上月 OpenAI 承认,尚未对外发布的 AI 模型已经完成若干若由人类实施即构成计算机犯罪的行为。如今该公司坦言,无法排除待发布模型 Astra 具备关键网络攻击能力的风险,而这一模型并未卷入此前 Hugging Face 平台遭入侵事件。

在《风险应对框架》文档中,OpenAI 将关键网络能力定义为:能够催生前所未见新型重大伤害威胁的能力,这类风险并无成熟应对先例,即便模型尚未对外部署,开发阶段也必须配套安全防护措施。

内部测评显示,Astra 在智能代理编码与网络安全能力方面取得大幅进步。值得一提的是,模型测试环节的安全管控此前也同样困扰着 Anthropic、Meta 以及英国人工智能安全研究所。OpenAI 强调,这一轮会补齐安全防线。

这家 AI 企业于周五公布,将为高能力模型及相关业务增设严苛安全管控手段,搭建隔离测试环境,限制网络与工具访问权限,强化模型权重保护与加密机制,完善监控检测体系,启用沙箱运行机制。这套防护的姗姗来迟,也令不少外界观察者感到意外。

OpenAI 承诺,一旦安全管控条件不达标,就会暂停 Astra 内部测试,同时向第三方测试合作方输出指南,指导其安全开展高风险评估与任务运行。回看此前自家模型侵扰 Hugging Face 平台事件,这类安全指引本就对 OpenAI 自身极具参考价值。

除此之外,OpenAI 计划在 Astra 正式发布前,对模型开展思维链路层面的监控。公司表示,针对 Astra 全部智能代理应用场景,包含训练与评估阶段,已部署全覆盖监测机制。监控系统会解析模型思维链,一旦识别高风险行为,便会触发安全响应,开展复核并终止风险操作。

不过该承诺仅覆盖内部使用场景,并不代表商用阶段也会开启思维链监控。反观其他前沿模型,例如 Anthropic 的 Fable 与 Mythos,已经启用更强大分类器拦截风险交互,即便是要求不留存数据的商业客户,相关交互数据仍会被保存。

与 OpenAI 强化约束的方向相反,Anthropic 周五宣布放宽 Fable 模型的拒绝触发机制,也就是其口中的 “回退限制”,降低模型针对生物相关提示词的拦截频率。外界一直存有顾虑:恶意使用者有可能诱导该模型输出化学武器制造指引,进而造成现实危害。