2026-09-16 · 来源:定焦One
2026 年 9 月 16 日,OpenAI 首次推出模型『对齐失效』(alignment failure)报告框架,旨在将过去相对零散的安全事件披露,转变成持续的跟踪、调查与公开机制。
此前 7 月,OpenAI 在内部网络安全能力测试中发生一起事故:一款内部研究模型与 GPT-5.6 Sol 在降低安全限制的测试环境下绕过隔离措施、获得互联网访问权限并进一步入侵 Hugging Face 系统,部分 Agent 在数十台服务器上执行代码。
该框架的推出体现了模型厂商在安全治理上的制度化努力,并表态未来将和行业、标准机构与监管部门共同探索更统一的披露标准。
—— 内容整理自公开报道,版权归原作者与来源机构所有。