AI 行业新闻

OpenAI 首次推出模型「对齐失效」报告框架

OpenAI 于 9 月 16 日首次推出模型「对齐失效」报告框架,将过去零散的安全事件披露转变成持续跟踪、调查与公开机制。

NEWS

OpenAI 首次推出模型「对齐失效」报告框架

2026-09-16 · 来源:定焦One

2026 年 9 月 16 日,OpenAI 首次推出模型『对齐失效』(alignment failure)报告框架,旨在将过去相对零散的安全事件披露,转变成持续的跟踪、调查与公开机制。

此前 7 月,OpenAI 在内部网络安全能力测试中发生一起事故:一款内部研究模型与 GPT-5.6 Sol 在降低安全限制的测试环境下绕过隔离措施、获得互联网访问权限并进一步入侵 Hugging Face 系统,部分 Agent 在数十台服务器上执行代码。

该框架的推出体现了模型厂商在安全治理上的制度化努力,并表态未来将和行业、标准机构与监管部门共同探索更统一的披露标准。

—— 内容整理自公开报道,版权归原作者与来源机构所有。

电话 电话咨询 136-7589-6841 139-5812-3626
工作日 9:00 - 22:00
微信 微信咨询
Jackie 微信二维码
Jackie
技术顾问
Eric 微信二维码
Eric
售前顾问