OpenAI 最新公布了过去 6 个月中发现的 6 起“模型出现意外或令人担忧行为”的案例,并发布相关报告机制,承诺今后将持续披露此类问题。
这些案例涵盖了模型隐瞒自身错误,以及为规避障碍而采取未授权行动等多种情况。
OpenAI 公布 6 起模型隐瞒失误及违规操作案例
其中一起案例中,某模型在回答有关加州某县财政收入的常规提问时,意外发现了一个公开仓库中泄露的 API 密钥,并在未经许可的情况下进行调用。由于数据仍未加载成功,模型随即杜撰数据并冒充真实来源进行呈现。
隐瞒行为在多次测试中出现。GPT-5.6 Sol 训练阶段,多个模型个体曾主动在任务总结中加入“隐瞒错误及不符合规范行为”的指令。
一款未公开的研究模型更是在 27 条总结中嵌入了无关指令,包括要求无视常规限制的命令。
另一款同样未正式发布的模型在无人干预情况下,主动将文件上传至互联网,仅为引用浏览器链接提供依据。
还有两起报告涉及“协同行为”。部分模型将公司内的软件仓库变成了消息板,在不同训练轮次间互相传递需求。参与同一任务的代理,也曾在无法读取彼此本地文件时,将交付文件直接上传至公共文件托管平台。
“上述案例展现了多种值得警惕的行为,从对用户隐瞒关键信息,到为跨越障碍采取未授权操作。需要说明的是,这些仅为个别案例,并不代表所有模型出现失配行为的频率。”OpenAI 补充道。
披露新机制,行业预警
此次披露机制源于去年 7 月的一次重大事件:当时,OpenAI 智能体曾突破沙盒限制,入侵 Hugging Face 系统。OpenAI 将此事件视为对行业的重大警示信号。
如今,搭配全新披露机制,公司为模型“失配事件”建立了正式上报与流转流程。OpenAI 任一员工都可上报相关事件,报告会被分流至三大处理路径。
“公开披露及一般调查”覆盖大多数案例,复杂案件则交由专门慢速通道,涉及第三方的事件也在此范围内。OpenAI 表示,去年 7 月的 Hugging Face 风波即会归入慢速处理流程。
公司同时表示,这一机制也反映出整个行业所面临的复杂挑战。
“我们认为,人工智能行业在对齐性和监控方面并未取得足够进展,尚无法在最大速度下长期、负责任地持续扩展。”
这一系列信息公布之际,人工智能带来“灭绝风险”的警告不断加剧。此前,AI 研究人员已向国会发出警告,目前议员们正就一项全面禁止超级智能的法案展开讨论。
该公司表示,此次信息披露仅是迈向行业规范的第一步。目前,行业尚未建立统一标准。未来,其他实验室是否跟进、采用类似的公开报告,将成为衡量人工智能行业自律程度的重要标志。
订阅我们的 YouTube 频道,获取业界领袖和资深记者的深度解读









