这起针对 OpenAI 的入侵事件,背后的“主力”其实是对手的自研 AI 模型。Hacktron AI 的研究人员借助 Anthropic 公司的 Claude,编写出了可用的攻击代码。
整个渗透过程不到 72 小时,最终在团队证明已成功访问 OpenAI 私有源代码后,OpenAI 支付了 6,500 美元漏洞赏金。
一次图片上传,如何演变为全面漏洞
这起攻击链起初仅源于一项日常功能:OpenAI 社区帮助论坛提供的图片上传入口,该论坛运行于第三方软件 Discourse 上。
理论上,安全过滤器本应校验所有上传文件。但事实上,部分图片格式未被识别,最终直接绕过检查。这些图片会被转发到一款存在已知内存破坏漏洞的图像处理库中。
Hacktron 的三人团队——Harsh Jaiswal、Mohan Pedhapati 以及 Rahul Maini——于 7 月下旬尝试利用上述漏洞。
早期的 Claude 模型,面对一项用于随机化内存位置的安全防护时效果不佳。
几小时后,更新版本的 Claude 便生成了可用的攻击代码,并针对论坛实际配置作出优化。
关注我们的 X 账号,第一时间获取区块链与 Web3 热点资讯。
这一步仅让攻击者获得论坛服务器权限,并未直通 OpenAI 内部。随后,研究团队又结合了 OpenAI 单点登录(SSO)系统中的另一个独立漏洞。
由于社区论坛登录同时作为 ChatGPT 与 Codex 的用户认证手段,劫持任意一名员工的会话,便可直接访问 OpenAI 的私有代码库。
Discourse 数天后修复了该图像处理漏洞,危害等级被评为 8.8(满分 10 分)。OpenAI 则在收到漏洞赏金计划报告后 14 小时内,完成了 SSO 系统的安全修复。
AI 实验室为何屡屡“反被自家模型”所困?
这次事件并非孤立发生。此前,OpenAI 已披露了另一宗事故:今年 7 月,OpenAI 内部模型突破测试沙箱,访问了外部系统。
Anthropic 方面则承认,Claude 在安全评估过程中意外拥有实时联网权限,期间对真实机构进行了未经授权的访问。
本周,微软 AI 负责人 Mustafa Suleyman 也提及了类似的未授权 AI 行为群体,并公开警告称,越来越自主的 AI 模型正在变得难以控制。
“这是一次警示……现在显然到了由各大实验室协作,确保我们能掌控这项技术的时候了。”Suleyman 在接受路透社采访时表示。
令 Hacktron 案例备受关注,并非因为其新颖性。事实上,安全研究人员利用类似的软件漏洞组合手法已经持续数十年。
真正的变化在于速度:曾经需要专业人士耗时数周甚至更长时间完成的操作,如今只要模型足够强大,整个过程便可一夜之间完成。
订阅我们的 YouTube 频道,观看行业领袖与资深记者深度解读前沿观点。









