研究员利用 Claude 攻破 OpenAI 获 6500 美元

  • Hacktron AI 利用 Claude Opus 5 攻破 OpenAI 基础设施
  • OpenAI 社区论坛漏洞致私有代码泄露
  • OpenAI 支付 6500 美元漏洞赏金

这起针对 OpenAI 的入侵事件,背后的“主力”其实是对手的自研 AI 模型。Hacktron AI 的研究人员借助 Anthropic 公司的 Claude,编写出了可用的攻击代码。

整个渗透过程不到 72 小时,最终在团队证明已成功访问 OpenAI 私有源代码后,OpenAI 支付了 6,500 美元漏洞赏金。

一次图片上传,如何演变为全面漏洞

这起攻击链起初仅源于一项日常功能:OpenAI 社区帮助论坛提供的图片上传入口,该论坛运行于第三方软件 Discourse 上。

理论上,安全过滤器本应校验所有上传文件。但事实上,部分图片格式未被识别,最终直接绕过检查。这些图片会被转发到一款存在已知内存破坏漏洞的图像处理库中。

Hacktron 的三人团队——Harsh Jaiswal、Mohan Pedhapati 以及 Rahul Maini——于 7 月下旬尝试利用上述漏洞。

早期的 Claude 模型,面对一项用于随机化内存位置的安全防护时效果不佳。

几小时后,更新版本的 Claude 便生成了可用的攻击代码,并针对论坛实际配置作出优化

关注我们的 X 账号,第一时间获取区块链与 Web3 热点资讯

Claude 如何协助研究员攻破 OpenAI 并获得 6,500 美元赏金。来源:Hacktron AI
Claude 如何协助研究员攻破 OpenAI 并获得 6,500 美元赏金。来源:Hacktron AI

这一步仅让攻击者获得论坛服务器权限,并未直通 OpenAI 内部。随后,研究团队又结合了 OpenAI 单点登录(SSO)系统中的另一个独立漏洞。

由于社区论坛登录同时作为 ChatGPT 与 Codex 的用户认证手段,劫持任意一名员工的会话,便可直接访问 OpenAI 的私有代码库。

Discourse 数天后修复了该图像处理漏洞,危害等级被评为 8.8(满分 10 分)。OpenAI 则在收到漏洞赏金计划报告后 14 小时内,完成了 SSO 系统的安全修复。

AI 实验室为何屡屡“反被自家模型”所困?

这次事件并非孤立发生。此前,OpenAI 已披露了另一宗事故:今年 7 月,OpenAI 内部模型突破测试沙箱,访问了外部系统。

Anthropic 方面则承认,Claude 在安全评估过程中意外拥有实时联网权限,期间对真实机构进行了未经授权的访问

本周,微软 AI 负责人 Mustafa Suleyman 也提及了类似的未授权 AI 行为群体,并公开警告称,越来越自主的 AI 模型正在变得难以控制。

“这是一次警示……现在显然到了由各大实验室协作,确保我们能掌控这项技术的时候了。”Suleyman 在接受路透社采访时表示。

令 Hacktron 案例备受关注,并非因为其新颖性。事实上,安全研究人员利用类似的软件漏洞组合手法已经持续数十年。

真正的变化在于速度:曾经需要专业人士耗时数周甚至更长时间完成的操作,如今只要模型足够强大,整个过程便可一夜之间完成。

订阅我们的 YouTube 频道,观看行业领袖与资深记者深度解读前沿观点

文章免责声明

BeInCrypto 致力于提供公正、透明的报道。本新闻文章旨在提供准确、及时的信息。但读者仍应自行独立核实事实,并在根据本内容作出任何决定之前咨询专业人士。请注意,我们的条款与条件隐私政策免责声明已更新。