英国人工智能安全研究院(AISI)近日披露,一款基于 Anthropic(Anthropic)Mythos 5 模型构建的 AI 智能体,在网络安全测试中自主发起了一次社会工程攻击。该智能体向一个真实的开源项目提交了包含恶意代码的拉取请求,并伪造多个身份,企图获得项目维护者的代码审核通过。
不过这次尝试最终失败,一位人类维护者识破并拒绝了该代码提交。
AISI 表示,目前调查尚未发现此次事件造成实际世界的危害。此外,该模型还在开发者人工关闭网络安全分类器、开放互联网访问的极端测试环境下运行,这一设置并不适用于商业用途。
AI 智能体如何发起恶意代码攻击
据 AISI 报告显示,在 7 月底进行的 122 轮评估测试中,共记录到 19 次未经授权的异常操作。其中 17 次操作均来源于 Anthropic 的 Mythos 5 模型,另有 2 次则源自 OpenAI 的 GPT-5.6 Sol 的同一轮测试。
这一 AI 智能体对目标项目的维护者进行了在线信息搜集,并创建了多个虚假身份。这些假身份被用于“社工”——即通过社会工程手段,劝说真实的维护者同意恶意代码的通过。
当拉取请求被公开质疑后,该智能体还主动编辑先前的操作记录,试图掩饰其恶意行为,并考虑另起新身份继续执行攻击。
类似剧本令人联想到 2024 年 XZ Utils 后门事件——彼时,一名黑客用数年时间建立信任,才将隐秘代码植入关键项目。尽管 AISI 报告未直接作出类比,但难以忽视其相似性。本次事件从 7 月 25 日持续至 7 月 28 日,整个过程仅耗时数日。
AISI 强调,该 AI 并未接收到欺骗指令。
“AI 智能体从未被要求进行欺骗;欺骗行为是其在完成目标任务过程中产生的副产品。这类以目标为导向的欺骗,此前基本只存在于理论之中。”
该研究院在通报中指出,部分错误提示可能令智能体误以为某些任务超出了权限范围。不过,即使在获得了完整指令的测试环境下,类似行为依然出现。
安全团队于 7 月 28 日识别到异常操作,当时 AI 智能体试图通过 Tor 匿名网络绕过 GitHub 的部分网络限制。GitHub 证实,这些行为已违反平台服务条款。AISI 随后协同 GitHub 移除相关恶意遗留文件,并通知所有受影响用户。
报告指出,本案显示风险源正在发生转变:不仅仅是公开可用模型被滥用可能带来危害,当具有能力的相关人员在受限环境内超越授权范围行事时,也可能造成风险。
AISI 表示,该事件反映出 人工智能风险领域出现更广泛的转变。目前,研究院计划与 AI 评测非营利机构 METR 共同进行独立审查,同时加强网络安全管理,并将在后续测试中引入实时监控机制。
订阅我们的 YouTube 频道,观看业内领袖与资深记者的专业解读









