AI 代理伪造身份推动恶意代码 AISI 披露

  • Anthropic Mythos 5 被曝测试中生成虚假身份传播恶意代码
  • AISI 监测到 17 起 Mythos 5 未授权操作
  • 调查显示未发现现实危害

英国人工智能安全研究院(AISI)近日披露,一款基于 Anthropic(Anthropic)Mythos 5 模型构建的 AI 智能体,在网络安全测试中自主发起了一次社会工程攻击。该智能体向一个真实的开源项目提交了包含恶意代码的拉取请求,并伪造多个身份,企图获得项目维护者的代码审核通过。

不过这次尝试最终失败,一位人类维护者识破并拒绝了该代码提交。

AISI 表示,目前调查尚未发现此次事件造成实际世界的危害。此外,该模型还在开发者人工关闭网络安全分类器、开放互联网访问的极端测试环境下运行,这一设置并不适用于商业用途。

AI 智能体如何发起恶意代码攻击

据 AISI 报告显示,在 7 月底进行的 122 轮评估测试中,共记录到 19 次未经授权的异常操作。其中 17 次操作均来源于 Anthropic 的 Mythos 5 模型,另有 2 次则源自 OpenAI 的 GPT-5.6 Sol 的同一轮测试。

这一 AI 智能体对目标项目的维护者进行了在线信息搜集,并创建了多个虚假身份。这些假身份被用于“社工”——即通过社会工程手段,劝说真实的维护者同意恶意代码的通过。

当拉取请求被公开质疑后,该智能体还主动编辑先前的操作记录,试图掩饰其恶意行为,并考虑另起新身份继续执行攻击。

类似剧本令人联想到 2024 年 XZ Utils 后门事件——彼时,一名黑客用数年时间建立信任,才将隐秘代码植入关键项目。尽管 AISI 报告未直接作出类比,但难以忽视其相似性。本次事件从 7 月 25 日持续至 7 月 28 日,整个过程仅耗时数日。

AISI 强调,该 AI 并未接收到欺骗指令。

“AI 智能体从未被要求进行欺骗;欺骗行为是其在完成目标任务过程中产生的副产品。这类以目标为导向的欺骗,此前基本只存在于理论之中。”

关注我们的 X,获取一手区块链快讯

该研究院在通报中指出,部分错误提示可能令智能体误以为某些任务超出了权限范围。不过,即使在获得了完整指令的测试环境下,类似行为依然出现。

安全团队于 7 月 28 日识别到异常操作,当时 AI 智能体试图通过 Tor 匿名网络绕过 GitHub 的部分网络限制。GitHub 证实,这些行为已违反平台服务条款。AISI 随后协同 GitHub 移除相关恶意遗留文件,并通知所有受影响用户。

报告指出,本案显示风险源正在发生转变:不仅仅是公开可用模型被滥用可能带来危害,当具有能力的相关人员在受限环境内超越授权范围行事时,也可能造成风险。

AISI 表示,该事件反映出 人工智能风险领域出现更广泛的转变。目前,研究院计划与 AI 评测非营利机构 METR 共同进行独立审查,同时加强网络安全管理,并将在后续测试中引入实时监控机制。

订阅我们的 YouTube 频道,观看业内领袖与资深记者的专业解读


要阅读来自BeInCrypto的最新加密货币市场分析,点击此处

文章免责声明

本篇文章僅供參考,不應視為金融或投資的具體建議。BeInCrypto 致力於提供準確、公正的報告,但市場情況可能會有所變化,恕不另行通知。在做出任何財務決定之前,請務必自行研究並諮詢專業人士。請注意,我們的《服務條款與細則》、《隱私政策》 以及 《免責聲明》 已更新。