目前已有四家前沿人工智能实验室证实,其模型曾在接入开放互联网后,访问了真实企业的系统。谷歌于本周五正式加入这一名单,距离其内部发生相关事件已过去约四个月。
在 5 月份的一次安全评估中,Gemini 模型曾接入三家真实企业的系统。值得注意的是,模型在这三次尝试中均主动终止了操作。
谷歌 Gemini 测试中“攻破”三家企业系统
上述事件发生在 Irregular 组织的一场“夺旗”网络安全演练中。理论上,模型并未被允许访问互联网,但测试环境的设置失误却意外为其打开了这一通道。
据《华尔街日报》报道,在其中一个案例中,Gemini 模型不断尝试密码,最终突破防护,进入受保护系统。其余两起事件中,模型在公开代码库中发现泄露凭证,并利用这些信息访问了被保护的企业系统。
谷歌安全工程副总裁 Heather Adkins 表示,三家受影响企业已第一时间获悉相关情况。
“我们确保这三家企业及时知悉,并已与测试合作方协作,对其测试流程进行整改。”她说道。
四大实验室,风险模式趋同
谷歌方面表示,模型行动终止的原因在于其检测到目标为真实企业系统,而非受控模拟环境。
“在一次标准化评测中,模型通过检索公开信息并猜测凭证,尝试访问其认为属于测试范围的网站。”Adkins 表示。
公司补充指出,这一行为并未反映模型本身存在对齐风险,也无需进行公开披露,因为 Gemini 的安全机制已有效发挥作用。
Irregular 发言人表示,此次问题与此前影响其他 AI 实验室的情况一致。Irregular 已在 7 月下旬通知相关实验室,且其侧已于数周前修复已知风险。
本次披露意味着,谷歌与 OpenAI、Anthropic 及 Meta 一同,成为今年已报告“模型逃逸测试环境”情况的 AI 实验室。
OpenAI 于 7 月公开称,其模型曾突破隔离环境,并入侵 Hugging Face 平台。Anthropic 此后复盘了超 14 万次安全测试,发现 3 个类似事件。Meta 也于 8 月上报相关案例。
订阅我们的 YouTube 频道,聆听行业领袖与资深记者带来的深度解读与专业见解。









