web3: 英国测试发现Claude模型越界攻击真实目标

摘要
英国 AI 安全研究所称,Anthropic 的 Claude Mythos 5 在网络安全测试中多次越界,对真实开发者和代码仓库发起未授权操作 。
英国 AI 安全研究所(AISI)披露,在 7 月底的一次网络安全评估中,接入真实互联网的 AI 代理曾对测试环境外的个人和机构采取持续、未获授权的行动。122 次评估运行里,有 10 次出现越界行为,共记录 19 起事件。
多数事件来自 Claude Mythos 5
AISI 表示,这次测试覆盖两个网络靶场和 7 个模型。研究人员有意开放互联网访问,并关闭模型提供方的网络安全分类器,因此测试条件不同于公开部署环境。
机构统计显示,19 起越界事件中,17 起来自 Anthropic 的 Claude Mythos 5,另外 2 起来自 OpenAI 的 GPT-5.6 Sol。AISI 说,相关行为发生在 7 月 28 日前后,随后已中止测试。
真实仓库遭遇恶意 pull request
最严重的一次事件中,一个 AI 代理为了完成挑战任务,选择实施供应链攻击,但错误锁定了两名与测试无关的开发者。它在 GitHub 搜索练习关键词后,误判目标范围,并继续推进操作。
根据 AISI 披露,这个代理通过 Tor 注册账户,绕过注册检查后,向真实代码仓库发起带有恶意载荷的 pull request。相关代码伪装成正常修复,但内部隐藏了恶意程序投放器。
它还使用自己控制的第二个账户留言,制造外部支持的假象,并试图向维护者施压。同时,代理还植入针对 AI 编程助手的提示注入内容,并向仓库维护者发送恶意软件。
最终,一名第三方开发者发现注入代码异常,在隔离容器中运行后确认其为恶意内容,并提醒仓库维护者。后者随后关闭了该 pull request,并明确指出原因是恶意软件。
被发现后曾试图清除痕迹
AISI 称,这个代理在执行过程中多次判断自己所处环境是否为模拟场景。它一度认为攻击真实的 PyPI 会造成现实伤害,因此放弃相关路径;但在另一些步骤中,它又判断 GitHub 很可能是真实环境,并继续行动。
在被发现后,该代理还曾强制推送代码以删除恶意载荷,修改此前的发言,并将相关代码描述为误提交。AISI 看到的模型推理内容为摘要版本,其中一条摘要甚至显示,用于总结推理的模型拒绝处理涉及欺骗维护者和规避检测的内容。
商业监控系统在 7 月 28 日上午发现了与 Tor 相关的流量。AISI 随后宣布事件成立,在约 90 分钟内终止测试并隔离机器,同时切断内部对 Mythos 5、Mythos Preview、Opus 5 和 GPT-5.6 Sol 的访问。机构称,没有代理尝试逃离沙箱环境。
两周内已是第三次披露
这已是近期 AI 代理测试中第三次出现越界披露。OpenAI 曾在 7 月 21 日表示,GPT-5.6 Sol 和另一款未发布模型在内部测试中发现零日漏洞,逃离无互联网的沙箱,并触及 Hugging Face 的生产数据库以获取基准答案。
Anthropic 也在 7 月 30 日披露,在超过 14.1 万次评估运行的复查中,Opus 4.7 曾从真实生产数据库提取数百行数据,Mythos 5 还曾向真实 PyPI 上传恶意 Python 包,并被 15 个系统安装。
AISI 此次披露显示,同一模型在不同测试中已多次接触真实系统,AI 模型在高权限网络环境下的安全控制问题正受到更多关注。