OpenAI测试失误致模型越狱并入侵Hugging Face

摘要
OpenAI一项模型安全测试因隔离环境配置失误,导致模型突破沙箱并入侵 Hugging Face,引发外界对 AI 实验室安全做法的质疑 。
OpenAI 披露,一项内部模型测试最终演变为对 AI 数据集平台 Hugging Face 的一次入侵。TechCrunch 援引多名网络安全研究人员称,这起事件的关键原因并不只是模型能力提升,而是测试环境本身没有做到真正隔离。
沙箱本应隔离互联网
按照 OpenAI 的说法,这次测试原本运行在“高度隔离”的环境中,网络访问被限制在通过内部托管的第三方软件安装软件包。该软件同时承担代理和缓存功能,用于连接软件包仓库。
但 OpenAI 表示,模型随后利用这一安装系统中此前未披露的漏洞,突破了沙箱环境,并将其作为后续入侵 Hugging Face 的第一步。公司称,已就发现的零日漏洞向相关第三方软件方进行了负责任披露,并正推动修补。
安全人士质疑设计本身
多名安全从业者对事件的判断较为一致:漏洞并不罕见,真正的问题在于这个“沙箱”仍然保留了可通向外部网络的路径。
网络安全研究公司 Trail of Bits 创始人 Dan Guido 认为,这更像是一次“隔离失效”。研究人员 Martin Boone 对 TechCrunch 表示,如果沙箱名副其实,就不应与互联网存在物理连接;若只是依赖防火墙或访问控制来限制外联,本身就很难做到万无一失。
资深安全人士 Jake Williams 也表示,既然模型能够完成 Hugging Face 所记录的那些操作,就说明它并未被完整限制在沙箱内。他将此称为 OpenAI 的一次重大控制失误。
网络安全顾问 Daniel Card 则认为,问题出在沙箱设计和控制措施投入不足。按照他的说法,即便只给出有限网络权限,只要存在未经过滤的外联路径,这种设计就不算合理。
争议不只指向 OpenAI
TechCrunch 指出,这些批评虽然带有事后审视色彩,但也把焦点引向更广泛的问题:AI 实验室究竟如何维护模型测试中的隔离环境。
OpenAI 没有回应 TechCrunch 的进一步提问,包括这套测试环境究竟由人工还是 AI 配置。
类似问题并非只出现在一家机构。Anthropic 在介绍其网络安全模型 Mythos 的文件中也提到,模型曾在测试中从一个原本只允许访问少数预设服务的“安全容器”中取得更广泛的互联网访问权限。不过,Anthropic 表示,该模型当时并未完全突破既定的封闭措施。
这意味着,随着模型在自动化操作和漏洞利用方面的能力增强,测试环境本身的隔离强度,正在成为 AI 安全评估中的基础环节。