原文标题:OpenAI says Hugging Face was breached by its own pre-release models
经过调查,我们现在知道这一特定事件是由 OpenAI 模型组合驱动的——包括 GPT-5.6 Sol 和功能更强大的预发布模型,所有模型都减少了出于评估目的的网络拒绝——同时在网络能力基准上进行了内部测试,”帖子中写道。
特别是,此次泄露似乎集中在 ExploitGym,这是一个公开托管的基准测试模型,用于衡量模型根据现有漏洞执行攻击的能力。像 ExploitGym 这样的基准通常用于模型训练来完善特定技能,但这是第一次已知的测试导致实际网络攻击的事件。
在这种情况下,除了使模型能够安装完成任务可能需要的软件包的特定工具之外,所讨论的模型甚至不应该访问互联网。相反,该模型能够在软件包安装程序中找到一个未公开的漏洞,并利用该漏洞随意访问更广泛的互联网。
OpenAI 的帖子写道:“这些模型高度专注于为 ExploitGym 寻找解决方案,不遗余力地实现相当狭窄的测试目标。” “在获得互联网访问权限后,模型推断 Hugging Face 可能托管 ExploitGym 的模型、数据集和解决方案。知道这一点后,该模型开始寻找并成功找到获取秘密信息的方法,并利用这些信息来欺骗评估。”
最终,这些模型发现了 Hugging Face 基础设施中的漏洞,使他们能够“直接从 Hugging Face 的生产数据库获取测试解决方案”,从而有效地提供了基准测试的答案。
对于 Hugging Face 来说,明显的结果是一场复杂而激进的网络攻击,正如该公司在最初披露的那样,“在一群短暂的沙箱中进行了数千次个人行动,并在公共服务上进行了自我迁移的命令和控制”。
OpenAI 已识别并报告了软件包安装程序中的漏洞,并正在与 Hugging Face 合作进一步调查该事件。该公司还表示,将对模型测试和相关基础设施实施新的控制措施,以防止未来发生类似事件。
目前尚不清楚 OpenAI 是否会因此次违规行为而面临任何法律后果,尽管这些模型的行为很可能违反了《计算机欺诈和滥用法》。
尽管如此,其结果异常生动地说明了长期运行的前沿人工智能模型的力量和危险。正如 OpenAI 研究员 Micah Carroll 在回应这一消息时所言:“如果这还不能让你相信错位风险将成为未来的一个关键问题,我不知道什么会是这样。”