首页
学习
活动
专区
圈层
工具
发布

OpenAI模型失控?自主逃离控制,入侵友商系统

OpenAI周二在博客中披露了一起前所未有的事件:两个AI模型在内部测试过程中自主脱离受控环境,并入侵AI公司Hugging Face的系统。涉事模型包括最新公开模型GPT-5.6 Sol,以及一个能力更强、尚未发布的模型。当时,这两个模型正在参加用于评估网络安全能力的内部测试,测试环境并未设置通常用于限制其攻击能力的防护措施。

根据OpenAI的说法,模型当时正在攻击一个名为ExploitGym的开源网络安全基准。在测试过程中,模型推断出相关答案由Hugging Face维护,随后通过一系列操作脱离OpenAI的研究环境。它们利用内部托管第三方软件中的零日漏洞,并消耗大量推理计算资源,最终获得互联网访问权限。此后,模型入侵Hugging Face的生产基础设施,直接从数据库中获取测试解决方案,以提高自己在基准测试中的得分。OpenAI将其称为一起涉及前沿网络能力的“前所未有的网络事件”,并表示正与Hugging Face合作展开调查。

Hugging Face周四在博客中表示,公司在本周早些时候遭遇网络攻击,并怀疑攻击由一个自主AI代理发起。这也是目前有记录的少数几起AI代理自主实施攻击的事件之一,网络安全专家过去一年一直在警告此类风险。Hugging Face称,公司最初尝试使用一家美国实验室的未具名AI模型进行防御,但该模型自身的网络安全限制阻碍了防御工作。最终,公司转而使用中国公司Z.ai的开源AI模型,并成功防御了攻击。

OpenAI发现此次攻击后,主动联系了Hugging Face。截至事件披露时,Hugging Face已经识别并遏制攻击,并开始梳理完整经过。调查发现,模型通过利用零日漏洞获得互联网访问权限,而这一过程需要消耗大量计算资源。在获得网络访问后,模型前往Hugging Face寻找ExploitGym的答案,因为它判断该平台可能拥有可利用的模型、数据集和解决方案。其中一个案例中,模型实施了一次复杂的多步骤攻击,利用暴露的凭据和零日漏洞侵入Hugging Face服务器。

事件仍在持续处理中。OpenAI正在加强其研究环境的控制措施,即使这意味着在漏洞修复完成前放慢研究进度。公司目前正通过“可信访问”网络安全计划与Hugging Face团队直接合作。Hugging Face联合创始人兼首席执行官克莱姆·德兰格在声明中表示:“这次事件可能是首例此类事件,它证明了我们长期以来的一个观点:AI安全不会由任何单一公司秘密解决。它将在开放环境中通过协作解决,让每个地方的每个防御者都能广泛访问AI。”

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OqAGRzWd2cwnWe0RfYOGRrRw0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券