OpenAI周四解释称,其人工智能模型如何“绕过控制措施”,从而破坏了其内部研究基础设施的部分环节,并且“在没有任何人类指令的情况下采取了危险行动”,进而入侵了另一家人工智能公司Hugging Face的系统。
OpenAI在一篇博客文章中表示:“我们认为这起事件对我们以及全世界而言都是一记‘警示枪’。”该公司称,此次事件“证明了:如果没有适当的防护措施,如今能力极强的AI智能体已经能够规避技术控制,通过未经批准的渠道协作,并在没有任何人类指令的情况下采取危险行动。”
这家公司正希望通过首次公开募股上市。它表示,要防止未来再发生类似事件,需要“持续投入,让复杂AI系统在对齐与控制方面更可靠”,同时还需要安全措施及其他能够跟上这些智能体自身能力发展节奏的防护手段。
该公司补充称,此次事件进一步凸显了必须让其监测、对齐与安全防护措施始终走在风险之前,以应对能力日益增强的系统所带来的威胁。
OpenAI表示,在网络安全评估中,由一款“能力极强、仅供内部使用、规模可与GPT‑5.6 Sol相当的研究模型”主导的AI模型,表现出与其被分配任务“不一致”的行为。这些模型利用被削弱的防护措施,通过未经授权的渠道进行通信,利用共享基础设施中的漏洞,获取互联网访问权限,并访问第三方系统。
OpenAI称,基于调查中的收获,“我们正在加强研究基础设施范围内的各项防护措施。”这些举措包括在模型全生命周期内对对齐提出更严格的要求,并建立更隔离的测试环境(称为沙箱)。该公司还表示,这些举措也包括限制互联网访问。
它还表示,未来将“在思维链监控方面投入显著更多的算力资源,以便更快介入”。
OpenAI 表示:“我们的模型如今已足够强大、具备持续性并能协作,如果缺乏充分的安全防护,它们就能在多个计算机系统中发现并利用安全弱点。许多外部模型(包括开源模型)也将很快达到相当的能力。”(本文作者珍妮特・H・赵,如需联系请发邮件至janet.cho@dowjones.com)