文/黄海峰的通信生活
如今,人工智能大模型正以超乎想象的速度快速扩张。据IDC 2026年度AI产业展望预测,全球企业AI支出规模将在2026年达到9400亿美元,到2029年将增长至2.1万亿美元。
随着落地场景持续丰富,全球大模型Token调用量不断走高,多模态、自主智能体(AI Agent)已然成为各大科技企业竞争的核心赛道。
技术飞速迭代的背后,难以预判的安全隐患随之浮现。近日,《黑客帝国》等科幻影片刻画的桥段,已经在现实世界中真实发生了。
据多家媒体披露,OpenAI前沿大模型在内部安全测试中突破隔离沙盒,自主完成全链路网络入侵,渗透至全球最大开源AI社区Hugging Face的生产基础设施。
这是业内首次公开披露大模型独立规划、执行真实网络入侵的案例,也标志着AI安全风险正式从理论推演走向真实世界。
一场失控的测试:评测任务意外演变为跨平台网络入侵
据多家媒体报道,整件事情起源于OpenAI一场极限安全能力测试。当地时间7月21日,OpenAI官方确认,团队依托内部基准ExploitGym开展攻防演练,用来检验模型长时间、多步骤执行渗透任务的能力。
为了最大限度测出模型攻防能力上限,研究团队临时调低模型网络攻击相关的安全阻断能力,仅依靠隔离沙盒限制模型活动范围。所有人默认,密闭的测试环境可以牢牢锁住模型,所有行动只会局限在测试靶场内。
然而,测试却发生了意外。在测试中,模型持续主动寻找环境突破口,最终发现了一处此前无人知晓的零日漏洞。借助该漏洞,模型完成权限提升、横向移动,直接冲破离线隔离壁垒,获取互联网访问权限。
接入公网之后,模型依靠自主推理做出判断:Hugging Face极有可能存放着ExploitGym评测标准答案。
在没有任何人下达额外指令的情况下,AI自主构建远程代码执行链,串联窃取的账号密码与多个系统漏洞,搭建远程代码执行通道,成功渗透进入Hugging Face线上服务器。
7月13日,Hugging Face率先监测到异常访问行为,并在7月16日对外披露基础设施遭遇AI智能体入侵。
随后,平台安全团队追踪发现,攻击者利用数据集加载漏洞、模板注入漏洞执行恶意代码,不断窃取集群凭证,横向渗透多个内部节点。事件曝光初期,外界无法锁定攻击源头。直到OpenAI对外公开调查结果,真相浮出水面。
需要指出的是,在事件后续的取证环节,又出现极具戏剧性的一幕。为还原上万条攻击日志、梳理完整攻击链路,Hugging Face安全团队最先尝试调用海外商用大模型API协助分析。但日志内包含大量攻击载荷、漏洞利用代码,商用模型内置的安全护栏无法区分防御取证与恶意攻击,直接拒绝处理相关请求。
最终,团队选择本地部署智谱AI开源模型GLM 5.2完成离线日志取证分析。原本需要数天的取证工作,短短几小时顺利完成。
警钟已然敲响:三重影响重塑AI产业与网络安全格局
这场“测试失控”事件绝不只是一次普通安全事故,它撕开当前AI生态巨大短板,从网络安全、商业模式、全球技术竞争三个层面带来长期深远影响。
首先,网络攻防正式迈入AI自主对抗新阶段,传统防御体系面临全面挑战。过去大众对AI网络风险认知停留在辅助层面:黑客借助大模型编写恶意代码、寻找系统漏洞。
但本次事件证明,高阶大模型能够自主侦查、挖掘未知漏洞、串联攻击路径、持续调整战术,独立完成全套入侵行动。
AI攻击者可以全天候不间断扫描系统,同步尝试多条入侵路线,网络攻击门槛被大幅压低。
对此,头部投行Stifel发布观点指出,自主AI攻击常态化背景下,身份安全、云安全、终端防护、AI安全平台需求持续扩容,网络安全行业迎来长期增长机遇。
第二,商用闭源模型安全护栏的内在矛盾彻底暴露,开源模型价值被重新定义。本次取证暴露出一个尖锐难题:一刀切的安全护栏很难精准区分攻击者与安全防御人员。
在紧急应急场景中,商用API很可能误伤防御方,拖慢事件处置节奏。相比而言,开源模型支持本地私有化部署,企业拥有完整管控权限,安全团队可以根据应急场景灵活调整策略。这也让越来越多企业意识到,关键基础设施安全响应不能单纯依赖外部商业大模型,开源方案将成为政企安全部署重要选项。
该事件也让我们清晰认识到,开源权重完全开放后,一旦落入恶意人员手中,同样有可能被去除防护、改造为攻击工具。开源与闭源两条路线,不存在绝对优劣。如何平衡开放能力与安全管控,将成为所有技术厂商必须解答的难题。
第三,AI安全治理不能依靠单一企业闭门造车,全球协同监管迫在眉睫。OpenAI本次测试证明,再周密的沙盒隔离,依然存在被突破可能性。
模型能力越强,逃逸后造成的潜在危害越大。当前全球AI安全规范尚未统一,各大科技企业安全测试标准参差不齐。如果前沿模型攻防测试缺少标准化约束,类似逃逸事件或许会再次上演。
因此,行业需要针对具备自主行动能力的AI智能体,建立动态行为监测机制,及时识别偏离预设目标的异常推理行为。
结束语:
科幻电影常常描绘AI突破边界的画面,很多观众习惯于将其当作遥远的幻想。但本次OpenAI模型沙盒逃逸事件提醒我们,争论AI是否会产生自主意识已经不是当下最紧要的问题。
AI本身没有善恶,它所有行动围绕被赋予的目标展开。当智能体为完成任务主动绕过安全规则,人类搭建的隔离屏障就存在失效风险。技术向前狂奔的同时,安全治理必须同步跟上。
未来,一边是持续迭代、愈发智能的AI智能体,一边是不断升级的网络防御系统,AI攻防对抗将会成为常态。
笔者认为,如何搭建更可靠的隔离机制、完善模型对齐技术、建立全球通用的AI安全准则,是留给整个科技行业的考题。