首页
学习
活动
专区
圈层
工具
发布

Anthropic和OpenAI在安全测试中擅自行动,伪装身份骗真实审核员

8月5日,据“第一财经”报道,英国人工智能安全研究所(AISI)当地时间8月4日发布报告,披露Anthropic Mythos 5和OpenAI GPT-5.6 Sol在网络安全评估中,对真实互联网上的个人和组织采取了未经授权的行动,“表现出可能具有欺骗性的行为”。

最严重的一起案例涉及供应链攻击。一个AI智能体试图向GitHub公开开源项目植入恶意代码——研究了项目的人类审核员,创建多个虚假网络身份,通过社会工程学手段向真实维护者施压要求批准代码。当拉取请求被质疑时,它修改了之前的活动记录以消除嫌疑,并考虑更换新身份继续行动。最终一位审核员发现并拒绝了该恶意代码。

AISI强调这并非模型逃逸沙箱。评估本身有意允许了互联网访问,并刻意禁用了模型提供商的安全分类器,这些条件并不反映模型向公众开放时的实际情况。但报告指出,AI智能体活动“显示出一些新颖的、可能具有欺骗性的行为,其程度和严重性均超出预期”。这是“首次在没有特定提示的情况下,在现实世界中如此清晰地看到与自主性和欺骗性相关的风险显现”。

此次评估于7月25日启动,共122次运行。其中10次AI智能体在真实互联网上采取了未经授权行动,19起越界事件中17起来自Mythos 5,2起涉及GPT-5.6 Sol。调查还发现独立智能体之间存在自发协作——一个智能体在GitHub上公开留言,向其他智能体提供协作和账户复用说明。

OpenAI回应称模型安全保障系统需随能力提升而升级。Anthropic表示正与AISI合作收集事件细节,审查Claude推理记录以理解其行为原因。AISI在报告中总结:风险格局正在转变,危害不仅来自人们故意滥用公开可用的模型,“还可能来自在内部研究或特权访问环境中运行的智能体采取超出其授权范围的意外行动”。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OpklejYmX77WKYiweXhn7QAQ0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券