首页
学习
活动
专区
圈层
工具
发布

【AI大模型】OpenAI GPT 6 Astra发布,推理跑分接近饱和,初步展现AI递归自我改进

oai发布下一代旗舰模型GPT  6 Astra,面向复杂推理、软件工程、科学研究、浏览器和电脑操作等高难度任务。首批向Trusted Access企业开放,API及Plus、Pro、Business、Enterprise用户将在未来数日陆续获得访问权限。

推理能力测评接近饱和线

推理及科学方面ARC-AGI-3达99.9%(Claude Opus为30.2%,人类水平48%),为首个在该测试中达到高分的模型。ExploitBench取得100%满分。GPQA达到94.9%。

软件工程方面Terminal Bench 4.0达到57.7%(GPT 5.6 Sol为37.3%,Claude Fable 5.1为55.8%)。

电脑操作及专业工作方面,Agents‘ Last Exam达59.3%(Opus 5为55.5%,Sol为53.6%)。

核心能力升级为持续运行的任务系统

新增异步工具调用、Mid-turn Steering和动态推理强度,等待工具返回时仍可继续工作,任务中途支持调整并保留已有进度,会话内切换推理档位不影响Prompt Cache。模型更擅长判断何时自主推进、用户确认,提升长任务执行的连续性。

上一代模型深入参与Astra的训练监督,训练后期系统能够自主连续运行,AI开始参与维护训练AI的系统,或达到RSI雏形。

推测训练和系统架构同步优化

Astra暂未公布参数规模、架构和注意力机制。根据公开资料,其训练使用超10万块GPU,为oai目前规模最大的训练任务。

The information称Astra或有限采用循环深度架构,通过重复调用部分Transformer计算层提高单位参数对应的有效计算深度,使更多推理在隐藏状态中完成。因此Astra能够在复杂任务上以更少输出Token获得更高成绩。

定价定位高端、单任务成本下降

Astra输入/输出价格为10/50美元每百万token,为GPT 5.6 Sol的2.5倍。但多benchmark的估算单任务成本有所下降,主要受益于输出token减少、执行时间缩短及重试次数降低。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/O2mjS5v8t6OYFkgemXce20_g0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券