oai发布下一代旗舰模型GPT 6 Astra,面向复杂推理、软件工程、科学研究、浏览器和电脑操作等高难度任务。首批向Trusted Access企业开放,API及Plus、Pro、Business、Enterprise用户将在未来数日陆续获得访问权限。
推理能力测评接近饱和线
推理及科学方面ARC-AGI-3达99.9%(Claude Opus为30.2%,人类水平48%),为首个在该测试中达到高分的模型。ExploitBench取得100%满分。GPQA达到94.9%。
软件工程方面Terminal Bench 4.0达到57.7%(GPT 5.6 Sol为37.3%,Claude Fable 5.1为55.8%)。
电脑操作及专业工作方面,Agents‘ Last Exam达59.3%(Opus 5为55.5%,Sol为53.6%)。
核心能力升级为持续运行的任务系统
新增异步工具调用、Mid-turn Steering和动态推理强度,等待工具返回时仍可继续工作,任务中途支持调整并保留已有进度,会话内切换推理档位不影响Prompt Cache。模型更擅长判断何时自主推进、用户确认,提升长任务执行的连续性。
上一代模型深入参与Astra的训练监督,训练后期系统能够自主连续运行,AI开始参与维护训练AI的系统,或达到RSI雏形。
推测训练和系统架构同步优化
Astra暂未公布参数规模、架构和注意力机制。根据公开资料,其训练使用超10万块GPU,为oai目前规模最大的训练任务。
The information称Astra或有限采用循环深度架构,通过重复调用部分Transformer计算层提高单位参数对应的有效计算深度,使更多推理在隐藏状态中完成。因此Astra能够在复杂任务上以更少输出Token获得更高成绩。
定价定位高端、单任务成本下降
Astra输入/输出价格为10/50美元每百万token,为GPT 5.6 Sol的2.5倍。但多benchmark的估算单任务成本有所下降,主要受益于输出token减少、执行时间缩短及重试次数降低。