SpaceXAI近日正式发布大型语言模型Grok 4.6。该公司表示,新模型在特定领域的表现已超越Anthropic的Claude Fable 5。
SpaceXAI前身为xAI,上月因被SpaceX收购而完成品牌重塑,并于今年6月在纳斯达克创下IPO纪录。此次Grok 4.6的推出,距离其上一代旗舰模型发布仅间隔一个月。
训练升级与流程优化
据SpaceXAI介绍,Grok 4.6的核心改进在于延长了训练周期,并利用人工智能生成的数据集强化推理能力,同时引入了高质量工程数据。在初始训练后,模型还经历了监督微调(SFT)和强化学习两个开发阶段。
SFT阶段利用示例提示和预打包答案优化输出格式,重点提升科学和编程任务的处理能力。值得注意的是,SpaceXAI使用前代模型Grok 4.5辅助优化了Grok 4.6的SFT训练流程。
基准测试与性能表现
在Artificial Analysis Intelligence Index评估中,Grok 4.6获得61分,与OpenAI的GPT-5.6 Sol持平,仅比Claude Fable 5低一分。此外,在另外九项基准测试中,Grok 4.6在三项上表现优于Claude Fable 5,其中包括评估复杂知识工作能力的AA-Briefcase,以及涵盖多个行业任务的测试。
SpaceXAI指出,Grok 4.6在根据高层描述生成软件原型、创建界面等视觉资产方面表现出色,且在处理长周期项目时具备更强的自我纠错能力。
定价与获取渠道
Grok 4.6标准版定价为每百万输入令牌2美元,输出令牌6美元;高速版价格翻倍。开发者可通过编程平台Cursor(SpaceXAI于今年6月以600亿美元收购)及内部工具Grok Build使用该模型。
【星途科讯 图文丨伊贝 首发于ZAKER科技,转载请注明出处】