首页
学习
活动
专区
圈层
工具
发布

刚刚,Fable 5.1 来了,这是一个防蒸馏模型

刚刚,Anthropic 发布了 Fable 5.1。

话不多说,直接看数据:

Fable 5.1 benchmark 数据

七项 benchmark,七项第一,非常凶残!

Agentic 科研

01

Terminal-Bench-Science 0.1 上,Fable 5.1 拿到了52.6%

作为参考,Fable 5 是 24.7%,Opus 5 是 29.0%,GPT-5.6 Sol 是 22.4%。

Fable 5.1 比自家的上一代翻了一倍之多,比 Opus 5 高出近一倍,是 GPT-5.6 Sol 的两倍以上。

差距大到,有点不像是同一代产品了……不叫 Fable 6 是担心又被拦着不让用吗?!

Agentic 编程

02

Terminal-Bench 4.0 上,Fable 5.1 拿到了55.8%,搭配 Mythos 5.1 则可以到 60.9%。

Opus 5 是 52.3%,GPT-5.6 Sol 只有 37.3%。

CursorBench 3.2.0 上同样也是第一,73.4%

而 Fable 5 和 Opus 5 都在 70% 出头,GPT-5.6 Sol 是 67.2%。

知识工作与推理

03

知识工作(GDPval-AA v2)上,Fable 5.1 拿到了1853分,Opus 5 紧随其后 1824,Fable 5 是 1723,GPT-5.6 Sol 垫底 1711。

Humanity's Last Exam 上,无工具60.9%,有工具65.0%,两项也都是最高。

Computer Use

04

OSWorld 2.0 上,partial 得分77.9%,strict 得分41.7%,也都是两项最高。

Opus 5 分别是 75.4% 和 39.6%,Fable 5 是 72.9% 和 36.1%。

业务流程自动化

05

AutomationBench 上,Fable 5.1 拿到了31.4%

这个数字看着不高,但第二名 Opus 5 呢?26.9%。Fable 5 只有 17.1%。

Fable 5.1 几乎是 Fable 5 的两倍,GPT-5.6 Sol 的 19.6% 则还不到它的三分之二。

业务流程自动化这项,也是各家模型普遍得分不高的领域,31.4% 算是断层领先了。

Preserved Thinking

06

除了 benchmark 之外,Fable 5.1 还有一个重要的变化:Preserved Thinking,也就是对 thinking block 的防蒸馏保护。

之前有一种公开的蒸馏手法是:在多轮对话中,修改 thinking block 之前的系统提示词、工具和消息,让 Claude 把加密的推理过程解密并打印出来。拿着这些推理数据去训练其他模型,就能在不经授权的情况下复制 Claude 的能力。

Fable 5.1 的做法上,API 会校验 thinking block 是否在原始上下文中返回。如果系统提示词、工具或之前的消息被改动了,请求就会直接报错。

开发者也可以选择 non-strict 模式,这种情况下不会报错,但被修改上下文的 thinking block 会被丢弃,缺点是模型看不到之前的推理过程。

目前这项限制只针对 2026 年 8 月 31 日之后新创建的 API 账号。老账号暂时不受影响(给你留了迁移时间),但 Anthropic 表示,未来的模型会全面执行。

Claude Code、Claude Cowork、claude.ai 的用户则完全不受影响。

价格上,维持不变:

好了,蹬起来吧!

蹬起来吧

◇ ◆ ◇

Anthropic 官方博客:https://www.anthropic.com/research/fable-5-1

Preserved Thinking 文档:https://platform.claude.com/docs/en/build-with-claude/preserved-thinking

Fable 5.1 迁移指南:https://platform.claude.com/docs/en/models/fable-5-1/migration-guide

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OPD8G6DrIhlA7BTt71DBXP4g0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券