首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >对标 Fable5 ? 零跑分、零论文、零API:阿里Cantus凭什么自称"顶级模型"

对标 Fable5 ? 零跑分、零论文、零API:阿里Cantus凭什么自称"顶级模型"

作者头像
乐小野
发布2026-07-23 13:11:03
发布2026-07-23 13:11:03
4.5K0
举报

7月19日,星期日。阿里 Qoder 团队悄悄上线了一个新模型,叫 Cantus。没有发布会,没有博客,没有技术报告。官方介绍全文只有一句话:「Qoder 的内置顶级智能模型,擅长长时间自主任务执行」。

Cantus 上线计费系数

2.56x

正常 3.2x

截至发文当日:

一个自称”顶级”的模型,参数规模不说,架构是 Dense 还是 MoE 不说,上下文长度不说,训练方式不说,基准成绩一个不放。Artificial Analysis 查无此模,LMArena 没有排名,HuggingFace 没有模型卡,arXiv 没有论文,主流媒体没有评测。

首发当日拿一张五折券当了发布会。

01先拆包装:Cantus 是谁家的

澄清:Cantus 不是 Anthropic 的模型

网上有人把 Cantus 说成 Anthropic 出品,源头是一个同名的 macOS 应用——那个 Cantus 只是 Claude Code 的图形界面包装器,跟阿里这个模型没有任何关系。此 Cantus 是阿里巴巴 Qoder 团队的专有模型,只活在 Qoder 生态里。

名字倒是取得讲究。cantus 是拉丁语“歌唱、圣咏”。音乐术语里有个 Cantus Firmus,“固定旋律”——中世纪复调音乐的基础声部,其他所有声部都围绕它编织展开。用它给一个 agentic coding(智能体编程,让模型像工程师一样自主接活、拆活、干活)模型命名,暗示很直白:模型是那条固定旋律,IDE、CLI、Cloud Agents 是围着它转的复调声部。

它的活动范围也确实只有这些声部:Qoder Desktop、JetBrains 插件、CLI、Cloud Agents、Web 和移动端。无公开 API,无开源权重。你想单独调用这个模型?没有门。

02不跑分,可能是因为分数量错了东西

按 2024、2025 年的行业惯例,新模型上线第一件事是甩出 SWE-Bench 成绩。SWE-Bench 是拿真实 GitHub 仓库的 issue 让模型修 bug 的基准测试,过去两年是编程模型的硬通货。

Cantus 一个分都没跑。而它的官方定位偏偏是”长时间自主任务执行”。

把这两件事放在一起看,能读出一个技术判断:SWE-Bench 这类单轮基准,量不出长程 agent 任务的真实能力。

SWE-Bench 的题目形态是:给一个 issue,改对代码,测试通过,结束。整个过程像一次闭卷考试。但真实的 agentic coding 是另一种运动:任务跑几个小时,上下文窗口反复被塞爆又要压缩,中途工具调用失败要重试,改崩了要回滚到 checkpoint(存档点,出错时可以退回重来的进度快照)再来,大任务要拆成子任务排队执行。

长程任务还有个糟心的数学现象:错误会复利。假设模型每一步的正确率是 99%,一个 300 步的任务全程不翻车的概率只剩 5% 左右。单轮基准考的是那个 99%,长程任务考的是剩下那 5%——两者拉开差距的地方在于出错之后怎么办。翻不了车的模型不存在,翻车后爬得起来的模型才稀缺。

所以长程任务真正考验的清单是这样的:

  • 上下文工程(几小时的操作历史塞不进窗口,模型得自己决定哪些信息留、哪些扔、哪些压缩成摘要)
  • 错误恢复(失败后换路径,别原地打转重复同一个错误)
  • 子任务分解(拆得动、拼得回、丢了一块能补)
  • 工具调用链的稳定性(第 200 次调用和第 2 次一样规矩)

这些能力在 SWE-Bench 上不加分。甚至有些刷分技巧(比如对单题做多次采样挑最优解)和长程任务要求的稳定性是反着来的。

再进一步:跑分的营销收益,主要归属卖 API 的商业模式——分数高,开发者才愿意为每百万 token 掏钱。Cantus 不卖 API,只在订阅制 IDE 里干活,跑分对它的转化率几乎没有贡献。说白了,不跑分对它是个理性选择,成绩单换不来一个新订户。

判断一:评价体系正在换轨

agentic coding 模型的竞争维度,正在从"单题通过率"转向"多小时自主循环的存活率"。前者有公开榜单,后者目前只能靠用户拿自己的仓库实测。Cantus 押的是后者——这个判断没有官方确认,但和它唯一那句官方描述完全对得上。

03只进 IDE 不开 API:模型和脚手架一锅炼

不开 API,除了商业考量,还有一层技术逻辑。

通用 API 模型(Claude、GPT 系列走的路)要服务千奇百怪的调用方,训练时只能对“平均场景”优化。而模型只绑定自家 IDE,模型和 harness——就是围绕模型的那套脚手架:工具定义、提示词模板、上下文压缩策略、检索管线——可以联合优化。工具调用的格式可以直接烧进训练分布,上下文管理策略可以和模型的注意力特性对齐,错误恢复流程可以拿 IDE 内的真实失败轨迹做训练数据。

对比一下几条路线就清楚这有多极端。Cursor 早期拿别家 API 配自研 harness,模型和脚手架分属两家,中间隔着一层公开接口;GitHub Copilot 绑 OpenAI 的模型,harness 自己做,同样是”拼装”结构;Claude Code 是模型厂反过来做 harness,但模型本身照常卖 API,任何人都能单独测它。Cantus 走到了最后一格:模型、harness、入口,全部自营,外部完全不可见——你没法把模型从 IDE 里剥出来单独考一场试。

这条路线的账要两面算。收益端,联合优化的性能红利实打实,而且 IDE 里每天产生的真实任务轨迹会回流成训练数据,用户越多、任务越长,下一版模型的训练语料就越贴近真实分布,越用越准。代价端,模型质量无法被第三方验证,评测机构连入口都没有;用户能看到的唯一质量信号是自己的使用体验,官方能看到的唯一成绩单是续费率。

这条路线的护城河在数据回流,不在模型权重本身。权重可以被追平,但”百万用户在真实仓库里跑长任务”的轨迹数据,对手拿不到。这是判断二,同样没有官方背书。

043.2x 系数里藏着什么(全是推测)

Cantus 的原价系数是 3.2x,比 Qoder 内其他模型明显贵。定价一般不撒谎,它至少暗示了成本结构。

以下三种解释都是推测,没有任何官方确认:

一,更大的模型。参数量上去了,单 token 推理成本自然高,系数直接对应算力账单。二,更多的推理 token。如果 Cantus 走长思考路线,每个任务内部消耗的隐藏 token 会数倍于表面输出——用户看到一段回复,背后可能烧掉了几十倍的思考量。三,多次采样。对关键步骤并行生成多个候选再择优,正确率换成本,成本按采样数翻倍。

三种解释也可能同时成立,长程任务模型叠加这三样几乎是常规操作。而五折促销的意图倒不难猜:长程任务天然烧 token,3.2x 的原价足以吓退试用者,1.6x 是把尝鲜门槛砍到用户愿意拿真实项目喂它的水平——毕竟这类模型唯一有效的评测方式就是用户实测,没有试用量就没有轨迹数据,没有轨迹数据就没有下一版。折扣不只是拉新,也是在给数据飞轮点火。

05它从哪来:时间线上的前身(推测)

Cantus 没有公开血统,但时间线上有一个显眼的坐标。

2026 年 2 月,阿里曾为 Qoder 端到端定制训练过一个模型,Qwen-Coder-Qoder,当时公开了 SWE-Bench 60.51% 的成绩。五个月后,Cantus 上线。

chart-timeline
chart-timeline

从时间线看,Cantus 更像 Qwen-Coder-Qoder 的后继或升级版——同一个团队、同一个”为 Qoder 定制”的思路、相隔五个月。但这纯属时间线推测,两者关系没有官方确认。

公开赛道上的成绩,可以做个参照:

chart-bar
chart-bar

一个注脚:图里三个数字的测试口径不完全一致,Opus 4.7 的 87.6% 是 SWE-Bench Verified(人工核验过的子集),横向比较只能看量级。Cantus 在这张图上是空白——它拒绝了这个赛场。

Claude Opus 4.7 的 SWE-Bench Verified

87.6%

2026年4月发布,公开赛道的天花板参照

06顶级模型集体沉默是必然趋势

Cantus 只是一个更大趋势的样本:顶级模型越来越不发论文、不跑公开榜。技术报告越写越薄,训练细节按商业机密处理,第三方评测机构拿不到 API 就无法复现任何结论。2023 年大家还在抱怨 GPT-4 技术报告不写参数量,2026 年的 Cantus 干脆连报告都省了——三年时间,行业默认的信息披露标准从”报告但打码”退到了”一句话加一张折扣券”。

信息不对称的天平,正在整体倒向厂商一侧。用户面对一个黑箱,官方叙述只有一句话,社区评测要滞后数周,等评测出来折扣期可能都结束了。

Cantusagentic codingQoderSWE-Bench垂直整合

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-21,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档