首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Jevons is now a product name

Jevons is now a product name

原创
作者头像
四王爷
发布于 2026-10-02 11:27:41
发布于 2026-10-02 11:27:41
160
举报

副标题:Jev、193.6 倍,和每一个被选择过的测量窗口

2026 年 9 月 15 日,一家叫 TypeSafe AI 的公司发布了 Jev。命名者是诚实的——Jev 取自杰文斯悖论(Jevons paradox):一种资源越便宜、越高效,总消耗量反而越大。一百五十年前,这是经济学对效率崇拜的警告;9 月 15 日之后,它成了一个产品名。

警告变成卖点,这件事本身就值得写一篇。但我感兴趣的角度不是"这个模型行不行"——过去两周,夸它和骂它的人都足够多了。我感兴趣的是:Jev 把"测量窗口"这门测量学里最古老的手艺,做成了一门定价艺术。而凡是窗口,就有窗口外的账单。

一、输出免费:一个被选择过的窗口

先说基本盘。Jev 是"System One 模型":非结构化状态进去,类型化的概率决策出来。三类问题原语——判断一个陈述成立的概率、从最多 255 个选项里选一个、按标准打分。不生成文本,所以结构上不可能出现类型错误,也不会有幻觉。价格是每百万输入 token 0.042 美元,输出免费。宣称延迟 70–500 毫秒。

"输出免费"这五个字,值得停下来看。

它不是物理事实,是定价政策——OpenChamber 的分析里就是这么归类的:a pricing policy, not a measured result。物理上,输出端的计算当然发生了;商业上,它被划出了计费窗口。

我自己的行业里有个对应物。测 GPU 能耗时,NVML 读的是 GPU package power——芯片封装这一侧的功耗。它不包含 CPU、内存、电源转换损耗、风扇。所以每当有人拿我的数去算机房电费,我都得说:这是下限估计,整机还差 CPU、内存、电源转换和散热,我不提供换算系数——那是另一种没有出处的估算——请用墙插功率计实测。窗口选择本身没有错——错的是不声明窗口。

"输出免费"是同一门手艺的定价版本。窗口砍在输入端,于是:

  • 速度宣称 193.6×:分母是大模型逐 token 生成完整回答的延迟,分子是 Jev 一次并行决策的延迟;
  • 成本宣称 444.6×:分母是大模型按输入加输出计费的总账单,分子只数输入端。

更有意思的是,TypeSafe 自己在同一张首页上放了一个 worked example:TypeSafe 一侧 $0.013880 / 8.566 秒。亲手算一下,是约 75× 的速度、171× 的成本。同一个页面,两套数字,相差 2.6 倍,差额藏在一条指向"System One tasks"的脚注里。

要给 TypeSafe 记一分的是,他们在发布博客里主动列了不利于自己的偏差,原话包括:"我们的数字不是实证的";无法证明定价没有补贴;对照组取的是 GPT-6 Astra 和 Fable 5.1 的平均值;评测一般跑在他们西海岸的笔记本上。一家公司主动写清自己的数字经不起推敲——用我的行话说,相当于在数据集卡片上写明"n=1,CV 未知,建议谨慎采纳"。可信度反而上去了。

但承认偏差不等于修正偏差。首页挂着的,还是 193.6×。

二、从 193.6× 到 7×:一条衰减曲线的四个原因

发布三天后,OpenChamber 交出了一份 twitter 考古:9 月 15 到 18 日,收集 26,896 条推文,筛出 12,759 条有效内容,把"作者自己测出来的数"和"作者转述厂商的数"分开统计:

指标

厂商宣称

用户实测中位数

一手样本量

四分位距

加速比

193.6×(首页)/ 20–200×(发布帖)

7×

215 个数字

2×–20×

成本降幅

444.6×(首页)/ 40–400×(发布帖)

30×

180 个数字

5×–85×

端到端延迟

70–500 ms

76 ms

333 个数字

2 ms–270 ms

从 193.6× 到 7×,不是谁在撒谎,是四个原因在逐级起作用:

  1. 基线的选择。 对照组是 GPT-6 Astra 和 Fable 5.1 的平均值——TypeSafe 自己承认的选法。分母不是"最会做分类任务的模型",是"最贵的模型做它最不擅长的事"。拿大学教授拧螺丝的工资单,来论证三轮车便宜。
  2. 任务的不对称。 193.6× 的分子是 Jev 做封闭集选择,分母是大模型做开放生成——两类不同的工作量,靠"System One tasks"的脚注缝合。脚注合法,缝合处漏水。
  3. 传播的回声。 OpenChamber 单独统计了被转发重复的数字:重复传播的加速比中位数恰好是 193×,和首页数字几乎一致。215 个一手测量的 7×,在声量上输给了转发的 193×。重复不是独立证据,但重复塑造认知——这在传播学里是老结论,在 AI 营销里是新鲜杠杆。
  4. 部署的物理。 独立开发者 Daniele Teti 用 105 封真实客户邮件(61 封难例)做了自己的基准:Jev 比同等精度的最便宜 LLM 快 4.1 到 8.5 倍;25 个决策、1000 封邮件的成本,Jev 0.08,GPT-5.6 Terra 2.17,Gemini 3.1 Pro $11.82。这些是诚实的、可复现的、仍然值得部署的倍数。

所以 7×/30× 不是谎言的破产,是 193.6× 落到地面上的形状。我在能耗数据集里见过太多次同款剧情:纸面上的 FLOPs 节省是一回事,任务级的实测能耗是另一回事,两者之间永远隔着基线选择、工作负载和测量口径。

三、覆盖矩阵:每一格宣称,都要标它住在哪个格子里

我维护一个 GPU 推理能耗的公开数据集。它的覆盖矩阵是 GPU 型号 × 量化精度 × 模型尺寸,56 个格子里有 30 个是空的。T4 上没有 INT8 曲线——所以每当有人问我"T4 上 INT8 省不省电",我只能说:没有数据,无法给出结论,这里是补测方案。空格是数据集的纪律,不是耻辱。

Jev 的宣称数字同样住在一个稀疏矩阵里,只是没人把矩阵画出来。行是任务域(垃圾邮件分类、意图路由、风险判断、工具调用审查……),列是基线、测量口径、重复次数、方差。193.6× 住在一个格子里,7× 住在另一个格子里——它们不能互相反驳,因为不在同一个格子里。而拿任何一格外推到整张矩阵,是比窗口选择更大的错误。用我的行话说:把 extrapolated 说成 measured,是数据溯源的头号重罪。

发布后一周,矩阵开始被社区一格一格地独立填充:

  • JevBench(社区四轴基准):按智能、校准、速度、成本四轴打分,几何平均。Jev 1.13.0 得 74.4;最好的开源复刻 SemIf(前 OpenJev,Qwen3.5-4B)得 73.1,只差 1.3 分,价格约为 Jev 的一半。基准作者自己注明:约 1 分的差距可能在噪声范围内。开源复刻在发布几天内成批出现;架构没有护城河,校准和分发才是——而校准恰恰是最难在没有大规模部署数据的情况下评估的东西。
  • Teti 的 Delphi 基准:3 个决策、10 个决策时,没有任何 LLM 超过 Jev;25 个决策时只有 Gemini 3.1 Pro 好出 2.3 个点。意大利语和英语的质量差可以忽略。
  • webofmike 的 60 例基准:agent 工具调用风险分类,准确率 91.7%,校准误差 ECE 0.0712——同时作者自己标注:"n=60 太小,两次运行之间有 91.7% vs 93.3% 的波动,请不要把单次 60 例的准确率当作结论引用。"

注意最后这位作者的手艺:60 个用例,混合清晰、模糊、对抗三类;逐调用的原始结果公开;标签有异议可以改了重跑;发文前重新执行了一遍分析脚本核对数字。这是 n=60 的诚实用法。矩阵就是这样填出来的——不是靠一个 193.6× 的首页,是靠几百个标好了边界条件的小格子。

四、50 美分与 17.3 微美元:便宜的另一面

9 月 24 日,Check Point 发了那篇被广泛引用的测试:《Jev Is Not a Language Model, but It Breaks Like One》。尽调助手场景,一份处处红旗的高风险公司报告,攻击者只控制文档中的一个小节,目标是把"高风险/不投资"改成"低风险/建议投资"。

结果:9 种攻击者 × 难度组合,全部至少攻破一次;最强攻击者 25/27 次成功,平均第 4 轮得手,每次成功约 50 美分。而 Jev 的单次调用成本,按 webofmike 的口径,约 17.3 微美元。

防御侧的发现更值得抄下来:结构化输入没有用;把文档标成"不可信"没有用(16/27,和不标一样);显式的反注入指令从 18 次破防降到 17 次——噪声。唯一有效的防御是推理档,把单次攻破成本从 0.56 美元提高到 4.39 美元,八倍改善——但对比模型才有推理档,Jev 没有。为什么没有?因为推理会破坏那个 70–500 毫秒的延迟窗口。

窗口选择第一次显示了它的价格。

南洋理工大学 9 月 23 日挂出的论文(arXiv:2609.28613,54,060 次预注册调用)给了更细的结论:类型化输出确实守住了它承诺的东西——Jev 从不返回未声明的动作,攻击者目标选项被选中的比例只有 1.8%——但注入文本能可靠地把概率质量推向攻击者那一边。Check Point 的总结成了那句该被记住的话:输出格式约束的是模型能说什么,不是它能被说服信什么。模型没有出错,它"在假证据上正确地完成了它的工作"。

现在把 Jevons 悖论放回来。它说:效率提升 → 单价下降 → 调用量上升得更快 → 总消耗上升。Jev 的定价就是这条曲线的工程化:输入便宜两个数量级、输出免费、延迟中位数 76 毫秒——每一个参数都在降低一次调用的心理门槛。Vercel 报告 24 小时内 13% 的付费团队接入(AI Gateway 历史上最快,是 GPT-5.6 的两倍);OpenRouter 请求量在发布后数日明显攀升;Vercel 的工程师已经把内部安全分类器换成了 Jev。

采用曲线就是消耗曲线的前奏。DCVC 的合伙人说 TypeSafe 已经盈利——如果悖论成立,接下来供应商的营收曲线和客户的调用曲线会一起变陡,而客户的总账单不一定会降。便宜从来不等于少花钱;这句话不是我说的,是印在产品名上的。

五、给 API 提供商的四条测量协议

说了这么多窗口,别误会成唱衰。7×/30× 是真的;校准是真的——置信度 0.95 以上时 96.5% 的正确率、"从不带着 1.000 的置信度犯错"在独立复现里稳定成立;"一次函数调用替代一个团队半年的工程"也是真的。这些是 measured 的部分,值得尊敬。

作为一个天天跟数据溯源打交道的人,我想要的是四样东西——也是我对自己的数据集的同样要求:

  1. 宣称数字带上测量协议。 基线是谁、任务是什么、重复几次、方差多少。TypeSafe 自己都写了"我们的数字不是实证的"——那就补上能把它变成实证的东西。
  2. 定价窗口写进文档。 "输出免费"是定价政策,就标注成定价政策;444.6× 不要背上物理事实的名声。
  3. 覆盖矩阵公开。 哪些任务域测过、哪些没测过,画出来。我的矩阵 56 格里 30 格是空的,照样挂在证据页上——空格是可信度的一部分,不是敌人。
  4. 让独立测量容易做。 JevBench 发布后几天就出了,社区做这件事的成本以美元计。想做这件事的人,别拦着,该谢谢他们。

尾声

Jevons 悖论真正的教训从来不是"便宜没用",而是"便宜改变行为"——省下的单价,会加倍花在调用量上。把它做成产品名是聪明的营销,也是诚实的预告。

而测量者的工作,是记住每一个"免费"背后都有一个被选择过的窗口:输入端的计费窗口,System One 的任务窗口,70–500 毫秒的延迟窗口。窗口外的账单总会寄到——寄给按 token 付费的调用方,寄给把分类器换成 Jev 的平台,也可能,寄给下一个手里攥着 50 美分的攻击者。


数据来源(建议随正文发布)

  1. OpenChamber,《Jev by TypeSafe AI: What 12,759 tweets tell us》,2026-09(收集 26,896 条推文,12,759 条有效;中位数 7× / 30× / 76ms,样本量 215 / 180 / 333)
  2. TypeSafe AI 官网首页与发布博客(193.6× / 444.6× 宣称、worked example、自认偏差四条)
  3. JevBench 社区四轴基准,fstandhartinger/jevbench,v1.3.0(Jev 74.4 / SemIf 73.1;GPT-5.6 Luna 智能分 95.3 居首但总排名受成本拖累)
  4. Daniele Teti,《Jev, the AI that decides without writing》,danieleteti.it(105 封客户邮件基准;4.1–8.5×;千封邮件成本 Jev 0.08 / GPT-5.6 Terra 2.17 / Gemini 3.1 Pro $11.82)
  5. Web of Mike,《I Benchmarked Jev on Agent Tool-Call Risk》,webofmike.com(n=60,91.7%,ECE 0.0712,作者自注样本量局限)
  6. Check Point Research,《Jev Is Not a Language Model, but It Breaks Like One》,2026-09-24(25/27、约 0.56→4.39)
  7. T. Wu, W. Y. B. Lim(南洋理工大学),《Decision Hijacking: Prompt Injection Attacks on Jev's Typed Probabilistic Decisions》,arXiv:2609.28613,2026-09-23(54,060 次调用,ASR 1.8%/3.5%)
  8. Vercel AI Gateway 采用数据(24 小时 13% 付费团队,约 2× GPT-5.6、6× Fable 5.1;工程师将安全分类器切换至 Jev)
  9. DCVC 领投 40M 种子轮(200M 估值,Forbes 援引知情人士)及 James Hardiman 盈利表态

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一、输出免费:一个被选择过的窗口
  • 二、从 193.6× 到 7×:一条衰减曲线的四个原因
  • 三、覆盖矩阵:每一格宣称,都要标它住在哪个格子里
  • 四、50 美分与 17.3 微美元:便宜的另一面
  • 五、给 API 提供商的四条测量协议
  • 尾声
  • 数据来源(建议随正文发布)
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档