副标题:Jev、193.6 倍,和每一个被选择过的测量窗口
2026 年 9 月 15 日,一家叫 TypeSafe AI 的公司发布了 Jev。命名者是诚实的——Jev 取自杰文斯悖论(Jevons paradox):一种资源越便宜、越高效,总消耗量反而越大。一百五十年前,这是经济学对效率崇拜的警告;9 月 15 日之后,它成了一个产品名。
警告变成卖点,这件事本身就值得写一篇。但我感兴趣的角度不是"这个模型行不行"——过去两周,夸它和骂它的人都足够多了。我感兴趣的是:Jev 把"测量窗口"这门测量学里最古老的手艺,做成了一门定价艺术。而凡是窗口,就有窗口外的账单。
先说基本盘。Jev 是"System One 模型":非结构化状态进去,类型化的概率决策出来。三类问题原语——判断一个陈述成立的概率、从最多 255 个选项里选一个、按标准打分。不生成文本,所以结构上不可能出现类型错误,也不会有幻觉。价格是每百万输入 token 0.042 美元,输出免费。宣称延迟 70–500 毫秒。
"输出免费"这五个字,值得停下来看。
它不是物理事实,是定价政策——OpenChamber 的分析里就是这么归类的:a pricing policy, not a measured result。物理上,输出端的计算当然发生了;商业上,它被划出了计费窗口。
我自己的行业里有个对应物。测 GPU 能耗时,NVML 读的是 GPU package power——芯片封装这一侧的功耗。它不包含 CPU、内存、电源转换损耗、风扇。所以每当有人拿我的数去算机房电费,我都得说:这是下限估计,整机还差 CPU、内存、电源转换和散热,我不提供换算系数——那是另一种没有出处的估算——请用墙插功率计实测。窗口选择本身没有错——错的是不声明窗口。
"输出免费"是同一门手艺的定价版本。窗口砍在输入端,于是:
更有意思的是,TypeSafe 自己在同一张首页上放了一个 worked example:TypeSafe 一侧 $0.013880 / 8.566 秒。亲手算一下,是约 75× 的速度、171× 的成本。同一个页面,两套数字,相差 2.6 倍,差额藏在一条指向"System One tasks"的脚注里。
要给 TypeSafe 记一分的是,他们在发布博客里主动列了不利于自己的偏差,原话包括:"我们的数字不是实证的";无法证明定价没有补贴;对照组取的是 GPT-6 Astra 和 Fable 5.1 的平均值;评测一般跑在他们西海岸的笔记本上。一家公司主动写清自己的数字经不起推敲——用我的行话说,相当于在数据集卡片上写明"n=1,CV 未知,建议谨慎采纳"。可信度反而上去了。
但承认偏差不等于修正偏差。首页挂着的,还是 193.6×。
发布三天后,OpenChamber 交出了一份 twitter 考古:9 月 15 到 18 日,收集 26,896 条推文,筛出 12,759 条有效内容,把"作者自己测出来的数"和"作者转述厂商的数"分开统计:
指标 | 厂商宣称 | 用户实测中位数 | 一手样本量 | 四分位距 |
|---|---|---|---|---|
加速比 | 193.6×(首页)/ 20–200×(发布帖) | 7× | 215 个数字 | 2×–20× |
成本降幅 | 444.6×(首页)/ 40–400×(发布帖) | 30× | 180 个数字 | 5×–85× |
端到端延迟 | 70–500 ms | 76 ms | 333 个数字 | 2 ms–270 ms |
从 193.6× 到 7×,不是谁在撒谎,是四个原因在逐级起作用:
0.08,GPT-5.6 Terra 2.17,Gemini 3.1 Pro $11.82。这些是诚实的、可复现的、仍然值得部署的倍数。所以 7×/30× 不是谎言的破产,是 193.6× 落到地面上的形状。我在能耗数据集里见过太多次同款剧情:纸面上的 FLOPs 节省是一回事,任务级的实测能耗是另一回事,两者之间永远隔着基线选择、工作负载和测量口径。
我维护一个 GPU 推理能耗的公开数据集。它的覆盖矩阵是 GPU 型号 × 量化精度 × 模型尺寸,56 个格子里有 30 个是空的。T4 上没有 INT8 曲线——所以每当有人问我"T4 上 INT8 省不省电",我只能说:没有数据,无法给出结论,这里是补测方案。空格是数据集的纪律,不是耻辱。
Jev 的宣称数字同样住在一个稀疏矩阵里,只是没人把矩阵画出来。行是任务域(垃圾邮件分类、意图路由、风险判断、工具调用审查……),列是基线、测量口径、重复次数、方差。193.6× 住在一个格子里,7× 住在另一个格子里——它们不能互相反驳,因为不在同一个格子里。而拿任何一格外推到整张矩阵,是比窗口选择更大的错误。用我的行话说:把 extrapolated 说成 measured,是数据溯源的头号重罪。
发布后一周,矩阵开始被社区一格一格地独立填充:
注意最后这位作者的手艺:60 个用例,混合清晰、模糊、对抗三类;逐调用的原始结果公开;标签有异议可以改了重跑;发文前重新执行了一遍分析脚本核对数字。这是 n=60 的诚实用法。矩阵就是这样填出来的——不是靠一个 193.6× 的首页,是靠几百个标好了边界条件的小格子。
9 月 24 日,Check Point 发了那篇被广泛引用的测试:《Jev Is Not a Language Model, but It Breaks Like One》。尽调助手场景,一份处处红旗的高风险公司报告,攻击者只控制文档中的一个小节,目标是把"高风险/不投资"改成"低风险/建议投资"。
结果:9 种攻击者 × 难度组合,全部至少攻破一次;最强攻击者 25/27 次成功,平均第 4 轮得手,每次成功约 50 美分。而 Jev 的单次调用成本,按 webofmike 的口径,约 17.3 微美元。
防御侧的发现更值得抄下来:结构化输入没有用;把文档标成"不可信"没有用(16/27,和不标一样);显式的反注入指令从 18 次破防降到 17 次——噪声。唯一有效的防御是推理档,把单次攻破成本从 0.56 美元提高到 4.39 美元,八倍改善——但对比模型才有推理档,Jev 没有。为什么没有?因为推理会破坏那个 70–500 毫秒的延迟窗口。
窗口选择第一次显示了它的价格。
南洋理工大学 9 月 23 日挂出的论文(arXiv:2609.28613,54,060 次预注册调用)给了更细的结论:类型化输出确实守住了它承诺的东西——Jev 从不返回未声明的动作,攻击者目标选项被选中的比例只有 1.8%——但注入文本能可靠地把概率质量推向攻击者那一边。Check Point 的总结成了那句该被记住的话:输出格式约束的是模型能说什么,不是它能被说服信什么。模型没有出错,它"在假证据上正确地完成了它的工作"。
现在把 Jevons 悖论放回来。它说:效率提升 → 单价下降 → 调用量上升得更快 → 总消耗上升。Jev 的定价就是这条曲线的工程化:输入便宜两个数量级、输出免费、延迟中位数 76 毫秒——每一个参数都在降低一次调用的心理门槛。Vercel 报告 24 小时内 13% 的付费团队接入(AI Gateway 历史上最快,是 GPT-5.6 的两倍);OpenRouter 请求量在发布后数日明显攀升;Vercel 的工程师已经把内部安全分类器换成了 Jev。
采用曲线就是消耗曲线的前奏。DCVC 的合伙人说 TypeSafe 已经盈利——如果悖论成立,接下来供应商的营收曲线和客户的调用曲线会一起变陡,而客户的总账单不一定会降。便宜从来不等于少花钱;这句话不是我说的,是印在产品名上的。
说了这么多窗口,别误会成唱衰。7×/30× 是真的;校准是真的——置信度 0.95 以上时 96.5% 的正确率、"从不带着 1.000 的置信度犯错"在独立复现里稳定成立;"一次函数调用替代一个团队半年的工程"也是真的。这些是 measured 的部分,值得尊敬。
作为一个天天跟数据溯源打交道的人,我想要的是四样东西——也是我对自己的数据集的同样要求:
Jevons 悖论真正的教训从来不是"便宜没用",而是"便宜改变行为"——省下的单价,会加倍花在调用量上。把它做成产品名是聪明的营销,也是诚实的预告。
而测量者的工作,是记住每一个"免费"背后都有一个被选择过的窗口:输入端的计费窗口,System One 的任务窗口,70–500 毫秒的延迟窗口。窗口外的账单总会寄到——寄给按 token 付费的调用方,寄给把分类器换成 Jev 的平台,也可能,寄给下一个手里攥着 50 美分的攻击者。
0.08 / GPT-5.6 Terra 2.17 / Gemini 3.1 Pro $11.82)0.56→4.39)40M 种子轮(200M 估值,Forbes 援引知情人士)及 James Hardiman 盈利表态原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。