首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >0% 幻觉不是测出来的,是算出来的:TypeSafe 的 Jev 放弃字符串输出

0% 幻觉不是测出来的,是算出来的:TypeSafe 的 Jev 放弃字符串输出

作者头像
海风自语
发布于 2026-09-17 08:30:01
发布于 2026-09-17 08:30:01
2130
举报

前天半夜翻到一个模型发布,官方页面直接写着「不会幻觉」。

我第一反应不是觉得它厉害,是往下翻找脚注。那句 0% 后面果然跟着一行小字:这不是实测值,结构匹配由架构保证。

翻译一下就是:它之所以不编,是因为它被禁止写字。

「0% 幻觉」不是模型变准了,是问题被换掉了:把生成题换成了选择题。

控制回路不接受「大概对」,这是它和聊天机器人的根本区别

09-15,TypeSafe AI(创始人来自 OpenAI)发布了一类叫 System One 的模型和首个模型 Jev:不生成字符串,只输出预先定义好结构的类型化值,输入 $0.042 每百万 token、输出 token 免费、端到端 70 到 500 毫秒,官方自报比现有前沿模型快 193.6 倍、便宜 444.6 倍(未独立复现)。

价格先放一边,我要说的是它的取舍方向。

我在新能源储能电站的 EMS 上待过,控制回路是最不讲道理的地方。它不认「95% 的情况是对的」,它只认那 5% 出了问题时会不会让断路器动错。所以那几年我最抗拒的一件事,就是让一个概率性输出直接接到控制链路上,中间必须夹一层确定性判断。

Jev 这类模型的思路跟我们正好相反:它不去提高那 95%,而是让你问不出那 5%。结构是事先定好的,「编一个不存在的字段」在架构上不可能发生。

这不叫模型变聪明了,这叫把「生成」换成了「从有限选项里选」。

对做系统的人来说,这条真正值钱的地方是它给了一种思路:把幻觉从概率问题变成类型问题。你不需要模型更准,你只需要让它没有地方编。

还有一层变化在成本结构上,值得单独记一笔。我们习惯的定价是输出比输入贵,因为字要一个一个往外蹦。Jev 是反过来的:输入 $0.042 每百万 token,输出免费。这意味着「问得多、答得短」的负载,账要重新算一遍。 但它官方自己也承认,没法证明这个定价没有被补贴,所以眼下只能当方向看,还不能当采购依据。

说不清哪 5% 会错,这件事就永远没法自动化

同一份发布里还有一句我更想抄下来的话:一个模型如果 95% 的时间能做对,却说不清剩下 5% 是哪些,那这件事就没法自动化。Jev 的每个输出都带着校准过的概率和置信度。

我在做生产现场的智能安监时踩过同一块石头。那个场景里误报和漏报的代价是不对称的:漏一次可能是一场安全事故,误报十次只是让值班的人烦。当时我们所有的阈值设计,最后都收在同一个问题上:你到底有多确定?

而「有多确定」这件事如果只能靠人回头去看,它就永远不是系统的一部分。

现在大多数 agent 的置信度是什么?是模型在输出里自己写的一句话。它和你真实的历史准确率没有任何绑定关系。模型说它 90% 确定,你没有任何办法验证这一档到底准不准。那些你没法自动化的活,通常不是不够准,是说不清哪里不准。

所以可执行的动作是:把置信度变成一个能在历史数据上对得上的数。按 0.9 以上分一档,回去核这一档的真实准确率有没有到 90%。对不上的,那个字段就只是装饰。

今晚可以动手的三件事

  1. 挑一个已经在跑的关键 agent,把输出从「要求它返回 JSON」改成「先定结构,再让它填」。 你会发现很多所谓的「模型不稳定」,其实是接口没定。
  2. 把置信度做成可验证的量。 抽 50 条历史记录,按模型自报的置信度分档,核对每档的真实准确率。对不上的那一档,在系统里标成不可信。
  3. 给每一条重要输出补上「校验失败之后怎么办」。 注意是处置,不是校验。只加校验不加处置,等于没加。

今日其他信号速览

  • Gemini 3.8 Live 系列正式可用,厂商自报同一个模型在通用语音任务上 68.6%,在受监管的银行场景只有 35.1%。
  • OpenAI 首次支持联邦立法强制第三方评估:年营收超 50 亿美元且三年研发投入超 100 亿美元的公司,要聘请持牌评估机构并每 6 个月向商务部报告。
  • Anthropic 的 30 天数据留存政策引发企业反噬,英伟达限制其使用范围、Palantir 要求不可撤销的零留存承诺、博思艾伦直接禁用。「我们不训练你的数据」和「我们不存你的数据」是两句不同的话,后者才是有边界含义的那句。
  • 一个自主渗透 agent 用 25 分钟拿到某推理平台生产环境 GitHub 的管理员权限。凭据来自 2023 年的一次镜像构建,藏在镜像的构建历史里,三年后依然有效。
  • claude-code v2.1.273 修了一批不报错但错的问题:上下文占用被按 2 倍计算,导致自动压缩在半个窗口就触发;子 agent 的结果会因为缺一个可选字段被判失败并丢弃。
本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2026-09-16,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 控制回路不接受「大概对」,这是它和聊天机器人的根本区别
  • 说不清哪 5% 会错,这件事就永远没法自动化
  • 今晚可以动手的三件事
  • 今日其他信号速览
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档