前天半夜翻到一个模型发布,官方页面直接写着「不会幻觉」。
我第一反应不是觉得它厉害,是往下翻找脚注。那句 0% 后面果然跟着一行小字:这不是实测值,结构匹配由架构保证。
翻译一下就是:它之所以不编,是因为它被禁止写字。
「0% 幻觉」不是模型变准了,是问题被换掉了:把生成题换成了选择题。
09-15,TypeSafe AI(创始人来自 OpenAI)发布了一类叫 System One 的模型和首个模型 Jev:不生成字符串,只输出预先定义好结构的类型化值,输入 $0.042 每百万 token、输出 token 免费、端到端 70 到 500 毫秒,官方自报比现有前沿模型快 193.6 倍、便宜 444.6 倍(未独立复现)。
价格先放一边,我要说的是它的取舍方向。
我在新能源储能电站的 EMS 上待过,控制回路是最不讲道理的地方。它不认「95% 的情况是对的」,它只认那 5% 出了问题时会不会让断路器动错。所以那几年我最抗拒的一件事,就是让一个概率性输出直接接到控制链路上,中间必须夹一层确定性判断。
Jev 这类模型的思路跟我们正好相反:它不去提高那 95%,而是让你问不出那 5%。结构是事先定好的,「编一个不存在的字段」在架构上不可能发生。
这不叫模型变聪明了,这叫把「生成」换成了「从有限选项里选」。
对做系统的人来说,这条真正值钱的地方是它给了一种思路:把幻觉从概率问题变成类型问题。你不需要模型更准,你只需要让它没有地方编。
还有一层变化在成本结构上,值得单独记一笔。我们习惯的定价是输出比输入贵,因为字要一个一个往外蹦。Jev 是反过来的:输入 $0.042 每百万 token,输出免费。这意味着「问得多、答得短」的负载,账要重新算一遍。 但它官方自己也承认,没法证明这个定价没有被补贴,所以眼下只能当方向看,还不能当采购依据。
同一份发布里还有一句我更想抄下来的话:一个模型如果 95% 的时间能做对,却说不清剩下 5% 是哪些,那这件事就没法自动化。Jev 的每个输出都带着校准过的概率和置信度。
我在做生产现场的智能安监时踩过同一块石头。那个场景里误报和漏报的代价是不对称的:漏一次可能是一场安全事故,误报十次只是让值班的人烦。当时我们所有的阈值设计,最后都收在同一个问题上:你到底有多确定?
而「有多确定」这件事如果只能靠人回头去看,它就永远不是系统的一部分。
现在大多数 agent 的置信度是什么?是模型在输出里自己写的一句话。它和你真实的历史准确率没有任何绑定关系。模型说它 90% 确定,你没有任何办法验证这一档到底准不准。那些你没法自动化的活,通常不是不够准,是说不清哪里不准。
所以可执行的动作是:把置信度变成一个能在历史数据上对得上的数。按 0.9 以上分一档,回去核这一档的真实准确率有没有到 90%。对不上的,那个字段就只是装饰。