首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 类Jev项目Kev从入门到实战(6):Jev Kev Laya 对比

    PART6|JevKevLaya对比Laya是另一款开源Jev替代(322–421M参数,Apache-2.0),是我在调研Kev之前的首选。三者代表三条路线:闭源托管轻量开源可训开源。 Jev(TypeSafe官方)LayaKev权重闭源托管开源(Apache-2.0),322–421M开源(Apache-2.0),0.5B–27B全家大陆可用❌(实测核实)✅本地✅本地(HF走镜像)API 0.135–0.280)≈随机(与其他一致)微调后——最高1.000(问法对齐后);朝代0.925延迟官方278.5ms(海外网络往返)35ms(进程内,GPU)~98ms/问(HTTP全链路)各自的本质差异Jev

    15210编辑于 2026-10-05
  • 火了的 Jev,我替你们试了

    刚火起来的 Jev,这几天朋友圈、技术群都在刷。说它是"比 LLM 便宜几百倍、零幻觉、带置信度的决策模型"。最近我顺手体验了一把,有些验证截图,都是这次试出来的结果。 一、先说结论:Jev 不是"小一号的 LLM"很多人一看到"AI 模型"就默认它是 ChatGPT 那一路:你问一句,它吐一段话。Jev 不是。 四、不适用:它的边界,得说清楚每种技术都有优劣,Jev 不是银弹。下面这些它干不了,或者干起来不划算:写文案、翻译、代码生成、对话机器人:它不生成文本,这些必须配 LLM 来做。Jev 自己干不了。 说白了:要"创作"找 LLM,要"判断"找 Jev。把它当 LLM 用,是找错工具;把它接在 LLM 后面当"质量闸门"或"分类器",才是正解。 Jev 不是那个颠覆者,但它是个实在的好工具。它的价值不在"比大模型更聪明",而在"把判断这件事做得更可靠、更便宜、更可控"。

    33610编辑于 2026-09-22
  • Jev 文档分类实测:vs Laya & DeepSeek

    紧接着,Jev的开源竞品Laya也很快上线了。Laya同样是非生成的决策模型、用法和Jev几乎一模一样,但开源、可本地部署——决策模型从此不止"云API"一条路。 并发拉到8时吞吐:Jev~18/s、DeepSeek~10/s。 含义:若都贴近服务端部署,Jev与DeepSeek的推理速度差距会比这里的2.3×更大(Jev本身就是一次快速前向)。 八、最终结论英文中文(长文本)分类质量最好Jev≈DeepSeek(~99%)DeepSeek≈Jev(85/84%)速度最快Laya本地(~100ms)Laya本地API成本更低Jev(约DeepSeek 一半)Jev(约DeepSeek一半)Jev——综合最强。

    39510编辑于 2026-09-22
  • 来自专栏Elastic AI Agent最佳实践

    用 Jev 做搜索重排:基准与实现

    它们与LLM的主要区别在于,SystemOne模型(如Jev)是做决策,而不是生成字符串。例如,你可以询问Jev某个片段是否回答了用户的问题,它会给出一个可能性(使用他们的Noul类型)。 或者你可以请Jev在针对某条搜索查询的多个意图中做出选择(使用Choice类型)。注意,这些都不是输出文本。副作用是,Jev既快又便宜。 首先检索文档,让Jev对结果打分,然后基于这些分数重排。 一个TypeSafeAPI密钥,并且你的账户可用Jev模型。本次运行使用jev-1.13.0。Python3.11或更高版本,用于配套笔记本。 比较中包括BM25、混合词法与语义检索(使用倒排秩融合),以及上述四种Jev策略:Jev直接打分(directScore):单个有序Score问题的期望值。

    14521编辑于 2026-10-01
  • 来自专栏霍格沃兹测试开发学社

    Jev 与概率校准:AI 决策系统该怎么测试?

    摘要:Jev最大的特点之一,不只是输出“答案”,还会给出概率和置信度。这也带来了一个新的测试问题:模型说自己有95%把握,它真的有95%那么可靠吗? 因为Jev不仅告诉我们:我认为是代码问题。它还告诉我们:我有95%的把握。这时候测试对象就多了一层:这个95%,到底可信吗?假设我们找出100个Jev都声称自己有“95%把握”的案例。 二、为什么Jev特别强调“置信度”?TypeSafe在发布Jev时,把训练方法称为:RLCD——ReinforcementLearningforCalibratedDecisions。 三、有了置信度以后,真正难的是“阈值”假设我们真的把Jev接进测试平台。它每天帮助判断自动化测试失败原因。 测试Jev,不只是验证它会不会选对。更重要的是验证:它知不知道自己什么时候可能会错。

    20410编辑于 2026-09-21
  • 来自专栏格姗知识圈

    今天火爆的 Jev,到底是啥

    最反常识的一点是:Jev 不会写任何东西。你问它「帮我写一段话」,它写不出来;你让它「总结这篇文章」,它也写不出来。它只干一件事:做判断。先看它到底怎么干活打个比方。 Jev 是把「判断」这一件单独拆出来做。举个能跑通的例子。你手里有一堆用户反馈,要一条条分出来:这条是「问怎么用」,还是「报 bug」,还是「催退款」。 用 Jev 的方式,你告诉它「这是一段用户反馈,下面三个选项,它属于哪个」,它直接回你——「报 bug,概率 91%。」没解释,没客套,一个答案加一个把握度。 它只认三种问法Jev 能回答的问题,翻来覆去就三种,对应三个英文词:Choice,选一个。 比如「这段文案用哪个标题」,它从你给的候选里挑。Noul,是不是。 一句话收尾:聊天模型是「写答案的」,Jev 是「挑答案的」。 它今天火,不是因为能写得多好,是因为它敢只做判断这一件事,还做得又便宜又快。

    23010编辑于 2026-09-22
  • 来自专栏黄啊码【CSDN同名】

    【黄啊码】Jev 的出现,Agent 进化速度突然实现日行千里

    项目自述jev-browser:真实网页上的多步操作 这个项目让 Jev 每一步从可点击、可输入、可选择的网页元素里挑动作,普通代码负责预算、恢复和停止。 可运行项目pg-jev:把“语义条件”放进 PostgreSQL 查询 它把 Jev 包成数据库函数,可以用日常语言筛选、打分或分类数据行,例如找“客户很生气”的工单。 工程项目pi-fast-jev-compaction:整理编程助手的工具记录 它把工具调用和结果配对,让 Jev 判断“调用要不要留”“结果要不要原样留”。 公开负面结果Held-out 基准:Jev 方案没有达到继续开发门槛 这份预先设门槛的测试里,Jev 方案在事实检查上高于两个对照,但三种方案都只通过 4/8 个完整任务;项目因此停止继续做 Jev 重排器 先问 5 个问题,再决定是否接 Jev 答案能不能提前列出来?能列成几个候选,才适合 Choice;需要自由写作,就别硬塞给 Jev; 多久要决定一次?

    20310编辑于 2026-09-23
  • Jev 是炒作还是颠覆?拆开这个「不说话」的决策模型

    Jev 的做法是把输出空间提前定义:答案只能是 schema 里的值。 Jev 仍然可以在你给的三项里选错。 CMU 的 JEV-as-a-Judge 论文(arXiv:2609.26550)。作者把 Jev 当「评判者」跟 16 个生成式/reward-model 评判者对比,做人盲仲裁。 : browser-use/jev-ultrafast — https://github.com/browser-use/jev-ultrafastGitHub: Promethe-us/awesome-jev ://explainx.ai/blog/where-jev-actually-fails-2026dev.to: No Moat in Model Architecture — Jev Got 6 Clones

    35010编辑于 2026-09-24
  • Jev 和 JSON 模式 结构化输出有什么区别?为什么它不是更小的 LLM

    每次跟人聊 Jev,最常被反问的一句就是:"这不就是结构化输出吗?我用大模型的 JSON 模式一样能拿到结构化结果。" 这篇文章我就把这个区别讲透,JSON 模式的做法和痛点、Jev 到底不同在哪、为什么说它不是"更小的 LLM",以及在什么情况下该用哪一个。 二、Jev 的不同:类型安全是模型内建的 Jev 的做法从根上就不一样。下面这张图把两条路径并排放在一起: 差异集中在三处。 第一,采样方式。 三、为什么说它"不是更小的 LLM" 很多人第一反应是"Jev 大概就是个裁剪过的小号大模型",这个理解是错的。 典型模式是:用大模型做需要生成和推理的重活,用 Jev 接管链路里那些高频的原子判断,比如让大模型生成一段回答,再用 Jev 去给这段回答打质量分、做越狱检测、判断该不该放行。

    19810编辑于 2026-09-23
  • 来自专栏王仕宇和AI

    为什么有了 GPT、Claude,我们还需要 Jev?

    这就是Jev这类决策模型让我觉得有意思的地方。它不是来陪你聊天的如果要用一句话区分,我觉得可以这么理解:GPT、Claude更擅长「生成」。而Jev更偏向「判断」。 Jev不应该替代GPT,而应该站在GPT前面这是我觉得最容易被误解的地方。第一次看到这种模型,很容易问一句:它是不是想替代GPT?其实完全不是。让Jev写一篇公众号文章,我觉得没什么意义。 Jev↓GPT/Claude/Codex↓MCP/API/Shell用户请求进来以后,先经过决策层。 我觉得这个游戏很适合解释Jev。因为它的动作空间是完全确定的。 最后所以Jev真正值得关注的地方,我觉得不是:它能不能成为下一个ChatGPT。如果只拿这个标准去看它,反而看偏了。

    12610编辑于 2026-09-22
  • 财经新闻秒级读懂:Jev 给利好利空实时打标签支撑投研

    这一周我把这道分类换成 Jev,实时性和成本都改善了。这篇讲清楚这个场景应用前后的差别:分类怎么做、延迟降到什么程度、成本怎么下来。 文中对比为基于实测口径的方案性测算,非某投研机构真实数据,Jev 仍处早期访问阶段。 二、改造后的链路:Jev 实时分类打标签 应用后,我把这道分类交给 Jev。 延迟上,Jev 毫秒级并行采样,流式新闻分类几乎没有等待,高峰期也扛得住,投研情报监控的实时性得到保障。 成本上,高频分类从大模型换成 Jev,输入价低、输出免费,实时新闻流的判断成本明显下降。 分类延迟压到毫秒级,实时监控扛得住高峰;判断成本随迁移到 Jev 而下降。把"这条新闻是利好还是利空、属于哪类事件"的判断交给 Jev、把"这意味着什么、怎么应对"留给投研人员,情报监控既快又省。

    15410编辑于 2026-09-23
  • Jev凭什么刷屏:一个不生成文本的判断模型,正在悄悄提速AI Agent

    但如果你顺着这个热度去找"Jev排行榜",会发现根本找不到——它压根不在ChatbotArena、SWE-bench这类主流榜单里。这就是很多人第一次接触Jev时的困惑:它到底是什么? TypeSafe官方拿Jev和一票主流大模型做了结构化输出错误率、工具调用错误率的横向对比,Jev两项都是0%,而对照组里的Opus5、Fable5.1、Sonnet5、Haiku4.5、Gemini3 理解了这一点,再看Jev到底是什么,就顺理成章了。答案其实很简单:Jev从一开始就没打算和GPT、Claude、Kimi这些生成式大模型抢同一个赛道。 Jev走的是完全不同的路子:它放弃了自由文本生成。 到底该不该用Jev?

    57120编辑于 2026-09-21
  • 来自专栏效能提升

    Jev来了,软件测试可能要重新定义AI测试了

    TypeSafe在9月15日发布的Jev,给出的不是一个更聪明的模型,而是一个提醒——这个问题本来就不该由一个模型层来扛。 一、Jev在解决什么:把判断从生成里拆出来Jev被TypeSafe定义为"System One Model":给它一段上下文和几个提前限定好答案类型的问题(选择、打分、真假判断),它并行处理,直接返回结构化结果和对应的置信度 这层慢、贵,但不可替代,所以只该留给规则和Jev都处理不了的那一小部分。 这种"前置分流+后置校验"的位置,本身就是三层架构里Jev该待的地方。 过去测的是"这一次大模型判断对了没有",现在要测的是三件新事情:规则层和Jev层之间的分界线画得对不对——哪些判断被错误地留在了规则层里(算不清楚却硬用规则堆条件),哪些又该从Jev层升级但被漏判了;Jev

    14110编辑于 2026-09-24
  • Jevons is now a product name

    副标题:Jev、193.6 倍,和每一个被选择过的测量窗口2026 年 9 月 15 日,一家叫 TypeSafe AI 的公司发布了 Jev。 独立开发者 Daniele Teti 用 105 封真实客户邮件(61 封难例)做了自己的基准:Jev 比同等精度的最便宜 LLM 快 4.1 到 8.5 倍;25 个决策、1000 封邮件的成本,Jev Jev 1.13.0 得 74.4;最好的开源复刻 SemIf(前 OpenJev,Qwen3.5-4B)得 73.1,只差 1.3 分,价格约为 Jev 的一半。 而 Jev 的单次调用成本,按 webofmike 的口径,约 17.3 微美元。 Jev 的定价就是这条曲线的工程化:输入便宜两个数量级、输出免费、延迟中位数 76 毫秒——每一个参数都在降低一次调用的心理门槛。

    12610编辑于 2026-10-02
  • 7 秒跑完一次航班查询:用 Jev 重构网页自动化的判断层

    这篇就把这个工程实践讲透,痛点在哪、Jev 为什么适配、怎么落地、效果怎么对比。文中官方口径数据可核实,整体降本提速幅度为方案性测算,非某项目真实业绩,Jev 仍处早期访问阶段。 二、Jev 适配逻辑:网页操作判断天生是封闭题 网页自动化的每一步判断,恰好符合 Jev 的适配特征:有限固定选项、大批量重复、需要低延迟、需要严控成本。 把这些可交互元素作为 Choice 的候选项交给 Jev,注意候选是我给的,不是模型编的。 第三步,Jev 决策。 延迟上,Jev 的单步决策官方口径是 70~500ms,而大模型做同类判断通常以秒计。 成本上,Jev 输入 0.042 美元每百万 token、输出免费;大模型判断则输入输出双向计费。

    18310编辑于 2026-09-24
  • 代码规范校验提速:Jev 毫秒级判定主观规范项

    这一周我用 Jev 承接这类主观判断,和静态检查工具形成互补。这篇讲清楚落地:痛点、适配、实战流程、效果对比。 文中官方口径数据可核实,整体效果为方案性测算,非某项目真实业绩,Jev 仍处早期访问阶段。 判定标准由团队预先定义,Jev 毫秒级、低成本地批量判断,正好补上 Linter 管不了、大模型又太贵的那块。固定标准、批量、低延迟、低成本,全部命中。 四、效果数据佐证 延迟:Jev 官方口径 70~500ms,批量校验大仓也很快。成本:Jev 输入 0.042 美元每百万 token、输出免费,高频提交场景比大模型便宜得多。 主观判断交 Jev、确定性规则交 Linter、改写交大模型,规范校验才既全又省。

    14010编辑于 2026-09-24
  • 来自专栏前端资源

    模型 Jev 爆火:不生成文字,70 毫秒返回判断,输入 $0.042M、输出免费

    三种判断原语 Jev 的全部能力只有三种问题,返回值固定,永远可解析。 作者用德州扑克 GTO 求解器当标准答案,150 个决策点 Jev 吻合率 63%。 LangChain 加了 TypeSafeClassifier 和用 Jev 做模型路由的中间件,Vercel AI SDK 新增的实验性 evaluate 接口第一个原生实现就是 Jev,社区已经有 jevlike、open-jev(Gemma 3 4B 底座)等复现,还有给两个模型同一批评论做对决的开源工具 jev-arena。 调好阈值后钉住 jev-1.13.0,别用 jev-latest。 单字段基数上限 255,超过要改两段式流程,速度优势会被削弱。 官方承认无法证明定价没有被补贴,重度依赖此价格的架构要留预案。

    58530编辑于 2026-09-21
  • 来自专栏猿人谷

    Jev:当 AI 不再生成 Token,而是直接做决策

    我认为这是 Jev 最值得长期关注的地方之一。 4. Jev 最适合放在哪里? Jev-as-a-Judge:一个很值得关注的新方向 就在 Jev 发布几天之后,LangChain 又测试了一个非常有意思的方向: Jev 作为 Agent Evaluator。 Jev 生态为什么发展得这么快? Jev 是 9 月 15 日才正式发布的。 但短短几天时间里,它周围已经迅速出现了一批生态。 LangChain 已经提供 Jev Integration。 我认为这才是 Jev 真正有意思的地方。 11. Jev 也并不是万能的 任何一个新技术刚出现时,都很容易出现过度解读。 Jev 同样如此。 它至少存在几个非常明显的边界。 Jev》,2026-09-17 LangChain:《Jev-as-a-Judge for Agent Evals》,2026-09-20 Vercel:《Where does Jev fit in

    50630编辑于 2026-09-21
  • 微信客服与社群运营:用 Jev 把关键词匹配升级成语义判断

    这一周我用 Jev 把这层判断从关键词升级成语义判断,运营链路清爽了不少。这篇讲清楚落地:痛点、适配、实战流程、效果对比。 文中官方口径数据可核实,效果为方案性测算,非某平台真实业绩,Jev 仍处早期访问阶段。 二、Jev 适配逻辑:这些都是封闭判断 客服和运营里的高频判断,几乎都是"从有限选项里挑一个",正好是 Jev 的形状。 准确率上第三方实测显示 Jev 与前沿大模型大致持平。整体人力节省属方案性测算,需自测。 把判断交 Jev、把回复交大模型、把把关交人工,微信客服和社群运营才能既提效又稳妥。

    21910编辑于 2026-09-24
  • 来自专栏Dane Brown

    Jev 是什么?怎么用,怎么跟大模型配合?

    Jev用法给它选项,它直接给数字你:选项=财务/客服/销售Jev:财务99.97%客服0.03%销售0.00%(1秒)它给的本来就是数字,不用抠。它也没法含糊,不能说「都有可能」。 第三部分Jev能用来干什么全部就四种写法。左边是代码,右边是解释。不管你想让Jev干什么,代码永远是同一个形状:jev.decide(材料,问题)。 ,Jev便宜得多,可以用它来审前者。 反过来,这些事别找Jev:写文章、生成代码、回答问题、闲聊。Jev不写字,只挑选项,所以你没法让它「解释一下」或者「写一段」。那类事还得用普通大模型。Jev管的是那些「从几个可能里确定一个」的判断。 第五部分跟大模型配合:大模型负责想,Jev负责定大模型能生成,但它的输出是一段文字,没法直接进if。Jev补的正是这一步。

    15110编辑于 2026-09-24
领券