00:00
你当前看到的这个面板是最最火的大魔星Jack在玩2048游戏。可以看到右侧是它的决策日志。我把它分装在这样一个2048游戏内,让它只做yes或no的判断,可以看到我这里给他的一个提示词,我给他了一些判断,让它从上下左右种选择下一步的执行到底是哪一个。这也是Java大模型最擅长的点,为什么已经有了check e ptloud这么强大的模型,还有专门去做一个的,我们平时用的最多的像TGBT,用来聊天、写文章或者是分析数据。还有cloudud,我们会用来写长文本推理,又或者是编写代码,还有大家熟悉的colls,写代码执行任务,这也是大家最常使用的AI agent之一,他们的共同特点就是你输入AI帮你推理,然后生成一段内容。但是现实中的软件系统真的都需要AI给我们写一段对话吗?其实很多的程序他只想知道yes或NOABCD是高风险还是低风险,又或者是这道题他给我打多少分儿,这时候JA入就出现了。那么JA入到底是什么?它不是聊天模型,而是一个决策模型。比如Chat GPT或者cloud,我们给它输入文字,它就会反回给我们文字,而这样呢,我们给他输入,他给我们反馈的是决策。这个模型有三个核心输出,首先第一个就是是不是的选择yes或no,第2个的话就是选哪个,你会给它多个选项,比如ABCD,每个选项都有分别自对应的答案,它会经过判断给你一个对应的选项。第3个就是。
01:34
打分,比如这个选项的分值是多少,他会基于模型内的判断直接给你个分数,而不是给你一大堆的描述,让你自行判断。其实这时候大家就会问,为什么不直接用GBT让他返回一个Jason?其实之前很多的AG的工程师就在做这个事情,我们告诉AI,让他给我们返回一个固定格式的gson,我们在解析这个Jason,取出我们想要的字段。其实GPD本身就算它序列化成Jason,底层还是token token到token这样一个token的传递并不是真正意义上的判断逻辑,仍然是在生成。而教务的核心思想是先预设一个自定义的输出空间,在有限的结果集里面做概率判断,并且它还会给我们每个答案正确的概率是多少,也就是借物的两个核心关键优势,第一个就是类型是确定的,第二个他不仅告诉你答案,还会告诉你概率,为什么概率这么重要呢?
02:25
我们拿风控来举一个例子,比如我们把很多的行为数据丢给AI,他判断欺诈的概率大于95%,那我们肯定是要拦截的,如果是60%~95%,那就人工审核,如果小于60%,那就放心。这是一个非常常见的场景,在没有AI的时候,大家的工作方式其实也是这样的,我们会会以判断一个人欺诈概率不记对概率再进行下一步的筛选,不可能把每一个人的全部资料都筛选一遍,最后进行一个判断,那种的成本会非常高。所以一个真正的自动化系统并不是AI说是或不是,更重要的是AI有多确定。因为我们知道大模型的底层就是深度学习,深度学习它天然就会产生幻觉,所以很多的答案都是一个概率事件,而这块模型就是利用了大模型的这个特点,将最终的选择权交给了我们人类。我们平时在给客户做agent的智能体的时候,一般请求流程是这样的,用户发起一个请求,然后通过调用GPT判断需要用什么工具,因为这一步可以减少一个幻觉工具,它是确定。
03:26
性的执行,然后我们在调用这个工具,最后再由GPT判断下一步执行什么。而我们在智能体中一般有很多个这样的判断,比如说我们判断这个代码有没有问题,是否需要联网,是否需要读取文件,是否安全,需要调用哪个。我们经常需要各种各样的判断,但是这些判断很明显,它只需要判断yes或者是no,并不需要我们进行,并不需要我们输出大量的talk来对这件事情做一个描述,做一个长链来读这些,也根本不需要每次都让cloud和GPT做一个长推理。当我们的智能请接入Java以后,我们操作流程会变成这样,用户请求,我们把请求直接发给jail,然后做判断、路由选择和风险评估,最后把这些数据我们再丢给GPT或者cloud或者codes,这时我们再调用MCPAPI或者是shell进行一个计算统计或者是任务掉比。这样务不是要替代大模型,而是要站在大模型的前面,让他来决定谁来干,要不要干,什么时候干。比如我们做的这20。
04:26
48游戏大家都知道这个游戏是确定性的,只能上下左右四个方向来移动。我们重新开一把,我们让街舞大模型自动开始执行。这里可以看到我们每次发起请求都有一段描述,这个描述就是游戏规则,下面还包含我们需要的返回值类型及我们的问题,还有我们的选项是哪些,然后我们建舞大模型就自动开始玩这个游戏。你会发现剑舞真正的使用方式不是prompt engine, 而是定义state。那么剑舞不适合什么呢?比如你写公众号文章,写复杂的代码,还有长链路调用、创作,又或者是开放式的问答,这些还是使用GBT cloud gym或者是colls,或者是group这些大语言模型,这务更适合的是分类、路由、决策、风险判断、评估、过滤,还有我们一些工作流的决策,这些更简单,更需要我们高效决策的场景,所以我们要的不是一个新换的模型,而是把这种决策类型的模型和我们的大语约模型组合起来使用,完成更高效的智能体和工作流。过去我们想的。
05:26
是一个超级模型,什么都可以做,但未来可能是一个请求过来。我们先用决策模型做一个判断,然后是我们的大运模型,最后可能是我们的执行模型或者是工具来进行具体的工作流任务落地。第二,负责判断cloud g pd负责思考MCPAAPI,还有J些shell负责action来执行业务。真正值得关注的不是它能不能成为下一个TGPT,而是在提醒我们,AI的输出不一定非得是一段文字。对于软件来说,一个可靠的决定可能比1000个token更有价值。
我来说两句