00:00
不做画像教程,只要讲知识的自己。大家好,我是会学盖板你会唱歌的戴先生。今天咱们来聊一聊大模型工具调用与思维链的能力。进化时,大伙有没有注意到一个有意识的规律,每当大模型能力上升一个台阶,围绕它的A轮工程代码就会废掉一大片。又说大模型最重要的能力有哪些?我个人觉得非工具调用来的思维链不可,他们一开始就有吗?想多了,早期大模型就像个只会聊天的话痨,干不了实事。那当时怎么解决的?聪明的人类发明了prop engineering, 在提示于里做手脚,把这些人类外挂上去。先说工具调用,早期又让大模型调用工具,你得这么写,正常情况下模型会输出预期的响应,你得解析、提取字段写代码。
01:00
调用工具。接着整个过程被工程化了,比如LA trend的create structureed agent, 但大模型有时候会皮一下,在输出内容上画10添角,你看多这么一嘴就得解析到崩溃。工程师们又写各种异常处理代码解决这个问题,一点都不性感。后来呢,当需求积累到一定程度,训练师就开始训练大模型,让他直接学会工具调用能力。现在你只要告诉他有哪些工具,他就能直接输出有格式的调用指令。同样是查询北京天气,现在只需要很简单的提示语,模型会输出类似这样的格式。这是大模型的输出格式,不同大模型可能不同。这里演示的是GBTOSS大模型的输出格式,他知道什么时候该调用工具,该怎么调用,再也不用你执手。
02:00
手画脚了,再说说思维链。思维链就是让模型学会一步一步思考,早期也是靠外挂,当时流行react风格的提示语,你得教模型怎么思考,怎么行动,怎么观察这个提示语有多复杂,你得定义清楚short action observation的格式,还得告诉他什么时候该输出final answer完整的提示与示例。建议按一下暂停键,好好欣赏一番。第一轮请求后,大模型会返回这样的响应,接着你得解析工具返回的结果,提取action string和h string input字段,然后写代码,调用对应的工具,把结果补充到提示语里,继续给大模型。接下来大模型会返回以下响应,进行最终的回答,此次对话就以final answer结束了。后来大模型也学会了思维链。
03:00
能力,现在主流的深度思考模型都自带这个能力,你根本不用教他怎么思考,还是那句话,模型会输出思考内容,在输出工具调用指令蓝色部分就是思考内容,相当于之前的short,这是大模型自己输出的格式,这也不用你教它做事了。城市部分就是工具调用指令,相当于之前的action,你按照指示调用工具并返回结果后,把结果补充到提示与里,模型会自动进行最终回答。虽然还是要处理模型的输出格式,但最大的区别在于,原来定格式的是A软工程端,现在定格式的是大模型,大模型服务提供的API已经处理了解析工作,所以我们在A轮工程端就少了很多输入和输出的处理工作。这么看来,写A轮工程师。
04:00
越来越轻松了。表面上看确实如此,但大模型学会了思考和调用工具后,它就像一匹脱缰的野马,跑得飞快,但方向南控。所以A人工程的核心就变成了哈尼斯如何驾驭这匹野马,让他朝着正确的方向奔跑。总结一下,早期大模型的工具调用和思维链能力是通过prop engineering外挂上去的,工程师们又写大量的解析和异常处理代码。现在这些能力已经内置到了大模型里,你只需要告诉他有哪些工具,它就能自动思考,自动决定工具调用。这次的分享就到这里拜一拜。
我来说两句