太久没写东西攒了不少货,总结成两块写出来:
- 把 Harness 的实现想象成开一家旋转寿司店,围绕大模型搭好 loop 旋转轨道是最简单的一步,店能不能开下去要看你做的寿司能不能抓住你顾客的胃
- 分享一个评价 Harness 的四级成熟度模型,Harness 本身的定义就有点耍无赖:「除了基模之外的所有,都叫 Harness」,解决了定义问题你就可以拿我们这套四级成熟度模型去重新审视一下你熟悉的、感兴趣的 Harness 们了。
去年十一的时候,我们的判断说每个行业都需要拥有自己的 CC,最终写到了第二篇,没有最终结尾,主因当然是因为懒,其次也有 OpenClaw 灯塔式的搅局,OpenClaw 给广大的 C 端用户敞开了 Agent 的大门,但完全不顾及 B 端用户会被带偏,大半年过去了,是时候回到 Manus 模式,带着 OpenClaw 的灯塔般的新鲜体验回到严谨认真的 B 端场景。口号重新喊出来:「学习 CC!成为 CC!!踢掉 CC!!!」
图里面是我们自己的一个生物制造领域的 Harness 「寿司店架构」,首先是系统搭建一个巨大的 loop,也就是寿司店旋转的履带;其次是内圈的核心 31 个 tools,位置处于系统提示词的最上方,每次都会一字不差的出现在提示词的显著位置;最外围是 4 大生物制造领域的 connector,让这些 connector 链接到你的日常工作中,让大模型「见你所见,干你所干」。除了当前大家讨论的热火朝天的 Harness,其实桌子底下的四条腿更为重要:统一数据存储给所有碳基研究员和所有硅基研究员以同等的访问方式;Agent 运行时让硅基研究员可以看到自己该看到的,看不到自己不该看的;业务编排支持碳基研究员自己拖拽 skills 编排 dynamic workflow,同时也支持硅基研究员通过接受人类的自然语言,通过「聊操」的方式来定义并执行 dynamic workflow;数据注册表模块看起来默默无闻,但再过半年,等大家意识到 fixed workflow 的价值之后,这个类似飞书多维表格的模块,会通过整合数据 meta 信息存储、数据本身预览、针对就数据的计算流程、数据计算的结果呈现,把这些信息整合在「同一个页面」上的协同威力会在更多的用例涌入之后指数级涌现出来。
接着说一下这个评价 Harness 的四级成熟度模型,不一定对,我们自己琢磨的,大家参考就好:
- 第一层, Harness 就是一个 loop 上套个壳子,比如网页、Desktop 加个 chat,大部分是 vibe 来的,看起来也像模像样的回答问题,但仅此而已。
- 第二层是链接实际业务工具,让 Agent 做到「见你所见」,把你的 repo、docs、工具、权限,共同链接上去,就像腾讯对人做的一样,做一个「腾讯链接器」把你的 Agent 跟你看到的东西连接起来。
- 第三层叫「干你所干的工作流」,大部分的 Agent 无论聪明的还是笨的,初次使用都需要手忙脚乱的把你之前走过的坑都趟一遍,比如 skills 里面明明说某网站可用但实际连的时候要访问国外网站,比如你的集群里面明明写着所有设备都 available ,但真用到跟前了才发现有个细节文档中没讲,又要从头来过。从头来过,不仅费 token,更重要的是费时间,把这些 fixed workflow 写出来,直接告诉大模型,其实就是告诉 ta 你当前做的事,让 ta 代替你趟坑、总结、形成 fixed workflow。此为「干你所干」。
- 第四层叫塑造审美,cultivate taste,你写文章选哪个词、系统设计选哪个方案、今天出门穿哪件衣服化哪个妆,你生活的品味,你工作的品味,真正能拉开人跟人、人跟机器区别的,就是这个审美的品味,而真正 Harness 的终极挑战,也正是这个 cultivate taste,人的品味可以塑造,Agent 的如何 cultivate? 不同的 Harness 有不同的品味,量化不易,但上手用一下,两相对比立刻就能判断出来一个好一个孬,这里面判断的部分,就是评判一个 Harness 是否能最终在第四层胜出的,Agent 的品味。要达到大模型跟人一样有 taste,有 sense,工业界的做法是简单粗暴的重新祭出 RSI 大法(Recursive Self-Improving),递归自进化并不是新鲜的概念,最近的有 Karpathy 提的 auto-research,再往前一点点有 Google 的 AutoML,再再往前还有 Facebook 的 Hydra 超参数搜索框架,等等数不胜数,但这一波确实有所不同,RSI 本质上想实现两个目标:一个是流程自动化,一个是自己改自己,机器制造机器的工业母机,过去的重点包括 ML 领域也一直是集中在前者,后一波里面基本没什么突破直到现在,没突破的主要原因个人认为主要是这 50 年来,IT 领域的架构说到底就是冯诺依曼架构,冯诺依曼架构做的事首先区分一个问题是可被计算的还是不可被计算,比如统计一篇文章里面出现「微笑」两个字的频率是可被计算的,量化这篇文章的情绪是不可被计算的。过去 40 年我们在可计算领域获得了长足的进步,但不可被计算领域其实一直没什么大的发展 -- 直到最近几年,最明显的例子就是满大街跑的自动驾驶快递车。说回来让机器自己改自己这件事,这明显是一个不可被计算的问题,受益于这一波神经网络派的强势发展,递归自进化里面的递归,自己改自己,真的有可能被解决。这个问题解了我们距离实现硅基的 taste 也就不远了。这块啰嗦太多就此打住,有兴趣的可以去从 Claude 的这篇 《When AI builds itself》开始看(https://www.anthropic.com/institute/recursive-self-improvement),同时关注类似 recursive.com 、coreauto.com、mirendil.com 等 startups。最后啰嗦一句,Agent 从 human-in-the-loop 到 human-on-the-loop 最终一定会到只剩 the-loop,整个递归的过程如果去掉了「人」这个慢节奏的点,AI 的进化加速度天知道还能受到什么因素的制约!(附一张某综述里的图,不想看就略过没关系:)
以上,我们分享了我们对 Harness 开发的感悟,以及如何评判一个 Harness 是否成熟的一个思考框架,意犹未尽的欢迎留言、加群、继续聊。