× 万份文件堆进 RAG,能搜到——但用不上。
问题出在资料不等于知识,知识不等于能力。
本文记录一次进化实践,三个创新点,让知识库从仓库变成引擎。
图表 1:知识库三级进化路径(资料 → 知识 → 规律 → 技能)
知识库里堆着 ××× 封工作邮件、××× 份项目文档、××× 篇 AI 研究笔记。
以前的做法是全部丢进 RAG 做向量检索。用户问某个业务流程怎么走,系统返回 × 段相关文本。但用户要的不是 × 段原文,是一句「从立项到验收,标准几步走完」。
资料是原材料,知识是加工品。
我们做的第一件事:不存原文,存蒸馏后的知识。
图表 2:资料与知识的区别(原文检索 vs 蒸馏输出)
设计了三路蒸馏:
三路合计 ××× 条原始规律,去重合并后得到 ××× 条独立模式。
以某重点业务领域为例:×× 个项目目录、××× 份文件,蒸馏后产出 × 条规律和 × 种失败模式。其中一个请示文件迭代了 ×× 版、历时 × 月——这条规律不蒸馏出来,永远藏在文件名里没人看到。
蒸馏不是摘要,是「读取原文 → 提炼逻辑 → 结构化输出」。一份 ×× 页的制度文件,蒸馏后变成几条规律:预算分级审批机制、特定项目类型的经济门槛与收益周期、经营单元核算规则。
原文还在,但知识库存的是规律,不是文件。
图表 3:三路蒸馏流程(规律层 + 工作文档 + AI 研究 → 近百条)
近百条规律不是按学科分类,是按任务维度分——干什么、怎么干、具体技能。
干什么的规律:财务业务 ×× 条(预算闭环、增资流程、回款管理)、管理 ×× 条(经营单元管理、降本增效双轮驱动)、业务认知 × 条。
怎么干的规律:写作 ×× 条(报告六段法:背景 → 现状 → 问题 → 分析 → 措施 → 建议)、技术 × 条(文件版本管理、层级编号体系)、学习方法 × 条。
具体技能的规律——这是最接地气的部分:
校稿:公文标题不能省发文机关、数字大写统一规范、造词清单自动同步新发现的易错词。
汇报:述职报告先讲结果再讲过程、预算差异分析必须带同比。
数字:特定业务列收有门槛和收益周期、增资成本归集走标准流程。
这些规律不是教科书抄来的,是从 ××× 个桌面任务文件夹的真实工作中涌现的。每条规律都标注了来源文件,可以回溯。
图表 4:近百条规律的任务维度分布
知识库的终点不是「被搜」,是「被用」。
我们建了 ×× 个 skill 的反哺通道:校稿、公文写作、公众号写作、扩充、润色等。
反哺的意思是:蒸馏出的规律自动注入到对应 skill 的 references 里。比如校稿 skill 的「造词清单」会同步新发现的易错词,公文写作 skill 的「报告六段法」从最新蒸馏规律中更新。skill 不再是静态的,是活的。
进化闭环的路径:桌面任务 → 规律涌现 → 反哺注入 → skill 升级 → 下一个任务从更高起点出发。每跑一轮,skill 的基线就抬高一层。
规律晋升机制保证质量:出现 1 次为候选,2 次为观察,≥3 次为晋升候选,≥5 次为确认,跨 3 条独立来源为哲学级。近百条中 × 条已晋升哲学级——PDCA 闭环、事上磨炼、先确认后动手、蒸馏即可进化。×× 条跨路交叉确认。
当 skill 持续进化,agent 不再只是问答工具,而是工作台——每次任务都站在上一次的肩膀上。
图表 5:进化闭环(桌面任务 → 规律涌现 → 反哺注入 → skill 升级)
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。