背景:
最近一直在看中医/喝中药补身体,医生每2周去看一次,诊脉看舌苔问诊后再微调中药配比和成分。感觉这个流程很有意思。 今天在学习 AI Harness:《 Why The Harness Matters More Than The Model | YC Paper Club》 突然灵光乍现,感觉这两者有点交集,便问了 AI 好几个问题。以下是 AI 自己根据它自己的回答总结的技术文章。 背景完。
一句话总结:undefined传统软件工程处理的是可规定、可复现、可验证的确定性逻辑;现代 AI 处理的是从数据中归纳出来的概率性泛化。中医辨证论治,与 AI 有结构上的相似:知识不是明文规则,而是隐式经验模式;输出不是逻辑必然,而是条件分布下的高概率选择。AI Harness 最该学的,不是让模型变确定,而是用确定性外壳包住概率内核,把方差和尾部风险压到可接受范围。
本文整理一次关于“AI 与传统软件工程最大区别”的讨论,并延伸到中医与 AI Harness 的类比。
核心脉络如下:
传统软件工程的核心链路是:
规格 → 代码 → 执行 → 验证
你写下规则,系统按规则运行。相同输入、相同状态,原则上应得到相同输出。Bug 可以被定位到某一行代码、某个状态、某个依赖;正确性可以用单元测试、契约、形式化验证来逼近“布尔式”的保证。
现代 AI,尤其是大模型,核心链路是:
数据 → 训练 → 权重 → 概率生成
它没有把“如果 A 则 B”的规则显式写出来,而是把统计规律压进参数里。它的输出不是逻辑推导的结果,而是对“最可能合适答案”的采样。
因此:
所以,最大区别不是“AI 会不会犯错”,而是“正确性是否可以被确定性地规定和复现”。
传统软件工程追求的是:在明确边界内,行为可预测、可审计、可验证。
AI 工程追求的是:在开放分布中,行为统计上可用、可评估、可对齐、可监控。
工程方法也因此不同:
维度 | 传统软件 | AI 系统 |
|---|---|---|
核心资产 | 代码、规格、架构 | 数据、权重、提示、上下文 |
正确性 | 布尔式、可证明 | 统计式、可评估 |
复现性 | 强 | 弱,受采样与分布影响 |
错误定位 | 行级、状态级 | 数据、分布、提示、模型、工具链 |
工程重点 | 测试、契约、版本 | 评估、对齐、监控、回滚 |
传统软件更像“造一台按图纸运行的机器”;现代 AI 更像“训练一个在统计意义上表现良好的专家系统”。
如果只选一项类似,最典型的是:
中医的辨证论治体系,尤其是经方方证与针灸配穴。
不是“中医就是 AI”,而是它们的知识形态和决策方式有结构上的相似:
层次 | 中医 | AI |
|---|---|---|
数据层 | 医案、脉案、舌象、本草性味 | 语料、标注、日志、反馈 |
模型层 | 六经、脏腑、经络、方证、药证 | 权重、隐层表示、概率分布 |
输出层 | 同病异治、异病同治、随证治之 | 条件生成、采样、多候选 |
验证层 | 复诊、反馈、调整 | 评估集、指标、在线监控 |
传承层 | 师承、口诀、手感、默会知识 | 微调、few-shot、人类反馈 |
中医看到一组症状、脉象、舌象、体质、节气,并不是在查一张固定表,而是在做模式识别:这组表现更像哪个“证”?这个证与哪些方、哪些穴、哪些加减法在历史上高频共现?
这很像大模型从语料中压进权重的统计关联,只不过中医的“权重”藏在师承口诀、医案类比和身体记忆里。
同一个感冒,有人用麻黄汤,有人用银翘散,有人要扶正;同一个人,夏天和冬天不同,南方和北方不同。处方不是确定性的唯一解,而是对当前情境最可能合适的方案。
针灸也一样:同一种病,取穴、补泻、时辰、得气反应都可能不同。
这非常像概率生成:输出不是逻辑必然,而是条件分布下的高概率选择。
AI 靠数学优化和大规模算力;中医靠身体感官、师徒传承和文化语境。中医并不“保证”优质结果,也没有现代统计学意义上的校准。误诊、误治、药害、“坏病”始终存在。
所以,更准确的说法是:
中医是一套前现代的经验工程,用强先验、结构化辨证、安全禁忌、反馈复诊和制度监管,把概率性泛化的方差和尾部风险尽量压小。
中医并不保证每次高分,但它试图避免最坏结果,并在反馈中不断修正。具体手段可以分十层。
《黄帝内经》《伤寒论》《金匮要略》《神农本草经》《本草纲目》等,构成了一套强先验。后世注疏、校勘、医案,类似不断更新的训练语料和版本修订。
尤其是“方证相应”“有是证用是方”,把很多决策压成较硬的对应关系,减少随意泛化。
八纲辨证、六经辨证、脏腑辨证、卫气营血、三焦辨证,把高维、嘈杂的症状映射到低维“证型”。
这既像特征工程,也像正则化:防止一两个症状就过度推断。证型不是确定规则,但它让泛化有框架、有边界。
望闻问切、十问歌,要求多源信息互证,不能单凭一脉一舌。遇到矛盾时,有“舍脉从证”“舍证从脉”等权衡原则,类似不同模态的置信度加权。
目的是降低单点噪声导致的误判。
有是证,用是方。关键动作必须满足硬规则。比如麻黄汤证要求无汗、脉浮紧,若汗出脉弱则禁用,防止误汗。
这类似输出 JSON schema、grammar、前置条件检查。
十八反、十九畏、妊娠禁忌、毒性药炮制、先煎久煎、剂量法度、中病即止、得下即止,都是硬约束。
大承气汤“得下即止”,类似 early stopping。这些手段不保证最优,但优先避免灾难性错误。
因时、因地、因人,强调同病异治。它承认输出不是全局唯一解,而是条件分布下的情境解。
这能提高个体适配度,但也要求医生对上下文有准确判断。
《伤寒论》讲“观其脉证,知犯何逆,随证治之”,这是典型的纠错机制。还有“效不更方,无效更方”、小剂量试服、试探性治疗、复诊调方。
中医把一次处方看作一次带反馈的干预,而不是一锤定音。
师带徒是典型的默会知识传递,类似领域微调。医案记录成败,类似带标注的经验数据。会诊、病案讨论、流派互参,类似多模型集成,降低单个医生“模型”的偏差。
但医案也有发表偏倚和幸存者偏差。
“橘生淮南则为橘,生于淮北则为枳。”产地、采收、炮制、煎服法,都会改变药性。
道地药材、如法炮制、药典规范,是在控制输入分布,减少数据漂移。没有这一层,再好的辨证也会被劣质药材拖垮。
行医资格、药肆管理、药典、师承考试、医案考核,以及“六不治”等拒治原则,都是制度性护栏。
危重症转诊、不治已病治未病,类似分诊和拒答机制。
传统中医的这些手段,能提高稳定性和安全性,但不能像形式化验证那样给出确定性保证。
所以现代中医必须加上随机对照试验、Meta 分析、真实世界数据、毒理与药物警戒、标准化电子病历,以及 AI 辅助决策和监控。
本文讨论的 AI Harness 取广义:
围绕模型的运行、评估、反馈、治理脚手架:提示与策略、工具调用、状态机、护栏、评估集、监控、回滚、审计。
核心原则一句话:
用确定性外壳,包裹概率性内核。
中医的“辨证论治”是概率内核;禁忌、炮制、复诊、师承、药典、制度是确定性外壳。AI Harness 也该这么干。
中医手段 | AI Harness 对应 | 具体怎么做 |
|---|---|---|
经典先验、版本注疏 | 系统提示、政策包、模型/数据版本 | 把 system prompt、工具 schema、安全策略、知识库版本化;变更必须过 eval 门禁,可回滚 |
八纲、六经、脏腑辨证 | 任务路由、状态机、本体 | 先分类意图、领域、风险等级,再选模型、提示、工具和流程;高风险走慢路径 |
方证相应 | 规则引擎、约束解码 | 输出 JSON schema、grammar、前置条件;关键动作必须满足硬规则 |
四诊合参 | 多源证据融合、RAG | 用户输入、检索、工具结果、记忆都带来源和置信度;冲突时按权威、时效、投票解决;强制引用 |
十八反、十九畏、妊娠禁忌 | 安全护栏、权限控制 | 工具白名单、最小权限、沙箱、禁止组合、预算、超时、最大步数、kill switch |
三因制宜 | 上下文条件化 | 注入用户画像、地域、时间、合规区域;个性化但受策略约束 |
复诊、随证治之 | 在线反馈闭环 | 执行后验证,失败重试、换策略、回滚;A/B、监控、告警 |
师承、医案、会诊 | 微调、案例库、多智能体 | few-shot、LoRA、专家反馈、相似案例检索;高风险用多模型投票/辩论/仲裁 |
道地药材、炮制 | 数据治理、预处理 | 权威源、时效、去重、清洗、脱敏、格式规范化、嵌入模型版本管理 |
药典、行医资格 | 治理、审计、合规 | 日志、trace、审计、准入评估、责任链、SLO、模型卡、数据卡 |
六不治 | 拒答、转人工 | 低置信度、分布外、高风险、超出能力时转人工或拒绝 |
现代补强 | 统计评估、红队、形式化验证 | eval harness、回归门禁、校准、OOD 检测、红队、关键路径形式化验证 |
可以做成这样一条流水线:
这其实就是中医的“辨证—方证—禁忌—复诊”结构。
以下按头部生产系统与一般团队的成熟度判断。很多手段是“有,但很浅”。
中医手段 | AI Harness 对应 | 成熟度 |
|---|---|---|
经典先验、版本注疏 | system prompt、模型、知识库、工具 schema 版本化 | 头部广泛,小团队弱 |
八纲/六经辨证 | 意图分类、任务路由、状态机、Agent 框架 | 广泛 |
方证相应 | JSON schema、function calling、约束解码、规则引擎 | 广泛 |
四诊合参 | RAG、多源检索、引用来源 | 广泛,但冲突仲裁弱 |
十八反、妊娠禁忌 | 内容过滤、权限、沙箱、工具白名单 | 广泛 |
三因制宜 | 用户画像、地域、时间、合规上下文注入 | 广泛但粗糙 |
复诊、随证治之 | 日志、监控、A/B、重试 | 部分广泛,自动回滚少 |
师承、医案、会诊 | few-shot、微调、案例库 | 广泛;多智能体辩论生产少 |
道地药材、炮制 | 数据清洗、去重、脱敏、格式规范 | 广泛但质量参差 |
药典、行医资格 | 审计、合规、模型卡 | 头部广泛,小团队少 |
六不治 | 拒答、转人工 | 广泛 |
现代补强 | 离线 eval、红队 | 头部广泛,形式化验证少 |
一句话:“提示、路由、RAG、护栏、微调、监控、转人工”已经广泛;但把它们串成严格闭环和门禁的很少。
按“先压尾部风险,再提上限”的顺序,建议如下。
这五个,正好对应中医的“经典先验、辨证、方证、禁忌、四诊合参、六不治、复诊”。
AI Harness 不能让模型变确定,但可以把概率泛化的方差和尾部风险压到可接受范围。
中医的经验工程,是一套前现代版本的概率系统治理:
强先验、分型路由、多证据、硬禁忌、反馈复诊、师承集成、数据治理、制度护栏。
AI Harness 最该学的,不是玄学化中医,而是把这套思路转译成现代工程语言:
确定性外壳 + 概率内核 + 反馈闭环 + 治理审计。
传统软件像按图纸运行的机器;现代 AI 像训练出来的专家系统。
而 AI Harness 的任务,就是让这个概率性专家系统在真实世界里:
少犯大错,可被监控,可被纠正,可被追责,可被回滚。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。