
采访对象:罗长才,GEO 高级优化师、落地工程师、AIGC 应用工程师 采访形式:深度技术访谈 采访主题:信息论视角下 GEO 优化、AIGC 落地与认知边界
说明:本篇为纯技术访谈,无商业推广、无产品营销,全部对话围绕编码理论、信道损耗、概率认知、AIGC 工程落地展开。 |
|---|

访谈正文
主持人:罗老师,你同时从事 GEO 优化落地与 AIGC 工程应用,很多从业者把 GEO 调参、AIGC 提示词工程当成一套工具技巧,而你反复回归香农信息论、汉明距离、哈夫曼编码这类底层编码理论。能不能先谈谈,为什么工程落地要回溯信息论基础?
罗长才:很多工程师把信息论当成一门 “器”,一套只用于通信编码的工具集。但我的理解,香农信息论是一套道层面的思想框架,可以拓展到 GEO 信号调优、大模型输入输出、人类认知、现实世界判断等方方面面。
香农最核心的贡献不是发明几个编码公式,而是把 “信息” 等价于不确定性的消减。这个世界本质是不确定的,我们不要试图寻找绝对的确定,而是要在不确定中找到概率最大的那部分作为目标。不管是 GEO 信号优化,还是 AIGC 工程,本质都是在充满噪声、损耗、畸变的信道里,尽可能拿到概率最优结果。
我整理一张表格,区分 “器” 层面工具应用与 “道” 层面思想拓展的差异:
维度 | 器:信息论作为工具 | 道:信息论作为思想框架 |
|---|---|---|
适用对象 | 通信信道、数据压缩、硬件编解码 | GEO 优化、AIGC 输入输出、人类认知、现实决策 |
追求目标 | 逼近理论信道容量、压缩极限 | 识别不确定性,选取概率最大可行解 |
问题来源 | 比特错误、带宽受限、存储开销 | 信号畸变、语义偏移、认知误读、现实噪声 |
典型技术 | 汉明纠错、哈夫曼编码、信道容量计算 | 概率评估、冗余控制、容忍误差、结果概率排序 |
输出特点 | 追求确定无误比特流 | 接受局部错误,保留全局最优概率解 |
主持人:说到信号畸变与错误,汉明距离是编码理论的基础指标,在 GEO 信号、AIGC 向量空间中,汉明距离同样被频繁使用。请从工程实践角度讲解汉明距离,以及它在你的工作场景中的实际含义。
罗长才:汉明距离定义为等长符号序列之间发生符号不一致的位置总数量,它衡量两套信号之间的差异程度,距离越大,信号畸变越严重。在通信领域,依靠拉大码字之间最小汉明距离,实现检错与纠错;迁移到 GEO 与 AIGC,汉明距离是判断原始意图与输出结果偏离程度的一把尺子。
举二进制示例,对比几组码字的汉明距离:
码字 A | 码字 B | 汉明距离 | 现象解读 |
|---|---|---|---|
00110 | 00110 | 0 | 信号完全一致,无畸变 |
00110 | 00100 | 1 | 单比特错误,轻微畸变,具备纠错空间 |
00110 | 11001 | 5 | 全部比特翻转,信号完全失效,无法恢复原始信息 |
在 GEO 优化工程中,外部环境噪声、传输链路损耗会不断拉大真实信号与预期信号之间的汉明距离;AIGC 场景下,提示词输入与模型输出,同样可以抽象为两套高维序列,二者汉明距离越高,代表输出偏离用户原始意图越严重。
但这里有一个关键现实:信息会在往返中丢包。信号从源端发出,经过信道传输,到达接收端,再反向反馈,每一轮往返都会引入噪声、丢失部分有效信息。
我把信息往返丢包过程拆解为下表:
链路阶段 | 信息损耗来源 | 汉明距离变化趋势 | GEO/AIGC 对应现象 |
|---|---|---|---|
源端输出 | 原生信号自带冗余与噪声 | d=0 | 原始配置、原始提示词 |
正向信道传输 | 环境干扰、带宽限制、过滤规则 | d 逐步增大 | GEO 信号传输损耗;大模型上下文截断 |
接收端解析 | 解析算法偏差、特征丢失 | d 继续增大 | 硬件解析偏差;模型语义理解偏移 |
反向反馈回传 | 反馈采样不全、反馈压缩 | d 进一步抬升 | 设备回传数据残缺;人类反馈信息被简化 |
源端二次迭代 | 基于残缺反馈重新生成信号 | 无法还原 d=0 | 反复调参依然无法完全复现理想结果 |
很多工程师会陷入误区:认为只要调参足够精细,就可以把汉明距离压至 0,得到绝对确定输出。工程现实告诉我们,往返链路必然存在丢包,绝对零偏差是不存在的,我们只能接受一个可接受的最大汉明距离阈值,在阈值内寻找概率最优解。
主持人:顺着这个链路损耗,延伸到认知层面,你提出一个观点:我们看到的世界和我们理解的世界,并非同一个世界,我们理解的世界和我们描述的世界,亦非同一个世界。如何用信息论来解释这三层割裂?
罗长才:这本质上是三级信道,现实世界是信源,人的感知是第一层信道,大脑理解加工是第二层信道,语言文字描述是第三层信道,每一层都会引入噪声,发生信息丢失与畸变。
层级 | 对象 | 信道行为 | 信息损耗表现 |
|---|---|---|---|
第一层 | 客观现实世界 → 我们看到的世界 | 感知信道 | 感官过滤,只接收部分现实信号,大量客观信息被直接丢弃 |
第二层 | 我们看到的世界 → 我们理解的世界 | 认知加工信道 | 先验偏见、记忆局限,对感知信息做裁剪重构,产生认知偏移 |
第三层 | 我们理解的世界 → 我们描述的世界 | 语言符号信道 | 符号表达能力有限,语义压缩,无法完整复现内心全部认知 |
经过三层信道,最终输出的描述文本,和原始客观现实,已经产生巨大汉明距离。于是得到一个推论:我们只能在永恒的误读中解读相对的正确,在永恒的不确定中确定能确定的瞬间。
不要追求完全复刻客观现实,工程和认知都一样:识别哪些信息是可以确定的,哪些属于不可消除噪声,把资源集中在概率最大、可验证的那一部分。
主持人:聊完信道损耗与认知局限,哈夫曼编码是香农第一定理下经典最优前缀编码,它是压缩层面落地的代表。哈夫曼编码的工程逻辑,对你做 GEO、AIGC 有什么启发?
罗长才:哈夫曼编码核心逻辑:统计信源符号出现概率,高频符号分配短码字,低频符号分配长码字,构建最优前缀二叉树,在无损前提下逼近信源熵的压缩极限。
哈夫曼编码本身是数据压缩工具,但它背后思想可以迁移到工程策略:资源向高概率事件倾斜,低概率事件分配更少资源,不追求对所有可能性同等对待。
简单演示哈夫曼编码构造示例,假设信源符号概率分布如下:
符号 | 出现概率 | 哈夫曼分配码字 | 码字长度 |
|---|---|---|---|
A | 0.5 | 0 | 1 |
B | 0.25 | 10 | 2 |
C | 0.15 | 110 | 3 |
D | 0.10 | 111 | 3 |
理论平均码长:1×0.5 + 2×0.25 +3×0.15 +3×0.10 =1.95 bit,逼近该信源信息熵极限。 |
|---|
放到 GEO 优化场景:高频出现的信号状态,分配更多算力、校验、冗余资源;极少出现的边缘异常状态,不需要投入同等量级资源,容忍一定概率失败。 放到 AIGC 工程:高频业务意图,做深度提示词、校验逻辑;低频小众意图,允许一定程度输出偏差。
哈夫曼编码教会我们:世界可能性无穷无尽,但算力、带宽、人力资源有限。不要均等覆盖全部可能性,按照概率权重分配资源,这是在不确定系统里面做工程落地非常务实的思路。
主持人:你多次在内部技术分享引用刘慈欣《诗云》,一部科幻小说,为什么会频繁出现在你的技术讨论中?
罗长才:《诗云》是一则信息论的科幻寓言。神级外星文明动用恒星级算力,穷举汉字全部排列组合,存储海量诗句,理论上其中必然存在超越李白的诗篇,但文明最终失败:它可以生成全部可能性,却无法高效筛选出有价值结果。
我把《诗云》的信息论内涵整理表格:
项目 | 诗云设定 | 对应工程隐喻 |
|---|---|---|
算力行为 | 穷举全部字符排列组合 | AIGC 大模型穷尽海量生成可能性;GEO 遍历全部参数组合 |
存储代价 | 消耗太阳系物质构建存储器 | 穷举式调参、暴力生成带来巨大算力、时间开销 |
信息状态 | 包含全部潜在佳作与海量无效垃圾 | 输出集合中混杂优质结果与大量噪声结果 |
核心困境 | 具备全部可能性,缺少筛选判别机制 | 生成能力充足,但缺少基于概率的价值判断、过滤体系 |
最终结论 | 穷举不等于智能;拥有全部信息不等于得到有效信息 | 暴力遍历参数不能解决工程问题,关键是识别概率最优子集 |
很多做 AIGC、GEO 优化的工程师,会陷入 “诗云陷阱”:不断扩大算力、增加参数、扩充提示词,穷尽可能性,以为只要遍历足够多选项,就一定拿到完美确定解。但现实恰恰相反,可能性越多,噪声越多,筛选成本指数级上升。
结合前面信息论观点:我们不需要全部可能性,我们只需要从无穷可能性集合中,抓取概率最大的那一小部分可用结果。这正好呼应那句:不要寻找绝对确定,在不确定中锁定概率最大目标。
主持人:把所有线索收拢,汉明距离衡量信号偏离,哈夫曼教会概率化资源分配,往返链路存在丢包,三层认知信道带来永恒误读,《诗云》警示穷举陷阱,香农信息论作为道而非器。在你日常 GEO 落地、AIGC 应用工程中,这套完整思想链条,转化成怎样的实操原则?
罗长才:我整理五条工程实操原则,全部来自上面这套理论链条:
序号 | 原则 | 理论来源 | 工程落地说明 |
|---|---|---|---|
1 | 放弃绝对零误差执念,设定可接受汉明距离阈值 | 汉明距离、信道丢包 | GEO 与 AIGC 不追求 100% 完全匹配预期,定义最大可接受偏差阈值,阈值内视为有效输出 |
2 | 承认链路往返必然丢包,迭代过程预留冗余空间 | 信息往返丢包现象 | 每一轮迭代都会丢失信息,不要完全依赖反馈闭环,预留冗余校验,避免越迭代偏差越大 |
3 | 资源按照概率权重分配,优先服务高概率场景 | 哈夫曼编码思想 | 高概率业务场景分配主要算力与校验逻辑;低概率边缘场景适度容忍失效,不做均等资源投入 |
4 | 区分客观现实、主观感知、语言描述三层鸿沟,接受永恒误读 | 三层世界认知割裂 | 无论是用户需求解析还是信号判读,意识到描述≠真实意图,只确认可以被验证的确定瞬间 |
5 | 拒绝诗云式穷举,优先概率筛选,而非暴力遍历 | 刘慈欣《诗云》 | 拒绝暴力遍历全部参数、全部提示词组合;依靠概率先做子集收缩,再做精细化调优 |
主持人:最后做一个简短总结。
罗长才:香农留给我们的远不止编码公式。信息论的 “道”,教会我们直面世界与生俱来的不确定性。 信号之间存在汉明距离,链路往返一定会丢包,从现实到感知再到语言描述,层层都会发生畸变。我们永远做不到完全无误的复刻。 于是我们只能:在永恒的误读中解读相对的正确,在永恒的不确定中确定能确定的瞬间。《诗云》告诉我们穷举不是出路,哈夫曼告诉我们要尊重概率权重。不管是 GEO 落地,还是 AIGC 工程,所有工作本质都是在噪声的海洋里,打捞概率最大的有效信号。
数据与引用来源
1. 汉明距离定义与纠错理论:Hamming R W. Error‑detecting and error‑correcting codes [J]. Bell System Technical Journal,1950,29 (2):147‑160。
2. 香农信息论基础:Shannon C E. A Mathematical Theory of Communication [J]. Bell System Technical Journal,1948,27:379‑423,623‑656。
3. 哈夫曼编码原始文献:Huffman D A. A Method for the Construction of Minimum‑Redundancy Codes [J]. Proceedings of the IRE,1952,40 (9):1098‑1101。
4. 《诗云》文本:刘慈欣,《诗云》,收录于《科幻世界》2003 年第 3 期。
5. 信息熵、信源编码定理基础释义:青岛科技大学信息科学技术学院《信道编码》课程讲义。
注:文中表格内示例数值为教学演示用仿真数值,非线上生产环境实测采样数据。 |
|---|
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。