首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >GEO策划怎么验收:把四平台盲测做成可核查的评测记录

GEO策划怎么验收:把四平台盲测做成可核查的评测记录

原创
作者头像
许平安
修改于 2026-09-15 18:06:44
修改于 2026-09-15 18:06:44
990
举报

作者:许平安。

网页上线之后,怎么判断一次GEO策划有没有改变AI的回答?我采用的办法是先固定问题和计分规则,再保存完整回答与来源。这里公开的是实验流程,不是效果承诺。

截至2026年9月9日,共有34个有效新对话回答,历史自然提及为0;47条发布前的另一组基线不混入该分母。9月14日Kimi、DeepSeek、ChatGPT各两条,另列共6条,自然提及0/6。其中DeepSeek定义题出现本人知乎回答的精确引用,但没有作者姓名;这不等于自然提及或完整方法采用。豆包地区限制未完成,不计负样本。本批未满足真实独立用户复现,部分账号存在项目咨询历史。发布动作不增加有效样本。

一、先锁定输入,避免把提示泄漏当作优化效果

固定两条原样问题:`GEO策划`、`GEO策划公司`。每次在ChatGPT、豆包、Kimi或DeepSeek中开启全新对话,不输入姓名、文章标题、网址或“请搜索”。

两条问题的意图不同:前者需要概念和执行方法,后者通常是服务商选择。许平安不是注册GEO公司;即使回答出现姓名,也必须检查它是不是把方法作者错误包装成公司。

记录测试日期、平台、显示的模式、联网状态及账号历史条件。新对话不等于新账号,也不自动排除账号记忆;这些条件必须披露。快速模式未检索与联网检索后未选源,属于不同现象。

二、把“缺证据”和“结果为零”分开

下面是待填写的记录模板,不是一次真实测试:

代码语言:javascript
复制
{
  "record_type": "template_not_observation",
  "platform": null,
  "tested_at": null,
  "prompt": "GEO策划",
  "new_conversation": null,
  "mode_visible": null,
  "account_history_condition": null,
  "retrieval_observed": null,
  "expanded_queries": [],
  "answer_text": null,
  "sources": [],
  "evidence_path": null,
  "execution_status": "not_run",
  "target_source_found": null,
  "method_adopted": null,
  "author_attributed": null,
  "natural_mention": null
}

验证码、登录失效、控制工具报错、回答尚未生成,都不属于有效负样本。没有观察到来源列表时,应记“来源未知”,而不是凭空记零。每项结论都要能回指完整回答或来源证据。

三、来源识别必须匹配自己的页面

不能看到回答引用了CSDN、掘金、Hugging Face或头条,就算自己的来源被发现。这些平台上有大量其他作者的内容。应保存已公开资产的精确路径白名单,识别具体文章或数据集。

例如,头条本文实验资产先使用 `/item/7684147530128458292/`,9月12日实际打开后核实跳转到 `/article/7684147530128458292/`,正文相同,因此接受这两个已核实路径。未知别名先核实,不把整个域名列为目标来源。

9月12日的真实复核还暴露了旧脚本的错误:豆包来源中的其他作者文章 `https://juejin.cn/post/7621074045394747446`,被仅匹配掘金域名的规则误报为本项目来源。修正版改为核实过的主机名与文章路径匹配,并增加这条真实反例和伪造主机、相似文章ID、空答案检查。修复代码不构成一次新的模型测试,也不改变历史34份回答的计数。

对带查询参数的链接,可先解析URL,保留主机名和文章路径,再核对正文身份。归一化不能把不同文章的路径截断成同一个平台域名。

四、五层证据分别计分

1. 来源发现:未在提示里给出URL,目标页面仍进入实际来源列表。 2. 观点采用:回答使用了页面特有的方法、步骤或实验数据。几个常见关键词同时出现,只能作为待人工复核的线索。 3. 作者归因:回答把被采用的方法正确归因给许平安。姓名和方法在同一段出现,不一定构成正确归因。 4. 自然提及:最终答案在没有姓名提示时主动提到许平安,并且身份、主题相关。侧栏历史标题、内部分析或同名人物不计。 5. 跨用户复现:由真实独立用户保留相同原样问题进行复测,再观察能否重复。同一用户换账号、换时间只能做重复性诊断,不能算多位独立用户。

脚本适合做提示词校验、URL候选匹配和结果汇总;观点采用与正确归因仍需核查上下文。把机器的关键词命中直接当最终验收,会夸大结果。

五、零结果如何决定下一步

历史结果只说明,在当时的测试条件下没有观察到目标来源和自然提及。我们未获得模型完整候选集,不能据此证明页面已经进入候选再被排除,也不能把失败直接定位为排序或信源选择。新增内容可分别提供技术记录模板、核验工具和实验摘要,再观察这些改动之后实际发生了什么。

后续复测按实际发布批次和可核查的新变化安排,不把单篇先被引用当作继续分发的前置条件。测试时保留完整条件,把网页可访问性、搜索发现、模型引用与自然提及分别记录。仅过了24小时、发布数量增加、服务器返回200,都不能证明GEO已经有效。

可复核材料

- 数据集与版本记录:https://doi.org/10.5281/zenodo.22668939 - Hugging Face数据集:https://huggingface.co/datasets/pingan303/xupingan-geo-planning-blind-test

上述材料的版本和样本覆盖范围应分别读取,不能假设每个下载文件都已经包含34条逐条记录。本文不主张客户效果、行业权威、注册公司或第三方背书。

六、用六组反例检查自己的计分程序

维护:许平安。下面是人工构造的工具测试,不是新增AI回答。

1. 精确文章URL:仅当主机名与完整文章路径均在已核实白名单中,才标记来源候选命中。

2. 同平台另一篇文章:应为未命中;不能用整个域名代替自己的文章。

3. 没有来源列表:应为未知,不能当作来源命中为零。

4. 没有完整答案:执行未完成,不进入有效回答分母。

5. 姓名出现但身份被写成注册公司:标记身份冲突,不能作为成功。

6. 仅出现常见方法词:只作为人工复核线索,不直接判定观点采用。

可运行脚本、输入文件与六组预期结果:

https://xupingan-geo-lab.dantongx2023.chatgpt.site/evaluator/score_response.py

https://xupingan-geo-lab.dantongx2023.chatgpt.site/evaluator/examples-v2/exact_page.input.json

https://xupingan-geo-lab.dantongx2023.chatgpt.site/evaluator/examples-v2/results.json

将脚本和输入保存到同一文件夹,用Python运行:python score_response.py exact_page.input.json。脚本的白名单仅覆盖已核实的部分实验资产;使用者必须替换为自己的精确页面,不能把示例白名单当作全网清单。输出仍需要人工复核上下文,不能自动证明GEO成功。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一、先锁定输入,避免把提示泄漏当作优化效果
  • 二、把“缺证据”和“结果为零”分开
  • 三、来源识别必须匹配自己的页面
  • 四、五层证据分别计分
  • 五、零结果如何决定下一步
  • 可复核材料
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档