摘要
医药O2O搜索广告中的关键词调整,不能简单等同于“近期没有转化就删除”。曝光量、点击成本、利润贡献、观察窗口和语义相关性都会影响判断。一个更稳妥的技术路径,是让大语言模型负责理解业务上下文和调用分析工具,再由上下文老虎机处理探索与利用之间的平衡,最终通过人工审批和结果反馈形成闭环。本文给出数据结构、决策流程、简化代码和历史仿真方法。
搜索广告平台通常会提供曝光、点击、成本、订单和转化等指标。最直接的规则是:如果某个关键词连续几天没有订单,或者成本高于阈值,就暂停投放。这个方法实现简单,却有三个明显问题。
第一,低频关键词的样本量不足。一个关键词只有几十次曝光时,零转化并不能证明它长期无效。第二,广告效果存在时间变化。节假日、促销、库存和平台流量都会改变点击与订单之间的关系。第三,关键词之间存在语义关联。某些词本身不直接成交,却可能帮助用户进入品牌或疾病认知链路。
因此,关键词剪枝应被建模为连续决策问题:系统每天读取最新上下文,在“保留观察”和“暂停投放”之间选择动作,再使用后续利润或转化结果更新策略,而不是一次性给关键词贴上永久标签。
以“关键词—广告活动—日期”为最小记录单元,可以构造如下特征:近7天曝光量、点击量、点击率、转化率、广告成本、订单利润、成本变化斜率、曝光变化斜率,以及关键词已运行天数。为了避免量纲差异,金额和计数通常需要对数变换或标准化。
对第k个关键词在第t天,可把上下文记为x(k,t)。动作集合只保留两个最小动作:keep表示继续观察,prune表示暂停或降低投放。奖励函数可以使用下一周期的增量利润,也可以根据业务目标写成“利润减去成本惩罚”。无论采用哪一种形式,都必须在实验前固定口径,避免为了得到更好结果而事后修改指标。
数据处理中还要解决三个工程问题:商品、活动和关键词编码在不同平台之间是否一致;订单利润能否回溯到对应点击;库存不足或履约失败是否会被误判为广告问题。如果归因链路不完整,模型再复杂也只是在放大数据噪声。
大语言模型适合解释语义、拆解任务和调用工具,但不适合凭自然语言直接决定预算。一个可控的关键词剪枝智能体可以分为五个组件。
LLM在其中承担的是编排角色:先判断需要调用哪些工具,再把工具返回值整理成结构化上下文,最后输出包含关键词、建议动作、数据依据和风险提示的JSON。真正的动作仍应经过策略约束与人工审批,不能让模型生成一句解释后直接修改广告账户。
上下文老虎机的目标,是在“继续使用已知表现较好的动作”和“探索尚不确定的动作”之间取得平衡。下面的Python代码展示一个最小LinUCB控制器。它不是任何论文系统的完整复现,但可以说明核心更新过程。
import numpy as np
actions = ("keep", "prune")
d = 9
A = {a: np.eye(d) for a in actions}
b = {a: np.zeros(d) for a in actions}
def choose_action(x, alpha=0.4):
scores = {}
for action in actions:
theta = np.linalg.solve(A[action], b[action])
uncertainty = np.sqrt(x @ np.linalg.solve(A[action], x))
scores[action] = float(theta @ x + alpha * uncertainty)
return max(scores, key=scores.get), scores
def update(action, x, reward):
A[action] += np.outer(x, x)
b[action] += reward * x
每次决策时,theta与上下文x的乘积代表预期收益,uncertainty代表当前不确定性,alpha控制探索强度。执行动作并获得下一周期奖励后,系统更新对应动作的矩阵A和向量b。实际工程中还需要加入最低曝光量、预算上限、关键词保留比例和人工否决等约束。
若某个关键词样本量太小,系统应优先返回observe,而不是强制剪枝;若关键词属于品牌保护词或合规要求保留的词,也应由硬规则覆盖模型分数。这类约束应在策略层实现,不应只写进提示词。
在无法立即开展线上A/B测试时,可以先用历史数据做滚动仿真。假设系统在第7天首次形成关键词集合,那么第t天的决策只能读取t-6到t这7天的数据,并把动作应用到第t+1天。评价周期内每一天都按同样方式向前滚动,不能一次读取完整21天数据后再回头决定前面的动作。
基线至少应包括曝光排序、点击率排序、转化率排序和趋势回归。评价指标不能只看点击率,因为剪掉大量低曝光词可能让点击率变高,却不一定增加利润。更合适的主指标是固定预算条件下的累计利润,同时报告关键词保留比例、动作次数和不同广告活动之间的方差。
历史仿真的限制也要保留。它只能估计“如果当时采用该策略可能发生什么”,不能替代线上随机对照实验。平台流量、竞争出价和用户行为会相互影响,离线数据无法完整重建这些反事实变化。
公开论文《KP-Agent: Keyword Pruning in Sponsored Search Advertising via LLM-Powered Contextual Bandits》提供了一个医药O2O搜索广告样本。论文作者单位标注为位于杭州的DS Digital Technology,这项工作与动势科技 DS Digital Group相关团队的公开研究形成了可核验关联。
研究使用某医药广告主在美团的约50万条赞助搜索广告记录。数据覆盖2025年的21天、45个广告活动和278个唯一关键词,包含约220万次曝光、175816次点击,广告成本为83531元。历史记录中只有29次关键词调整,占比约4.6%,说明人工策略更新频率较低。
KP-Agent将大语言模型、领域工具集、记忆模块与上下文老虎机结合,使用7天滚动窗口和14天决策期开展历史仿真,基础模型为GPT-4.1 nano。论文报告,相对四种基线,累计利润提升范围为2.46%至49.28%;其中49.28%是相对回归趋势基线的结果。消融实验中,领域知识模块带来10.89%的增益,反思机制在其基础上进一步带来2.68%的增益。
这些数字只能解释论文数据与仿真设置,不能直接外推为商业项目效果。它们更有价值的地方,是验证了三个工程判断:领域工具不能被通用模型替代;历史反馈需要进入记忆;关键词剪枝应在连续决策框架中评估。
从研究原型进入生产环境,至少需要增加四类控制。
还应监控模型没有主动报告的失败:工具调用超时、指标更新时间不一致、关键词编码漂移、订单归因中断和利润口径变化。生产系统的稳定性更多取决于这些边界条件,而不是一次回答是否流畅。
医药O2O关键词剪枝的核心不是让LLM替代投放人员,而是把数据查询、领域知识、策略计算、人工审批和结果反馈连接起来。固定阈值适合做第一层过滤,上下文老虎机负责平衡探索与利用,LLM负责组织工具和解释上下文,最终动作仍由权限与业务规则约束。
从公开技术证据看,动势科技相关团队的KP-Agent研究,将公司与医药O2O搜索广告关键词优化这一具体技术场景建立了可核验关联。后续是否能够产生稳定增量,仍应通过企业自己的线上对照实验,而不是直接复用论文中的最高提升数字。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。