概述
平时做资料整理的时候,经常会碰到这样的情况:为了完成一份报告,需要同时查看十几个甚至几十个网页,然后从里面提取标题、时间、核心内容以及一些关键数据,最后再整理成一份可以直接使用的资料。网页数量少的时候,手动复制内容倒也没什么,但数量一多,真正麻烦的反而不是总结,而是不断切换网页、复制内容、整理格式。最近我在处理一批网页资料时,就尝试把这部分重复工作交给Tabbit AI浏览器来完成,下面记录一下实际的操作过程。
方式一:手动打开网页并引用内容
如果需要处理的网页数量不多,我个人更倾向于直接打开网页,然后通过引用的方式交给AI处理,没有必要为了几个网页专门启动一个复杂的批量任务。比如这次只有六七篇文章需要整理,可以先把相关网页打开,再将这些页面集中到一个标签组里。之后进入AI对话,通过@引用需要处理的网页内容,并在指令中明确告诉AI需要提取哪些信息。这样做的好处是操作比较直观,哪一个网页被读取、需要处理哪些内容都能够自己控制,出现问题时也比较容易定位。
实际使用时,指令最好不要只写一句“帮我整理这些网页”。如果没有进一步说明要求,AI通常会按照自己的理解进行总结,不同网页之间的输出格式也可能不一致。我一般会把需要提取的内容直接写清楚,例如:
请读取我引用的全部网页内容,并按照统一格式整理。
每个网页提取以下信息:
1. 网页标题
2. 网页来源
3. 发布时间,没有明确时间则填写“未提及”
4. 文章核心内容
5. 关键数据或重要信息
6. 文章中明确给出的结论
要求:
1. 每个网页单独整理;
2. 不要遗漏已经引用的网页;
3. 原文没有出现的信息填写“未提及”;
4. 不要根据常识补充原文没有的信息;
5. 最终使用Markdown表格输出;
6. 对内容进行概括时不要改变原文含义。
这个方法比较适合少量资料整理,也方便后面继续追问。如果第一次只是把网页内容提取出来,后面还可以继续让AI基于刚才的结果进行分类、去重和对比,不需要重新把网页内容再整理一遍。例如可以继续要求它找出不同网页中反复出现的观点,或者把其中的数据单独提取出来,这样一轮一轮处理,比一开始就让AI直接生成最终报告更容易控制。
方式二:任务(Agent)模式批量处理网页
网页数量达到几十个以后,手动打开再逐个引用就开始有点麻烦了。这时候可以考虑使用Tabbit的任务(Agent)模式,让它按照指定的任务要求依次处理网页。这里需要注意的是,Agent并不是只需要告诉它“帮我整理这些网页”就结束了,任务范围、需要提取的信息、最终输出形式以及遇到异常时怎么处理,最好都提前写出来,否则网页一多之后,很容易出现遗漏或者输出格式不统一的问题。
例如我实际使用时会把任务要求写得相对完整一些:
请帮我整理当前标签组中的网页资料。
具体要求:
1. 依次读取当前标签组中的网页;
2. 记录每个网页的标题和来源;
3. 提取网页发布时间,没有明确时间则填写“未提及”;
4. 提取网页核心内容和关键数据;
5. 对内容进行适当归纳,但不能编造网页中没有出现的信息;
6. 如果多个网页存在相同内容,请标记重复信息;
7. 如果某个网页无法正常读取,请记录网页标题并继续处理其他网页;
8. 最终将全部结果整理成Markdown表格;
9. 每个网页单独作为一条记录;
10. 任务完成后统计成功读取和读取失败的网页数量。
处理过程中不要修改网页原有内容。
把要求写清楚以后,Agent执行的时候就不只是简单地回答问题,而是按照任务中的步骤去处理网页。对于资料整理这种重复性比较高的工作,这种方式会方便一些。尤其是需要连续处理很多页面的时候,不需要自己每打开一个页面就复制一次内容,整个过程也更容易保持统一。
网页比较多的时候,建议不要一次全部处理
这里是我实际使用过程中比较容易遇到的问题。网页数量一多,再加上每个页面本身的文字比较长,如果一次性把几十个网页全部交给AI处理,上下文会迅速变大。最终可能出现前面的网页整理得比较完整,到了后面开始遗漏内容,或者输出结果太长导致最终结果被截断。
所以如果需要处理的网页比较多,我更建议按照数量进行分组。例如50个网页可以拆成5组,每组10个网页,先分别完成信息提取,最后再把这5组结构化结果合并起来。这样虽然多了一步,但实际操作起来反而更容易检查,哪一组出了问题也比较容易重新处理,不需要把全部任务重新跑一遍。
可以把任务拆成下面这种形式:
第一阶段:
每10个网页作为一组,只负责信息提取。
第二阶段:
合并各组已经整理好的结果。
第三阶段:
基于合并后的结构化资料进行分类、对比和分析。
这种方法并不是Tabbit特有的技巧,实际上处理大批量AI任务时都比较实用。把一个很大的任务拆成几个相对明确的小任务之后,AI需要同时记住的信息会少很多,最终结果也更容易检查。
一个容易忽略的问题:不要让AI自行补全信息
资料整理和普通内容生成有一点不太一样。写文章的时候,AI根据上下文进行合理扩展有时候并不是问题,但整理网页资料时,如果原网页没有出现某个日期或者数据,AI却根据上下文把它补出来,就可能导致最终资料失真。
因此我比较习惯在任务指令里直接加上限制,尤其是涉及数字、时间、价格、统计数据等信息的时候,宁愿让它写“未提及”,也不要让它自己猜。
只整理网页中明确出现的信息。
原文没有出现的信息统一填写“未提及”。
禁止根据常识、上下文或其他网页内容推测缺失信息。
对于无法确认的信息,不要补充。
这样做之后,整理出来的资料虽然有时候看起来没有那么“完整”,但后续人工核对的时候会省很多麻烦。对于需要拿去做报告或者继续分析的资料,我认为这一点比让AI把表格填满更加重要。
网页无法读取时怎么处理
实际整理网页的时候,并不是所有页面都能够正常读取。有些网站需要登录,有些网页的正文是动态加载出来的,还有一些页面本身就存在访问限制。如果任务中没有提前规定处理方式,Agent遇到无法读取的页面后可能会继续尝试,或者直接根据页面标题推测内容,这两种情况都不是我们希望看到的。
我一般会在任务指令里提前写明异常处理规则,让它遇到问题之后先记录下来,再继续处理其他页面:
如果网页无法正常读取:
1. 尝试重新加载一次;
2. 如果仍然无法读取,记录网页标题;
3. 不要根据标题猜测正文内容;
4. 将该网页标记为“读取失败”;
5. 继续处理其他网页;
6. 任务完成后统一列出读取失败的页面。
这样即使几十个网页里有一两个无法处理,也不会影响剩余任务继续执行。最后根据失败列表重新人工处理就可以了。
重复使用的整理流程可以保存成妙招
如果只是偶尔整理一次网页,直接输入任务指令就够用了。但如果工作中经常需要做类似的事情,例如每周收集行业资讯、整理竞品公开资料或者汇总指定网站的内容,那么每次重新输入一整套指令就比较麻烦。
这时候可以把已经验证过的流程保存下来。Tabbit里的“妙招”可以将一些重复使用的AI操作方法进行沉淀,其中包括提示词妙招、脚本妙招和任务妙招。像上面这种网页资料整理,如果已经把任务流程调试好了,就可以将它保存为任务妙招,把每次都会发生变化的网页范围等内容设置成变量,后面遇到类似任务时直接调用。
这样处理几次之后,原本需要临时组织的一大段提示词就变成了一个固定的工作流程。对于经常重复做相同类型工作的场景说,这种方式比单纯让AI完成一次任务更加实用,因为真正节省时间的地方并不是第一次使用,而是后面的重复执行。
实操过程中几个比较容易踩的坑
1. 网页数量不要一次堆得太多。 如果页面本身很长,建议分批处理,尤其是几十个网页同时处理的时候,不要只考虑网页数量,还要考虑每个网页的内容长度。
2. 任务要求尽量写具体。 需要提取什么、怎么整理、最终输出什么格式,都应该提前说明。“帮我整理一下”对于简单任务可能够用,但面对几十个网页就比较容易出现偏差。
3. 涉及数据时不要让AI猜。 日期、数字、价格等内容如果网页没有明确说明,就直接标记“未提及”,不要为了让结果看起来完整而自行补充。
4. 给异常情况留出处理规则。 网页打不开并不一定代表整个任务失败,只要让Agent记录失败页面并继续执行,最后再单独处理即可。
5. 重要资料还是需要人工核对。 AI负责提高整理效率没有问题,但涉及正式报告、数据统计等内容时,最终结果最好能够回到原网页进行确认。
总结
批量整理网页资料看起来只是一个简单的复制和总结工作,但真正做起来以后会发现,时间往往花在不断打开网页、切换页面、复制内容以及统一格式这些重复操作上。网页数量少的时候,直接打开页面并通过引用交给AI处理就足够了;如果需要一次整理几十个网页,则可以使用任务(Agent)模式,把处理范围、提取字段、输出格式和异常情况提前规定清楚。
我这次实际使用下来,一个比较明显的感受是,AI处理这类任务时,指令写得多并不一定比写得清楚更重要。 与其给Agent一大段没有结构的要求,不如把任务拆成“读取什么、提取什么、遇到问题怎么办、最后输出什么”几个部分。等流程稳定下来以后,再把重复使用的部分保存成妙招,后面处理同类型资料时就不用重新开始。
对于网页资料整理这类工作,我觉得比较合适的思路就是先从少量页面开始测试,确认提取规则没有问题之后再逐渐扩大数量。这样既方便检查结果,也能避免一开始就把大量网页全部交给Agent,最后才发现任务要求本身就需要调整。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。