前言
我是一名调味品行业的区域销售主管,日常工作中大量信息通过钉钉群流转。全国业务沟通群里经常有同事分享AI听记纪要,内容很有价值,但散落在聊天记录里很难回溯。
前几天我需要把群里某位同事发送的所有AI听记全部提取出来做汇总,如果手动翻聊天记录逐条复制,几十条消息至少要花一两个小时。用WorkBuddy配合钉钉CLI工具,最终30分钟搞定了全部提取和汇总。
这篇文章记录完整的实操过程,适合需要从钉钉群批量提取结构化信息的办公人。
一、背景与需求
钉钉群内同事会不定期分享AI听记(会议纪要),每条听记包含:主题、时长、参会人、AI摘要等。我的需求是:
1. 定位到指定群聊("线下全国业务沟通群")
2. 找出某位同事发送的所有含AI听记的消息
3. 提取每条听记的完整内容
4. 按时间排序汇总成结构化文档
二、实操步骤
第1步:确认钉钉CLI环境
WorkBuddy内置了钉钉工作台CLI工具(dws),可以通过命令行操作钉钉数据。先确认登录状态:
如果显示未登录,先执行 `dws auth login` 扫码登录。
第2步:搜索目标群聊
用群名关键词搜索:"线下全国业务沟通群"
返回结果中找到目标群的 `groupId`(一串加密字符串),后续操作都靠这个ID。
第3步:拉取群全量消息
这一步是关键。用 `--page-all` 参数翻页拉取全部历史消息,导出为JSON文件:
几个重要参数说明:
——自动翻页,直到拉完所有历史消息
——不限制总条数
——每页100条,减少请求次数
——输出到文件而不是直接打印到终端
我的群总共2594条消息,一次性全部导出。
第4步:筛选AI听记消息
拉取完成后,消息数据是JSON格式。我用WorkBuddy帮我写了一段Python脚本,筛选出特定发送人、且内容包含AI听记标识的消息:
关键筛选逻辑:
- 按发送人昵称过滤(我找的是"春玲"发送的听记)
- 按内容关键词过滤(包含"主题:"、"听记"等关键词)
这里有个踩坑点:群成员列表里的昵称可能和消息里的发送人名称不完全一致,需要灵活匹配。我最初找"占**"没找到,后来发现实际发送人是"春玲"(同音字导致口述误差)。
第5步:提取听记内容并汇总
每条听记消息的 `text` 字段里包含了完整的AI摘要内容,包括:
- 会议主题
- 会议时长
- 参会人
- AI生成的结构化摘要(分点列出核心内容)
WorkBuddy自动帮我:
1. 按时间排序所有听记
2. 提取每条听记的核心要点
3. 按主题分类汇总
4. 生成结构化的汇总文档
最终输出一份汇总报告,7条听记的核心内容一目了然。
三、踩坑记录
坑1:群成员名称匹配
口述的"占春林"在群里实际叫"春玲",拼音相同但字不同。解决方案:先拉取群成员列表全量打印,人工核对后再精确匹配。
坑2:消息格式解析
导出的JSON文件不是标准的ndjson(每行一个JSON对象),而是一个完整的JSON对象里包含 `messages` 数组。最初按行解析报错,改成整体 `json.load()` 后正常。
坑3:翻页参数
第一次用默认参数只拉到最近几百条消息(到1月为止),历史消息没拉全。加上 `--page-all` 和 `--max-results 0` 后才拉完整。建议首次拉取时检查返回结果里的 `complete` 和 `hasMore` 字段,确认数据完整。
四、效果与价值
最终产出:
- 7条AI听记完整提取,无遗漏
- 每条听记的核心要点提炼(3-5条/条)
- 按时间排序的结构化汇总文档
原本需要手动翻2小时聊天记录的工作,30分钟完成。更重要的是,汇总后的文档可以直接用于团队分享和后续学习复盘。
五、适用场景
这个方法不仅限于提取AI听记,任何需要从钉钉群批量提取结构化信息的场景都适用:
- 提取某个同事的所有工作汇报
- 汇总群内的活动方案/通知公告
- 整理项目群的需求讨论记录
- 批量导出群消息做数据分析
总结
WorkBuddy + 钉钉CLI的组合,让"翻聊天记录"这种纯体力活变成了可自动化的数据处理流程。核心三步:搜索群 → 拉全量消息 → 筛选汇总。过程中踩的坑(名称匹配、格式解析、翻页参数)都是实际操作中常见的问题,希望这篇记录能帮到有类似需求的朋友。
本文为个人实操记录,仅作方法分享。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。