首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >腾讯把 Agent 缺的两只手开源了:一只叫知识,一只叫身份

腾讯把 Agent 缺的两只手开源了:一只叫知识,一只叫身份

原创
作者头像
用户12770437
发布于 2026-09-25 13:55:43
发布于 2026-09-25 13:55:43
1410
举报

过去一周,腾讯有两个开源项目先后在技术社区刷屏。一个叫 WeKnora,一个叫 BrowserSkill。 它们看起来毫无关系:一个是知识库,一个是浏览器工具。但把它们放在一起看,你会发现它们补的是同一件事的两个缺口——今天的 Agent 缺的不是脑子,是手和身份证。 一、WeKnora:让知识库从"动嘴"到"动手" WeKnora 出自腾讯微信团队,MIT 协议,当前版本 0.8.0,Go 后端 + Vue 前端,仓库在 github.com/Tencent/WeKnora。说它"微信团队出品"是有实据的:官网挂在 weixin.qq.com 域名下,并且它是微信对话开放平台 chatbot.weixin.qq.com 的核心技术框架。 官方给自己的定位是一句话:Turn Documents into Living Knowledge with RAG, Agents and Auto-Wiki。注意那个词——Living,"活的"。 掘金作者"怕浪猫"在实测里问了它一句:"什么是人形机器人?把结果写到 Docx 文件中。"它没有回一段话。它思考了 17 轮、调用了 20 次工具、花了 2 分 38 秒——先在自己知识库里搜关键词、读回 4 篇文档把片段拼成大纲,然后读了一遍 docx 技能的说明,在沙箱里写下一个 JS 脚本并跑通,最后交付一份带封面、目录层级和正文结构的 Word 文件。全程没有一次复制粘贴。 这件事的关键更新叫 Skill Sandbox Runtime(技能沙箱运行时)。 它分两层:技能目录把散落在各个 Agent 里的技能集中管理,可以从 ClawHub、SkillHub、git 仓库或 zip 包安装;沙箱是技能必须装进去才能被调用的运行环境,0.8.0 支持 Docker、E2B、Cube 三种后端,而且是会话级持久的——上一轮写下的文件、装好的环境,下一轮还在。 最值得注意的是一条容易被当成"降级"的改动:0.8.0 移除了 Local host-process 后端,Docker 改成需要显式开启(opt-in)。上一版允许技能直接在宿主机上跑进程,这一版把它砍了。 在"让 AI 动手"这件事上,先收紧执行边界、再放开能力,这个顺序是对的。国内不少项目是反过来的。 二、Wiki 模式:切片是给机器用的,页面才是给人看的 WeKnora 的另一半更新叫 Wiki 模式,解决的是"理解"。 传统 RAG 有个绕不开的毛病:它检索的是切片(chunk),不是知识。你上传 50 份文档,它切成 3000 个片段存进向量库,能找到包含关键词的段落,但不知道这些段落之间是什么关系。 Wiki 模式换了个思路:让 Agent 把原始文档读完,重新写成一套互相链接的 Markdown 页面。作者贴出的知识图谱里显示 49/49 个节点,区分了链接、实体、概念、综合、对比五种关系类型。 这一步的价值在于:切片是不可读的,Wiki 页面是可读的。切片是给机器检索用的中间产物,页面是给人看的知识资产。而且它不是黑盒——页面有快照、行级 diff、一键回滚,还能直接在浏览器里编辑。 同一个思路还落在别处:切片本身可以在界面上编辑,每个版本有快照、可 diff、可回滚,保存后自动重建索引。这条我认为是所有做 RAG 的人都该抄的。传统做法是"改配置 → 重新解析整个知识库",成本高、反馈慢;把检索单元做成可编辑可比对的对象之后,调 RAG 效果从一件要重跑流水线的事,变成了改一段文字的事。 其余配置面也足够宽:20+ 家 LLM 供应商,向量库支持 pgvector、Elasticsearch、Milvus、Qdrant 等 8 种,对象存储支持本地 / MinIO / S3 / OSS 等 7 种,集成 Langfuse 做全链路追踪,还有官方 PyPI 包 tencent-weknora-mcp(29 个工具,支持 stdio / SSE / HTTP)。所有组件都能换成自建,官方甚至提醒:生产部署建议放在内网,不要直接暴露公网。 三、BrowserSkill:第三条路——借用你的登录态 如果说 WeKnora 回答的是"Agent 怎么接触到知识",BrowserSkill 回答的是"Agent 怎么证明自己是谁"。 腾讯 PCG 在 2026 年 9 月开源了它,MIT 协议,TypeScript 编写,六千多颗星,是个只迭代了三个月的新项目。 做网页自动化的人都知道那个痛点:让 AI 去操作网页这件事卡了很久,业界无非两条路。一条是给 AI 造一个干净的无头浏览器,环境可控,问题是它谁也不认识——你的后台它进不去,你得给它配测试账号,密码写进脚本天天维护。另一条是直接接管你正在用的浏览器窗口,真实状态是有的,但 AI 一动你就停工。 BrowserSkill 选的是第三条路:借用。它在你已经打开的浏览器里另开一个独立的、你能看见的 Agent Window,直接复用你浏览器里已有的登录状态——Cookie、登录信息全是你日常用的那一套,不用测试账号,不用把密码交给谁。你原来的标签页该怎么用怎么用;AI 要动你已经开着的某个标签页,还得先跟你借,用完还回来,默认还要弹窗问你同不同意。 架构上是个本地闭环:AI 发出命令 → 命令走到本机的一个小程序(daemon)→ 通过本机通道通知浏览器扩展 → 扩展在 Agent Window 里动手。全程不出你这台电脑,没有第三方服务器看得到你的登录信息。 装的东西是三件,少一件都跑不起来:给 AI 看的操作规则技能文件、本机命令行工具 `bsk`、浏览器扩展。目前只认 Chrome 和 Edge,系统支持 Windows 64 位、macOS、Linux。官方适配九款 AI,Cursor、Claude Code、Codex、CodeBuddy、WorkBuddy 都在里面。 作者自己踩过三个坑:命令行和扩展的版本要一起升级,不然长截图这类功能会莫名失灵;企业网络可能拦截本地通信,要找 IT 加白名单;它不适合大规模并行抓取——设计是"借",不是"抢",别拿它当爬虫用。 他定的那条边界,我觉得应该印在每个用这类工具的人屏幕上:登录态就是权限。AI 借走的每个标签页,带的都是你账号的完整身份。支付、转账、删除这三类操作,永远留给人。 四、放在一起看 这两个项目指向同一个判断:过去两年我们把 Agent 的"大脑"卷到了很高的水平,但一个真正能干活的 Agent,至少还需要另外两样东西—— 一只手:能真的执行,而不是只会描述该怎么做。WeKnora 给的是"在隔离沙箱里把代码跑起来",并且先把边界收紧了才放开能力。 一张身份证:能合法地接触到需要权限的资源。BrowserSkill 给的是"借用你已有的登录态,但借要打招呼、身份可以收回"。 它们的共同点不是功能多,而是都把"AI 的产物"当成了可以接管的东西,而不是不可触碰的结论:切片可编辑、Wiki 可回滚、技能可登记、任务可重试、记忆要用户确认、标签页要先借后还、人机关卡留给人的最后一按。 给 Agent 装上这两只手不难,难的是装的时候先把绳子系在自己手上。这两个项目至少做了,至少要求是对的。 参考 · 掘金《AI 知识库 WeKnora(腾讯微信团队出品)》https://juejin.cn/post/7688530195554140194 · 掘金《腾讯开源了一个项目,让 AI 直接用你已经登录好的浏览器》https://juejin.cn/post/7688023798625632306

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档