神了,居然能看到海外权威研究机构在讨论小红书的模型??
8 月 14 日,小红书 dots 模型实验室开源 dots3-note preview。
模型总参数 280B,每个 token 激活约 16B 参数,支持 512K 上下文,并具备文本、视觉和语音等多模态理解能力。
开源后短短几天,SemiAnalysis、vLLM、SGLang、ARC Prize 等海外 AI 社区和机构陆续开始讨论这一模型。
其中 SemiAnalysis 的测试最受讨论。
SemiAnalysis 直接以「dots3-note beats American open weight models」为题进行了比较。
原因是在 Terminal-Bench 2.1 上:
dots3-note拿到了75.1分,而其他的美国开源模型都只拿到了70分左右🫡
更值得关注的是,dots3-note 本身并不是一个单纯针对 Coding benchmark 优化的模型。
它背后的研究问题是一个目前仍然没有得到充分解决的方向:
Long-horizon Agent
也就是能够在真实世界中持续数小时、数天甚至数月执行任务的智能体。
比如现实世界中的旅行规划、装修、长期研究等任务,往往持续数天甚至数月,同时存在意图逐步披露、环境动态变化、超长 trajectory、稀疏 reward 和 credit assignment 等问题。
为此,dots 团队引入 self-critique,让模型在任务过程中持续评价自身状态;同时提出 TEMPO,探索长程强化学习中更有效的训练方式。
团队还构建了 VibeSearchBench 和 VibeLifeBench,专门评估多轮需求理解和动态环境下的长期任务。
值得一提的是在VibeLifeBench目前的结果中,即使最强的一批模型,在这些真实生活长程任务上的绝对得分依然很低。
这可能也是为什么 dots3-note 最近会引起海外 Agent 社区的兴趣。
而且 note 目前还只是 dots3 系列中最轻量的版本。
按照小红书公布的规划,完整 dots3 系列还包括 jazz 和 aria。
真正值得观察的,是这套针对真实世界长程 Agent 的技术路线最终能走到什么程度。
目前dots3-note preview已经在官网免费提供
在hugging face、GitHub也已开源