暂无搜索历史
第 29 篇讲 Fully Async Policy:当 rollout 和 trainer 分开跑,吞吐、新鲜度和 off-policy correction...
第 28 篇讲 TransferQueue:它把 rollout 产物从 controller 返回值改成外部队列和 metadata,但 trainer 仍然...
第 27 篇把 data movement 拆成 DataProto序列化、driver 侧合并、Ray object 和 DataProtoFuture。第 ...
一页看懂 Kimi K3 的六个突破:2.8T 参数、896 个专家选择 16 个、百万上下文、2.5 倍扩展效率、MXFP4 与 MXFP8 低精度共设计、...
第 25 篇建立了一轮 RL step 的 profiling 账本:先看 perf/time_per_step、perf/throughput,再拆 timi...
第 24 篇把训练权重同步回 rollout,补上了 update_actor -> update_weights -> next rollout的闭环。闭环之...
昨天《训推工坊:以 verl 代码库走读 AI Infra》第 24 篇《Checkpoint Engine:训练权重如何同步给推理引擎》刚刚发布。今天是周日,...
第四组把视角推进到 worker 内部:actor/critic update 由训练 engine、micro-batch、sequence parallel...
第 23 篇把训练引擎推到 token 维度:长上下文让 Sequence/Context Parallel 进入 forward、attention 和输出恢...
第 22 篇把 mini-batch、micro-batch 和 dynamic batch size 拆开了:算法窗口、GPU 执行切片、token 重新装箱...
第 21 篇解释了 EngineRegistry和 BaseEngine如何把不同训练后端收进同一组 worker 合同。接下来最容易混淆的不是后端名字,而是 ...
第 19 篇和第 20 篇分别拆了 FSDP/FSDP2 与 Megatron/MCore。读到这里,很容易产生一个反问:既然两个后端差异这么大,为什么上层 t...
第 19 篇讲 FSDP/FSDP2:当一次 RL update 进入 worker 内部,训练状态怎样被参数、梯度和 optimizer state 的 sh...
上一篇:腾讯开源 CubeSandbox:当 AI 开始替你动手,Sandbox 就不再是可选项,从 AI Agent 进入办公和研发场景讲起,解释了 Cube...
第三组解释了 rollout 如何把 response 生产出来,第四组导读把问题推进到 worker 内部。本文从最常用的 FSDP/FSDP2 后端切入:当...
如果你第一次接触 AI Agent,可以先把 sandbox 理解成“给模型临时分配的一台隔离小电脑”。模型可以在里面运行 Python、Shell、测试命令,...
第三组把推理嵌入训练:response 不是训练脚本里顺手调用的一次生成,而是由 rollout service、backend adapter、KV cach...
上一篇把工具、sandbox 和环境反馈接回了训练信号。本文继续看这个设计的代价:一旦 rollout 不再是单轮补全,而是长 prompt、长 respons...
上一篇说明了 agent loop 为什么必须坚持 token-in/token-out:多轮轨迹里既有模型生成 token,也有工具 observation ...
当我们进入 RLHF、GRPO、Agent RL、多轮工具调用这些场景时,系统里同时出现了训练目标、数据流、controller、worker、reward、r...
暂未填写公司和职称
暂未填写个人简介
暂未填写技能专长
暂未填写学校和专业
暂未填写个人网址
暂未填写所在城市