最近整理WAIC智启具身论坛任至意关于通用机器人策略的分享,有一个判断很值得记住:机器人的下一步,不只是增加任务数量,而是让同一个模型看懂不同任务、环境、本体和数据质量。于是AI的落地,从能够生成到能够推理,再到现在能够自主学习了。
图1
|通用策略要同时过两关
一条轴是能力广度,能不能换任务、换环境、换机器人;另一条轴是任务表现,成功率、速度和连续运行够不够好。会做十种任务,但每种都不稳定,不算真正通用;只把一个任务做到极致,也很难叫基础模型。
图2
|机器人需要读懂完整上下文
模型输入不能只有当前画面。历史观察、细粒度指令、未来子目标、机器人本体、数据质量和错误位置,都应该成为上下文。信息给得越完整,模型越不容易把偶然动作学成错误规律。
图3
|失败数据也有价值
机器人数据里既有成功示范,也有碰撞、洒落、卡住和人工恢复。重点不在于把“坏数据”全部删掉,而是标出哪里错了、为什么错、后来怎样恢复。模型知道数据质量,失败才能变成经验。
图4
|让真实执行反过来训练模型
模型进入真实环境后,会暴露训练集没覆盖的卡点。人类介入一次,系统就多得到一段失败与恢复轨迹。数据回流后再训练,成功率提高,无人运行时间变长,人工接管逐渐减少。这才是能转起来的数据飞轮。
图5
|跨本体迁移,迁移的是任务结构
同一项折叠技能,要能从低成本双臂机器人迁移到工业机械臂。模型不能死记关节轨迹,而要理解抓取、展开、对齐、折叠这些步骤,再根据新本体生成动作。
图6
|教机器人,不一定要逐帧遥操作
当低层策略足够稳定,人可以直接说“右手打开闸门”“左手拿起物体”。机器人自己完成动作,系统再用这些指令与轨迹训练高层策略。人的角色开始由控制每个动作,转为描述目标和步骤。
图7
|基础模型与真实场景一起迭代
通用模型进入家庭、仓库和工厂,收集成功、失败与接管数据,再反哺下一代基座。理想结果很直接:每代模型更强,下游需要的适配数据更少,新场景部署更快。
通用机器人最终拼的,不只是模型参数,也不是某一批漂亮Demo。它要能理解上下文、利用失败、迁移技能,并在真实工作中继续学习。
以下为广告部分:
买书么?自动驾驶的,机工社权威出版的,汽车行业高薪岗位,未来具身智能必备书籍