← 返回构建报告首页
XLeRobot · 模仿训练用在哪 · 2026-08-31

模仿训练到底用在哪,怎么让项目出彩

如果感知+编程就能抓起一个杯子,那还要模仿训练(IL)干嘛?这一页专门回答这个困惑:IL 不是用来"抓杯子"的, 它是用来做那些无法用几何/规则写出来的、有温度的行为。看完你会知道 IL 该点缀在哪几处、每处要多少数据、风险多大。 配套:系统架构与分工 · 讨论记录。 带 复现 的是他人已发表的真机结果,推断 是对本项目的推理。

一句话总纲:抓一个刚性杯子 → 用经典感知+编程(免数据、更稳)。 IL 留给交接的顺从、倒酒的手感、拟人的表现力、失败的恢复、多饮品的语义选择这些"编程写不出的软实力"。 IL 是项目的"出彩层",不是"地基层"。

1 · 一页看懂:IL 是什么,不是什么

模仿学习(Imitation Learning / Behavior Cloning) = 人来遥操作示范很多遍,网络学一个映射:"看到的画面(+机器人状态) → 下一步动作"。它不理解物理、不做规划,就是把示范里的"看到什么就怎么动"记成一个连续函数。

IL 是IL 不是
把"难以描述的手感/风格"从人身上拷进模型不是"越多数据越强"——脏乱、不一致的示范会互相抵消
省掉显式建模(不用写抓取几何/标定)不是"万能感知"——它认位置的能力其实弱于专门的检测器
天花板 = 示范的质量 × 覆盖不是"能自我超越"——那是强化学习(RL)的事
本项目的血泪教训:0826 那批 50 集实机 0/14 成功,败因不是"没学会看"(它确实跟着杯子调整), 而是最后 3cm 的极端修正没学到、模型回归到均值。结论写进了数据纪律:关键修正必须在示范里 大、多、必要、且风格一致 —— 15 集纪律严明 > 50 集风格混杂。详见 失败分析。

2 · 三条路再厘清(详版在架构页)

方式怎么泛化要你采数据擅长
① 写死坐标不泛化,挪一下就抓空不要——
② 感知+编程抓取靠实时感知:每帧重新看杯子在哪、什么形状不要(用别人训好的通用模型)刚性、位姿可测的物体
③ 模仿训练 IL靠示范覆盖:见过的分布内才行要,且要很多难建模的接触/风格/语义

仿真(simulation)是第三个轴——不是"怎么抓",而是"训练数据从哪来"(仿真里造数据/试错)。仓库结论是先别转仿真,见 仿真·RL·深度。

3 · IL 真正擅长的五类场景(配调酒例子)

IL 擅长为什么规则写不出调酒里的例子
柔顺接触 / 手感接触力/顺从很难解析建模,"轻一点""顶住"是隐性知识把杯子稳稳交到顾客手里、被轻拽时顺势松开
杂乱场景里"是哪一个"靠细微外观/上下文分辨,规则枚举不完吧台上多个杯子/瓶子,挑出"那杯要递的"
多步隐式策略中途要看着状态调整,分支太多边倒边看液面、快满了收手
不想搭感知栈用工程换数据:示范给它看,省掉检测+标定+抓取规划快速做一个"能用"的端到端 demo
泛化到列举不完的变化大模型从广数据里学到语义先验换了没见过的杯型/背景/光照仍大致能干

4 · ★重点★ 调酒机器人里,IL 能"出彩"的五个机会

下面逐条讲:为什么这里 IL 比编程更出彩、怎么落地、要多少数据、风险在哪。

(a) 柔顺人手交接 Compliant Handover 推断·高价值

为什么出彩:这是整台机器"有没有温度"的高光时刻——把杯子递到人手上、感到人接住了就松,动作柔顺不僵。纯规则能做但很"机械"。

(b) 倒酒的手感 / 收尾不滴 Pouring Flourish 推断·中价值

为什么出彩:脚本能"倒",但"漂亮地倒、收尾一提不滴落"是风格。少量示范能把这个"帅"学进去。

(c) 拟人表现力,联动情绪模块 推断·展示价值高

为什么出彩:看到顾客累→动作更轻柔缓慢;看到开心→利落带点花式。这把 情绪模块(§7) 和手臂动作连起来,是极强的 demo 记忆点。

(d) 学习式失败恢复 Recovery 推断·中价值

为什么出彩:滑了/碰歪了能自己重试,而不是卡死或摔。失败情形太多,规则枚举不完,正是 IL/RL 的地盘。

(e) 多杯型 / 多饮品语义选择 推断·扩展价值

为什么出彩:"给我那杯红的"——用语言条件挑对杯子/对应动作。这是 VLA/SmolVLA 的强项(你们现在的栈就是 SmolVLA)。

哪些出彩点最划算(排序)

机会出彩程度数据成本风险建议顺位
(c) 表现力(先参数化)高≈0低①先做
(a) 柔顺交接高小中②
(b) 倒酒手感中小-中中③
(d) 失败恢复中中中④
(e) 多饮品语义高大高⑤后期
结论:最划算的出彩顺序是 先"参数化表现力"(零数据、看着惊艳) → 再"柔顺交接"(少数据、有温度), 其余按需。把稀缺的采数据预算,只花在"编程真的写不出、又最能出彩"的地方。

5 · 补足知识点

BC vs RL 的根本区别

模仿/行为克隆 BC强化学习 RL
怎么学拷贝人示范自己试→拿奖励→改进
天花板= 示范质量可超过示范
代价要采示范要大量试错(真机慢、要样本高效)
本项目现状(ACT/SmolVLA)升级项 HIL-SERL:真机 RL,~1–2.5h 收敛到 ~100% 复现

三种 IL 策略的定位

数据纪律(最重要的一条知识点):关键修正要 大(幅度够)、多(次数够)、必要(真解决失败)、一致(风格统一)。 这不是玄学,是 BC 的数学本质决定的——策略学的是示范的平均,微弱/矛盾的修正会被平均掉,正是本项目 0/14 的直接原因。

6 · 混合架构怎么落地(省数据的关键)

不要让 IL 从像素里瞎猜位置。让感知先算好 3D 位姿,当输入喂给 IL——IL 只需学"给定位姿后怎么柔顺完成",数据需求骤降。

感知/编程层  ┌─────────────────────────────────────────────┐
(免数据)   │ 检测杯子 → 深度反投影 3D 位姿 → 人手 3D 位置 │
            └───────────┬──────────────────┬──────────────┘
                        │ 3D 位姿(当输入)   │ 目标点
                        ▼                  ▼
IL/技能层     ┌──────────────────┐  ┌──────────────────┐
(少数据点缀)│ 最后 3cm 柔顺闭合 │  │ 柔顺交接 + 松手   │
            └──────────────────┘  └──────────────────┘
                        │                  │
编排层        ┌─────────────────────────────────────────────┐
(脚本)      │ 导航(脚本) → 抓(感知+IL) → 倒(脚本±IL风格)    │
            │ → 移动(脚本) → 递交(感知+IL) → 放(脚本)        │
            └─────────────────────────────────────────────┘

两种最实用的混法:①位姿喂入(上图,最省数据);②分段接力:感知把手伸到杯前 3cm,IL 只接管最后闭合那一下。

7 · 各种情况的决策指南

任务性质用什么要不要采数据
刚性物体、位姿可测、只要"抓到"纯经典(感知+编程)不要
要"手感/风格/温度/表现力"经典 + IL 点缀少量、同风格
接触复杂、要超越示范、要自愈HIL-SERL(真机 RL)少量种子 + 真机试错
动作可几何描述(走/倒到定点)脚本不要
语言指定、多物体多指令VLA/语言条件 IL大(后期)

8 · 对你们的务实建议(排序)

  1. 先用经典感知+编程把"抓取"做可靠(路线 A,免数据)——正好解你们"采不到数据"的死结。
  2. 把深度录制 sidecar 建好——保证以后的示范自带深度,不被锁死路线。
  3. IL 只点缀出彩层:先参数化表现力(零数据) → 再柔顺交接(少数据) → 倒酒风格/恢复按需。
  4. 需要"自愈/超越示范"时再上 HIL-SERL。
  5. 仿真暂缓(见 仿真·RL·深度)。

9 · 诚实边界