XLeRobot · 学习 / 路线 · 2026-08-27

走向移动 bartender:
同类系统怎么泛化、怎么训练

skill decompositionobject-centricclassical navco-training

一个真实担心:如果要「取杯 → 走到另一处 → 按客人位置放下」,取放位置每次都不一样,现在这套端到端模仿会不会学不会?这一页先讲结论性的思路(我们自己的分析),再看 10 个真实系统怎么训练、追什么创新目标、给我们哪条可迁移教训。采集规范细节见 GOAL 文件 §43。

答案不是「录更多长轨迹」,是【拆成位置无关的可复用技能 + 独立经典导航】。

一、我们的思路(为什么拆)

二、10 个真实系统怎么训练的

1. ACT / ALOHA — 动作分块基线(你最接近的)

arXiv 2304.13705 · RSS 2023 · LeRobot 有实现

🔎 展开:为什么「最后 3cm 不准」可能是时域问题

模仿学习若一步一预测,每步的小误差会把机器人带到示范没覆盖的状态,越错越偏 —— 这叫误差累积(covariate shift)。最后 3cm 精度要求最高,误差在这里最显形(抖/漂/抓空)。所以「抓不准」可能不是「示范不够」,而是「顺序决策太多、误差滚雪球」。两味药:

① 逐步预测:每步一个决策 误差逐步累积(covariate shift) 目标轨迹 最后一段偏差最大 → 抖 / 漂 / 抓空 ② 分块(k≈100)+ 时序集成 决策点少 K 倍 + 重叠预测加权平均 同一时刻被多个块预测 → 加权平均 末端稳、准
图 · 上=逐步预测,误差累积、末端漂;下=动作分块一次预测一整段(决策点少 K 倍)+ 时序集成(重叠块对同一时刻加权平均),路径贴着目标、末端稳。这就是为什么「最后 3cm」先查 chunk 与集成,而不只是补数据。

2. Diffusion Policy — 更鲁棒的策略头

arXiv 2303.04137 · RSS 2023 · 代码

3. Mobile ALOHA — 和你终极形态最像

arXiv 2401.02117 · Stanford 2024 · 项目页

4. RT-1 — 大规模多任务、语言条件 BC

arXiv 2212.06817 · Google 2022

5. RT-2 — 视觉-语言-动作,借网络知识泛化

DeepMind blog · arXiv 2307.15818 · 2023

6. SayCan / PaLM-E — LLM 规划 + 有把握的低层技能

arXiv 2204.01691 · 项目页 · PaLM-E arXiv 2303.03378

7. Transporter Networks / kPAM — 对象中心、位置等变的取放

Transporter arXiv 2010.14406 · CoRL 2020 · kPAM: Manuelli 等, ISRR 2019

8. TidyBot / TidyBot++ — LLM 个性化 + 好用的移动底盘

TidyBot arXiv 2305.05658 · IROS 2023 · TidyBot++ arXiv 2412.10447 · CoRL 2024

9. HomeRobot / Stretch — 开放词汇移动操作,设计上就是模块化

arXiv 2306.11565 · Meta CoRL 2023 · 代码

10. LeRobot / SmolVLA — 你实际用的这套

arXiv 2506.01844 · HF 2025 · lerobot/smolvla_base

三、一条共识:为什么「拆」比「端到端」强

文献(HomeRobot 的模块化 OVMM、SayCan 的技能 grounding、Transporter/kPAM 的等变表示、Mobile ALOHA 的联合训练)收敛到同一个理由:每个子问题有各自天然的对称性和最便宜的监督来源,拆开后各自在它天然泛化的表示里解决。导航是 2D 度量地图/SE(2) 问题,经典 SLAM+规划零示范就稳、还能覆盖证明;抓取是物体位姿等变问题,关键点/热图表示几条示范就跨位置泛化。硬塞进一个 pixels→joints 网络,等于逼模型从遥操示范里重新学建图、避障、位姿不变性——恰恰是最费数据、最难泛化的部分——还把误差耦合起来:底盘一抖,抓取就崩。拆开还给你可单独测试的接口。

例外:紧耦合、富接触的底盘+手臂动作端到端能赢。规则=拆松耦合的缝,只把真正必须耦合的留一起。

四、对我们的落地(7 条)

排序不变:① 先把单个 right-pick 弄可靠(当前 0/N;先修时域/精度 + 对象中心 + 数据覆盖)→ ② 加 PLACE、拼 PICK→PLACE(边界连续)→ ③ 上 SLAM 导航 + 找人,扩成移动 bartender。移动是最后一层,不是现在搭。采集规范见 GOAL 文件 §43。

来源均经检索核对(2026-08)。kPAM 的 arXiv 编号未逐一核验,引用其标题/作者/会议(Manuelli 等, ISRR 2019)。RT-2 以 DeepMind 官方博客为准。