← 返回构建报告首页
Pipeline · Leverage what we have · 2026-08-31

整条链路一张图:
现有能盘活到哪,突破点押在哪

没机器人、碰不到机械臂的当下,把已有的 40+50 段示范数据、已训的 ACT/SmolVLA 权重、笔记本能跑的视觉推理最大程度盘活。这页把整条链画出来,标清楚:现在离线就能做 / 要真机才能接 / 唯一真正靠模仿训练的核心段。

已有资产 / 编程可解 现在(笔记本/离线)就能跑 要真机(深度/闭环)才能接 核心突破 · 靠模仿训练
flowchart LR
  subgraph PER["感知 Perception"]
    A["头/腕 RGB 相机"] --> B["YOLO 认杯子
→ 框(u,v)"] C["深度相机 Z16"] --> D["反投影
→ 杯子 3D 坐标"] B --> D end subgraph GR["抓取 Grasp"] S[("示范数据
40+50段·3×RGB·无深度")] --> RB D -. 可选:喂坐标降数据量 .-> RB["路线B 模仿策略
ACT / SmolVLA"] D --> RA["路线A 编程运动
(免训练)"] RA --> G["抓起杯子 PICK"] RB --> G end G --> H["运送到顾客侧
(感知+编程)"] H --> R["语音放爪
ASR → 开爪"] A --> E["情绪→推荐→TTS
(Ville · 云)"] BASE["底盘 A→B
里程计+AprilTag"] -.-> H classDef ready fill:#e6f5e6,stroke:#0ca30c,color:#064006; classDef blocked fill:#fbeecd,stroke:#b8860b,color:#3a2c00; classDef core fill:#f7dcd7,stroke:#c0392b,color:#5a130b,stroke-width:3px; classDef have fill:#e2edfb,stroke:#2a78d6,color:#08306b; class A,B,E ready class C,D,H,R,BASE blocked class RB,G core class RA,S have

绿=笔记本/离线现在能跑 · 蓝=已有或纯编程 · 黄=要真机才能接 · 红=唯一真正靠模仿训练的核心。虚线=可选/外部触发。

一、盘活清单:没机器人也能推进的三件事

你手上其实已经攒了不少东西,只是没接起来。下面每一行都是笔记本离线就能干、直接用上现有数据/模型的:

你手上的资产现在(离线/笔记本)能做什么它告诉你什么缺什么才完整
40+50 段示范数据
(3×RGB, 无深度)
用 lerobot 可视化逐段回放审数据质量;把 YOLO 过每一帧,看当时"认不认得出杯子" 示范一致不一致("偏右/上冲"是不是数据里就有);YOLO 在你真实场景的命中率 数据里没有深度——深度→3D 这半段只能上真机补
ACT / SmolVLA 权重
(已训 2 万步, 未验证)
开环离线评测:喂录制的观测帧 → 模型出动作 → 和示范里人做的动作逐帧比对 模型到底有没有"学进"训练数据。误差大=连示范都没拟合(欠拟/坏);误差小但真机失败=记住了不泛化 闭环执行、真"抓起来"要真机+机械臂
笔记本 3060 视觉 YOLO 认杯子(摄像头/图片/录制帧);把感知→坐标这条经典链在离线先搭好、单测好 "认什么"这一步就绪,等真机深度一到就能接成 3D 坐标 深度→3D 的最后拼接要机器人的深度相机在线

这三件事对应的脚本我照 laptop-gpu/ 的模式写好推上来,你回家 git pull 直接跑即可。

二、要打通的"接缝"——技术突破就押在这几个衔接上

链路的每个方块大多是现成的(YOLO、深度测距、编程运动、TTS 都是成熟件)。真正的活儿、也是出彩点,全在方块与方块之间的接缝:

接缝两头现状怎么打通性质
① 认杯子框 → 深度 → 3D 坐标
(感知→坐标)
YOLO 有了、深度测距有了,中间没对齐 相机内参 + RGB/深度对齐 + 做一次手眼标定 突破点·工程
② 3D 坐标 → 抓取动作
(坐标→动作)
路线A 用编程;路线B 把坐标喂给模仿策略当先验 先拍板走 A 还是 B(见 架构页 B4) 岔路·需决策
③ 抓起杯子 PICK 本身 ACT/SmolVLA 训了但0 次验证成功;症状:偏右、上冲太快 唯一真正要靠模仿训练打磨的一段;关键是把示范分布修对(大、多、必要、一致),不是加深度 核心突破·模仿训练
④ 运送 / 放爪 / 情绪 / 底盘 都是编程 + 成熟件 不阻塞、不训练,按模块各自做 编程即可

三、重心押哪:核心真正要"模仿训练"的只有一段

核心 = 只有"PICK 抓起杯子"这一段值得砸模仿训练。整条链里其它全是感知+编程能解的成熟件; 唯独"手怎么对准、下爪、握住"这种接触细节,规则难写清、示范能直接教——这才是模仿该上、也是当前卡住(偏右/上冲)的地方。 而它现在失败,诊断指向示范数据分布(修正要够大、够多、够一致),不是"缺深度"。
没机器人的当下,重心 = 把三件离线事盘活: ①用 lerobot 审那 40 段数据到底教对没有;②对 ACT/SmolVLA 跑开环离线评测,看模型学进去没有(这一步不用真机、不烧租 GPU); ③在笔记本把 YOLO 认杯子 + 感知→坐标经典链先搭通单测好。真机一恢复,直接接闭环。

四、要不要仿真?——现在不做

结论:现在别搭仿真。把机器人+杯子+标定过的相机搬进 Isaac/MuJoCo 是好几周的坑,而接触密集的抓取"仿真→真机"迁移本身就是研究难题。 你的瓶颈是真机访问不是缺算力,任务又短。离线评测 + 数据审查 + 视觉链能用 5% 的力气拿到 80% 的"搞清为什么失败并改进"。 仿真留到"要大批量造合成数据 / 要练长程运动"时再说,见 sim 策略页。

五、笔记本上要配的环境(除了 laptop-gpu 那套)