这是 GOAL-DEPTH-INTEGRATION.md 第 1 节引用的十篇工作,按它们在我们计划里承担的作用分组。
每一条都附上「对我们的含义」——那是文档里原本就写下的判断,不是事后补的。
这三篇决定了「深度信息以什么形式喂给模型」。结论直接推翻了我们原来的设想。
系统比较 RGB / RGB-D / 点云三种观测空间。
点云方法经常优于 RGB 和 RGB-D,尤其在泛化和低数据量场景。 原因:点云直接编码三维结构,把几何和语义特征分开。
点云给几何,RGB 给纹理和语义,两者互补,融合优于任何单一表示。
它解决的正是我们的问题:已经有一个 RGB 预训练的策略,怎么加深度而不重训主干。
| 它怎么做 | 对我们的意义 |
|---|---|
| RGB 主干冻结(ViT + projection 不动) | SmolVLA 的 SigLIP 可以不动,避开「分布外输入毁掉预训练特征」的顾虑 |
| 加两个小模块:Depth Completion Module(cross-attention 从 RGB 预测深度特征)+ Depth-Aware Codebook(深度离散化,抗噪) | 只训这两个小模块 |
| 每个任务约 20 条真机轨迹 | 我们有 30 集 —— 数量够 |
| 推理时可只用 RGB:63.15% vs 63.95%,只掉 0.8% | 部署更省事,深度只在训练时需要 |
| 提升 57.95% → 63.95%,长时程任务提升最大(约 12%) |
文档的结论:没有人用「找最近的一团」这种手写规则。标准做法是开放词表检测 + 分割。
近期的自主机器人如 MOKA 和 OK-Robot 都用 GroundedSAM / OwlViT 做视觉定位, 因为它们对语言表述的变化更鲁棒。这是当前的标准实践。
用边界框提示 SAM 得到物体实例掩码,作用在 RGB-D 上可以得到更精细的物体点云, 供下游的抓取位姿估计使用。
模块化方法(先估物体位姿和形状,再做对映抓取采样)在实验中优于端到端方法, 而且对端到端方法失败的小物体也能抓到。但效果取决于位姿估计的精度,在杂乱场景中会退化。
既不是「手写规则算 3D 坐标喂进去」,也不是「端到端硬 train」,而是中间路线: 感知不进控制回路当规则用,只作为结构先验交给策略自己取舍。
| 它怎么做 | 论文实测 |
|---|---|
| 用预训练 RPN 拿一组通用(不分类别)物体候选框 | 不用自己训检测器 |
| transformer 策略在候选框上做注意力,自己挑任务相关的 | 成功率比当时 SOTA 模仿学习高 45.8% |
| 物体级结构先验 | 对物体变化和环境扰动更鲁棒 |
| 真机长时程任务(摆餐具、冲咖啡) | 在实体机器人上部署过 |
VIOLA 用的是它自己的 transformer 策略。这篇是同一思路做在真正的 VLA 上。
| 论文原文 | |
|---|---|
| 基座 | OpenVLA(Llama-2 7B + DINOv2 ViT-L/14 + SigLIP ViT-So400M/14,224×224) |
| 物体 token 从哪来 | FT-Dinosaur,无监督物体中心模型(现成的,不用标注) |
| token 数 | 256 → 16:7 个物体 token + 9 个 agent(夹爪)token,少 93.75% |
| 收敛 | LIBERO 上「至少快一倍」 |
| 真机 pick-and-place | Oat-VLA 29/49,OpenVLA 20/49 |
全部来自仓库内 GOAL-DEPTH-INTEGRATION.md §1。
网页版全文:深度整合 GOAL(2026-09-03)。
本页只做汇总与链接,判断语句均为文档原有内容。