← 报告首页 / reports index
2026-09-04 · 文献清单 · GOAL-DEPTH-INTEGRATION §1

深度 + VLA:计划里引用的全部文献

这是 GOAL-DEPTH-INTEGRATION.md 第 1 节引用的十篇工作,按它们在我们计划里承担的作用分组。 每一条都附上「对我们的含义」——那是文档里原本就写下的判断,不是事后补的。

一、深度怎么进策略

这三篇决定了「深度信息以什么形式喂给模型」。结论直接推翻了我们原来的设想。

Point Cloud Matters: Rethinking the Impact of Different Observation Spaces on Robot Learning

arxiv.org/html/2402.02500v2

系统比较 RGB / RGB-D / 点云三种观测空间。

点云方法经常优于 RGB 和 RGB-D,尤其在泛化和低数据量场景。 原因:点云直接编码三维结构,把几何和语义特征分开。
对我们的含义:「把深度伪彩成第四路相机」是三种做法里最弱的一种—— 而我们原来设想的路线 B 正是这么做的。这条因此被改掉。

Towards Fusing Point Cloud and Visual Representations for Imitation Learning

arxiv.org/pdf/2502.12320

点云给几何,RGB 给纹理和语义,两者互补,融合优于任何单一表示。

★ Depth Helps: Improving Pre-trained RGB-based Policy with Depth Information Injection

arxiv.org/html/2408.05107v1 · 文档标注为「最贴合我们处境的一篇」

它解决的正是我们的问题:已经有一个 RGB 预训练的策略,怎么加深度而不重训主干。

它怎么做对我们的意义
RGB 主干冻结(ViT + projection 不动)SmolVLA 的 SigLIP 可以不动,避开「分布外输入毁掉预训练特征」的顾虑
加两个小模块:Depth Completion Module(cross-attention 从 RGB 预测深度特征)+ Depth-Aware Codebook(深度离散化,抗噪)只训这两个小模块
每个任务约 20 条真机轨迹我们有 30 集 —— 数量够
推理时可只用 RGB:63.15% vs 63.95%,只掉 0.8%部署更省事,深度只在训练时需要
提升 57.95% → 63.95%,长时程任务提升最大(约 12%)
论文自己说的注意事项:需要成对的 RGB-D 训练数据(我们有);三阶段训练(warmup / alignment / codebook); codebook 在某些任务类型上会掉点;真机实验用双相机,第三人称视角会让深度感知变难—— 而我们的深度相机正是装在头上的第三人称。

二、怎么锁定目标物体

文档的结论:没有人用「找最近的一团」这种手写规则。标准做法是开放词表检测 + 分割。

Grounded SAM(Grounding DINO → SAM)

playground.roboflow.com/models/idea-research/grounded-sam
近期的自主机器人如 MOKA 和 OK-Robot 都用 GroundedSAM / OwlViT 做视觉定位, 因为它们对语言表述的变化更鲁棒。这是当前的标准实践。
用边界框提示 SAM 得到物体实例掩码,作用在 RGB-D 上可以得到更精细的物体点云, 供下游的抓取位姿估计使用。
这正是我们缺的那一环:RGB 负责「哪个像素是杯子」(开放词表,换杯子不用改代码), 深度负责「那些像素有多远」,合起来得到杯子的点云 → 再算抓取位姿。 2026-09-04 更新:这一步所需的相机内参今天已经标定完成,这条路现在可以走了。

三篇相关的抓取定位工作

三、模块化感知 vs 端到端

Object Pose and Shape Estimation for Grasping: Does it Work?

arxiv.org/abs/2605.26944 · 2026-05-26 · Karke 等 · 限定平行夹爪、7-DoF 抓取、单视角 RGB(-D)
模块化方法(先估物体位姿和形状,再做对映抓取采样)在实验中优于端到端方法, 而且对端到端方法失败的小物体也能抓到。但效果取决于位姿估计的精度,在杂乱场景中会退化。
两面都要看。正面:「先定位再抓」这条路有实测支持,不是拍脑袋。 反面:它的上限被感知精度锁死;端到端因为是联合优化,反而不被单个环节卡住。 所以感知不做对,模块化路线的优势就不存在。

四、第三条路:物体候选框作为结构先验

既不是「手写规则算 3D 坐标喂进去」,也不是「端到端硬 train」,而是中间路线: 感知不进控制回路当规则用,只作为结构先验交给策略自己取舍。

VIOLA: Imitation Learning for Vision-Based Manipulation with Object Proposal Priors

arxiv.org/abs/2210.11339 · CoRL 2022 · UT Austin(Zhu / Joshi / Stone / Zhu)· 代码 github.com/UT-Austin-RPL/VIOLA
它怎么做论文实测
用预训练 RPN 拿一组通用(不分类别)物体候选框不用自己训检测器
transformer 策略在候选框上做注意力,自己挑任务相关的成功率比当时 SOTA 模仿学习高 45.8%
物体级结构先验对物体变化和环境扰动更鲁棒
真机长时程任务(摆餐具、冲咖啡)在实体机器人上部署过
它宣称解决的正是我们最痛的那一点:换个杯子、挪个位置就失效。 和 Grounded SAM 那条是互补不是替代:VIOLA 的 RPN 是类别无关的(「这里有个东西」)。

★ Oat-VLA: Focusing on What Matters — Object-Agent-centric Tokenization for Vision Language Action models

arxiv.org/abs/2509.23655 · Bendikas / Dijkman / Peschl / Haresh / Mazzaglia

VIOLA 用的是它自己的 transformer 策略。这篇是同一思路做在真正的 VLA 上。

论文原文
基座OpenVLA(Llama-2 7B + DINOv2 ViT-L/14 + SigLIP ViT-So400M/14,224×224)
物体 token 从哪来FT-Dinosaur,无监督物体中心模型(现成的,不用标注)
token 数256 → 16:7 个物体 token + 9 个 agent(夹爪)token,少 93.75%
收敛LIBERO 上「至少快一倍」
真机 pick-and-placeOat-VLA 29/49,OpenVLA 20/49
★ 我们对这篇做过两处更正,都记在文档里 ★
① 原本引用它的理由之一是速度:「SmolVLA 在 Jetson 上 146 ms/帧,视觉 token 是大头」。 2026-09-04 在本机实测:SmolVLA 是 1329 ms(146 ms 其实是 ACT 的数字被张冠李戴), 且三路视觉合计只占总耗时 13%(177.7 ms)。速度理由不成立,只剩结构先验这一条。
② 它报的真机 59% vs 41%,我们用它给的原始计数重算:29/49 vs 20/49,区间重叠, Fisher p = 0.106,不显著。所以我们引用它的方法,不引用它的成功率。

出处

全部来自仓库内 GOAL-DEPTH-INTEGRATION.md §1。 网页版全文:深度整合 GOAL(2026-09-03)。 本页只做汇总与链接,判断语句均为文档原有内容。