← 返回:仿真 · RL · 深度 总览
XLeRobot · 深度研讨 / C 段展开 · 2026-08-28

深度相机抓取:
材质决策 · 手眼标定 · 抓取管线

RGB-DD405Contact-GraspNetArUco/AprilTaghand-eye

这是总览页 C 段「深度相机」那张卡片的展开:把「什么材质走哪条」「抓取检测选哪个」「一次性标定怎么做」「怎么接进 IL」讲清楚,配两张图。核心不变:深度出一个位置无关的 6-DoF 抓取位姿送臂,IL 只管最后柔顺闭合。

塑料杯=深度直接可用;磨砂也友好;只有透明反光才需贴标记兜底;高脚杯抓杯身不抓脚。

① 材质 → 方案(决策树)

目标物体 透明 且 反光? (玻璃 / 亮面) 是 贴 ArUco/AprilTag → 6-DoF 位姿 免疫透明 · 玻璃兜底(或 ClearGrasp) → 彩色透明高脚杯 否 · 不透明/漫反射 是高脚杯?(细杯脚) 是 深度可用 但抓杯身,不抓脚 · → 磨砂高脚杯 否 · 塑料/磨砂杯身 深度 → Contact-GraspNet 类 → 6-DoF 位姿 ★ 你现在的塑料杯走这条(最直接)
图 1 · 材质→方案决策树。绿色=推荐主路(不透明/漫反射→深度直接出抓取位姿),塑料杯与磨砂高脚杯都走这里(高脚杯抓杯身);虚线=透明反光才用的标记兜底。失效因素是「透明+反光」,不是颜色。

ClearGrasp · ArUco · AprilTag · 深度失效于透明/镜面(非颜色):Intel RealSense 透明表面说明 ↗

② 抓取检测选哪个(能不能在 Orin Nano 上跑)

Contact-GraspNet · GraspNet-1B · Dex-Net · VGN/GIGA/SceneGrasp

方法 是什么 / 硬件 适合我们吗
Contact-GraspNet 从原始点云直接出 6-DoF 抓取分布,杂乱场景 >90%。要约 8GB 显存、约 4FPS;有 PyTorch 移植 + Jetson 的 TensorRT 转换。 能力最强,通用。Orin Nano 上要 TensorRT 调优才跑得动 —— 起步偏重。
VGN / GIGA 体素化抓取网络,约 22FPS;比 Contact-GraspNet 轻。 更适合边缘算力,想要「学习式但轻」时的中间选项。
质心 + PCA 启发式 非学习:对已知的杯子,点云求质心 + 主轴,直接推顶部/侧向抓取位姿。几乎零算力。 ★ 最省、最快落地。你只抓「杯子」这一类规则形状,先用这个验证整条链路,再谈换学习式网络。

建议:先用「质心+PCA」把链路打通(相机→点云→位姿→送臂→IL 闭合),证明标定和接口对了,再按需换 Contact-GraspNet/GIGA。别一上来就上重网络。

③ 一次性手眼标定:外参 T 是那座桥

① 一次性:手眼标定 → 外参 T(相机→臂) T 用在这一步 RGB-D ② 运行时 检测 6-DoF 位姿·相机系 Contact-GraspNet / 质心+PCA ×T 位姿·臂系 预置 + IL 闭合 SmolVLA
图 2 · 标定只做一次,产出外参 T;运行时把相机系里检测到的抓取位姿乘 T 换到臂系,再预置爪子、由 IL 做柔顺闭合。T 就是连接「视觉」和「运动」的那座桥。

OpenCV calibrateHandEye · easy_handeye · MoveIt Calibration

术语别搞混 ——「transform」在本项目里指过四个完全不同的东西: ①外参 T(本页 Fig 2 这个:相机系→臂系的坐标变换);②Transporter Networks(②层的一种对象中心抓取方法);③Transformer(③层 SmolVLA/ACT 的神经网络架构);④图像 transforms(③层训练时的数据增强算子)。名字像,层次和作用全不同。

④ 硬件:为什么是 D405

RealSense D405

★ 现状(查了你自己的代码/文档):你已经有深度硬件,但没在录。

来源:robot_server.py:79–154(CAMERAS / cameras_record_arg)· SETUP.md(Orbbec Gemini 335 · /dev/video4 Z16 · 67% 有效)· SAFETY.md §5(深度 deferred)· 03-software/scripts/v4l2_depth.py。

⑤ 怎么接进 IL(以及排序)

来源均经检索核对(2026-08)。抓取网 FPS 数字来自二手汇总、为近似;「磨砂友好」是漫反射-镜面物理的推论(强支持,非逐字规格),建议在实物上验证。

⑥ 在我们目标 + 机子上:工作量 + 调试清单

A. 要准备的东西

项内容说明
深度相机RealSense D405(近距 7–50cm)腕装;桌面抓取的对的档位
标定板ChArUco/ArUco 靶(打印即可)做手眼标定用
抓取检测先用「点云质心+PCA」已知杯子够用;要更强再换 Contact-GraspNet(预训练权重)
训练数据0 条几何法不靠学习,不用采数据(这是它比 IL/HIL-SERL 省事的地方)

B. 哪些本地、哪些能远程

这条路几乎全在本地 —— 因为它是确定性的、运行时的,没有「训练」环节,所以没有远程 GPU 的活(和 IL、Isaac 不同)。

C. 怎么跑测

D. 调试 TODO(照做)

  1. 装 D405(腕部),接好、确认能出 RGB-D。
  2. 打印 ChArUco 靶,用 easy_handeye / MoveIt 采 ≥5 个位姿做手眼标定,得外参 T。
  3. 验 T:让爪子触已知点,误差几毫米内才算好。
  4. 取点云,写「质心+PCA」出一个顶/侧向抓取位姿。
  5. 用 T 把位姿换到臂系,预置爪子,最后闭合交给现有策略(或先手写闭合)。
  6. 不同杯位测 20–30 次;不行再考虑 Contact-GraspNet。

E. 坑(诚实标注)

← 返回总览:仿真 · RL · 深度 —— 整体学习策略架构