← 返回构建报告首页
XLeRobot · 讨论记录 · 2026-08-31

2026-08-31 讨论记录

这一页忠实记录当天与组员讨论中口述的情况与决定,尽量不加工。我的分析、判断与分工另起一页 —— 系统架构与分工 →。会变的状态(试验次数、模型有没有上机)以机器生成的 STATUS 为准。

TL;DR 主题:① 确认深度相机没进正常录制流程并要求补上;② 用专业判断把整套任务分成"要训练 / 能编程 / 要仿真";③ 递交杯子的语音放爪可行性;④ 头部情绪识别→推荐→语音反馈(队友 Ville 远程负责);⑤ 底盘 A→B 方案;⑥ 头部硬件(speaker、情绪小屏)待装。交付:记录成文档 + 我的分析,GitHub 与 Space 各一份、互链、挂主页。

A1 · 起点:深度相机没进正常录制流程

要求确认深度相机录制有没有被囊括进正常流程。核查结果:没有。 两条录制路径 (dashboard robot_server.py 与 leader-follower leader_follower_server.py 端口 8781) 都只录 3 路 RGB(左腕 / 右腕 / 头)。head_depth 被枚举但主动过滤 (robot_server.py:843 注释 "depth is not an RGB stream"),数据集特征硬编码 3 通道 (xlerobot.py:191)。深度目前只用于硬件在位检测和一个默认关闭的实验预览。

实测 深度相机现在就插在本机(lsusb: Orbbec Gemini 335;2.3.1:1.0 → /dev/video0)。 用自研 v4l2_depth.py 读取成功:Z16 · 640×480 · uint16 毫米 · 有效 93% · 153–65535mm · 中位 677mm。 深度采集不依赖舵机 —— 远程、舵机拔掉也能录、也能自测。

A2 · 目标与约束

A3 · 当前实验状态(口述)

A4 · 任务分工的初步判断(用户提出)

A5 · 递交杯子时的放爪

打算用语音触发:顾客拿到杯子后说一句(如"请某某某放开杯子"),机器人检测到就放爪。问可行性。 DIY 硬件里麦克风、speaker(及可能的语音接收硬件)都已经有了。

A6 · 头部情绪识别 + 推荐

想调用头部相机识别顾客情绪表情,据此给语言反馈,或判断推荐 A/B/C/D 四款酒里哪一种。 问:视觉→情绪→语言分析→结论跑在哪个硬件?Jetson 会不会负担太大?怎么减负?最现实的方式?这部分怎么训练? 这块由队友 Ville 远程负责(人在台湾,接触不到芬兰机器人),需要写清完整流程。

A7 · 头部硬件

机器人头壳已打印,但 DIY 的 speaker、以及反应情绪的小屏幕还没装。 需要找相关资料,给(可能加入的)硬件同学一份"应该做哪些内容"。

A8 · 底盘移动方案

让机器人从一个点移动到另一个点,要讨论出方案,好让本地硬件同学能做出来。

A9 · 对深度抓取的看法

在机器人黑客松见过用深度相机协助精准抓取的视频,认为这并不少见、应该很容易找到案例, 倾向于用"深度相机 + 深度图像分析"。

A10 · 交付要求

  1. 第一优先:把今天说的记录成文档。
  2. 在此基础上加我的分析、判断、整理。
  3. 在 GitHub 更新。
  4. 给一个 HF Space 链接:讨论整理成一页、我的分析列成新页、互相关联、挂到主页;GitHub 的相关文档在 Space 也各写一份。