这一页忠实记录当天与组员讨论中口述的情况与决定,尽量不加工。我的分析、判断与分工另起一页 —— 系统架构与分工 →。会变的状态(试验次数、模型有没有上机)以机器生成的 STATUS 为准。
要求确认深度相机录制有没有被囊括进正常流程。核查结果:没有。 两条录制路径
(dashboard robot_server.py 与 leader-follower leader_follower_server.py 端口 8781)
都只录 3 路 RGB(左腕 / 右腕 / 头)。head_depth 被枚举但主动过滤
(robot_server.py:843 注释 "depth is not an RGB stream"),数据集特征硬编码 3 通道
(xlerobot.py:191)。深度目前只用于硬件在位检测和一个默认关闭的实验预览。
lsusb: Orbbec Gemini 335;2.3.1:1.0 → /dev/video0)。
用自研 v4l2_depth.py 读取成功:Z16 · 640×480 · uint16 毫米 · 有效 93% · 153–65535mm · 中位 677mm。
深度采集不依赖舵机 —— 远程、舵机拔掉也能录、也能自测。打算用语音触发:顾客拿到杯子后说一句(如"请某某某放开杯子"),机器人检测到就放爪。问可行性。 DIY 硬件里麦克风、speaker(及可能的语音接收硬件)都已经有了。
想调用头部相机识别顾客情绪表情,据此给语言反馈,或判断推荐 A/B/C/D 四款酒里哪一种。 问:视觉→情绪→语言分析→结论跑在哪个硬件?Jetson 会不会负担太大?怎么减负?最现实的方式?这部分怎么训练? 这块由队友 Ville 远程负责(人在台湾,接触不到芬兰机器人),需要写清完整流程。
机器人头壳已打印,但 DIY 的 speaker、以及反应情绪的小屏幕还没装。 需要找相关资料,给(可能加入的)硬件同学一份"应该做哪些内容"。
让机器人从一个点移动到另一个点,要讨论出方案,好让本地硬件同学能做出来。
在机器人黑客松见过用深度相机协助精准抓取的视频,认为这并不少见、应该很容易找到案例, 倾向于用"深度相机 + 深度图像分析"。