按性价比排序。第 1 项五分钟,可能直接解释掉昨天的 0/3, 所以它排在所有事情前面。往下每一项都标了要多久、以及做完长什么样。
要改的两处,都在详情页:
| 昨天用的 | 明天改成 | |
|---|---|---|
| 任务指令串 | ...with the left arm. | Pick up the cup with the right arm. |
| speed | 0.3 | 1.0 |
| 时长 | 25 s | 40 s |
| chunk-rate | auto | auto(不变) |
杯子仍然放中段(120–175 mm),每次换一个杯位,顺序固定——和昨天一样, 这样两批数据才能直接比。
Pick up the cup with the right arm.
(查自 tasks.parquet)。SmolVLA 是语言条件模型,喂 left arm 等于给它一个从没见过的任务。远程量过现有 202 集的数据覆盖:右臂的横向范围只有 35°,标准差 5.15°—— 杯子位置一直集中在一个窄带里。模型没见过的位置,靠算法变不出来。
怎么放:把杯子放到比平时更左、更右、更近、更远的位置, 每个新位置录若干集。重点是横向(左右),那是覆盖最窄的一维。
用右臂,指令串用 Pick up the cup with the right arm.
——和现役模型的训练数据保持一致。
磨砂、透明、彩色各一只,位置不用变。换杯子和换位置是两件事: 同一个位置换一只杯子,需要的动作完全一样,变的只是画面。
录几集,另外每种杯子拍几张头相机的静态照片—— 远程这边要用它们评估检测器对不同外观的稳定性,那是纯离线活。
顺便回答一个问题:现有 202 集里到底用过几种杯子? 如果一直是同一只,模型很可能已经锁死在那只的外观上。
640×480 里,算出来是垃圾,而且不会报错。为什么要重拍而不是补:原生读出 848×480,640×480 是它的居中横向裁切(水平视场 69.7°),
424×240 是 2× binning(85.4°),1280×720 与 424×240 同视场
(2026-09-06 实测尺度 s=0.3330,等视场理论值 0.3312)。
生产里头相机跑的是 424×240。09-04 那次标在了三个模式里唯一被裁边的那个上,
所以那组内参按宽度比例缩到生产分辨率时差 32%。改标 1280×720,缩过去直接就对,不需要任何推导。
怎么拍:分辨率写死 1280×720,全部照片同一个分辨率。头停在 trial 位不动,
手持棋盘拍 15–20 张——覆盖画面中心和四个角、近和远、正对和明显倾斜(30–45°,肉眼一看就是斜的)。
板要占画面 30% 以上。细则见 棋盘格那一页。
影响范围:只影响 conversational_ai 那条线(人脸/杯子的角度和距离)。
SmolVLA 实机试跑完全不用内参,端到端只吃像素,所以这一项不挡跑测。
正确做法:
trial 位。已经修好的一点:这个按钮现在每拍一张会自动记录当时全部 17 个舵机的位置, 不用再担心「拍了但没记姿态」。
为什么排最后:手眼挡住的是视觉伺服、朝人递出、人身安全区, 这些都不是当前瓶颈。它不影响训练模型、跑模型、也不影响 B0 那条改进路线。
棋盘格下载页(含打印说明) ·
直接下载 PDF
打印三句话:普通白纸不要相纸、100% 实际大小不要「适应页面」、黑白最高质量。
印完贴硬板压平,再量 4 个格子把实测值告诉远程。
先花五分钟把指令串改成 right arm、speed 改成 1.0,跑 10 次。 这一件可能就解释掉昨天的 0/3。剩下的时间用来在更宽的杯位范围补录示范。 手眼可以不做。