同一把尺子量八个 checkpoint,四种 state 喂法。结论有两条,方向相反:横向(pan)那一列全是噪声,读不出任何东西;纵向(elbow)那一列差异明确,而且指向数据集。还有一条比数字更重要 —— 这把尺子已经被证明预测不了真机,所以它不能当上机门禁。
图像按集变化,覆盖整个杯位范围;只换 state 怎么喂。四种喂法:
| 喂法 | 含义 |
|---|---|
z0 | 17 维全零 |
pin | 钉住恒定维 —— 训练统计量里 std==0 的维度钉回训练均值。这是线上修复后的实际行为,主表用它 |
ref | 所有集共用一个真实 state(控制变量最严) |
per | 每集自己的真实 state(2026-09-08 修复之前的行为) |
斜率 = 输出 pan 对杯位 pan 的回归斜率。示范里应接近 +1:杯子左右移多少,手就跟多少。
pin 喂法| 数据集 · 臂 · 配方 | state | pan 斜率 | elbow 斜率 |
|---|---|---|---|
| 0826 · 右 · b16 · 20k | [6] | −0.006 | +0.861 |
| 0826 · 右 · b16 · 20k | [17] | +0.001 | +0.757 |
| 0826 · 右 · b16 · 12k · +dropout | [17] | −0.008 | +0.851 |
| 0826 · 右 · b16 · 20k · +dropout | [17] | −0.052 | +0.841 |
| 0820 · 右 · b8 · 20k | [17] | +0.006 | +0.271 |
| 0820 · 右 · b16 · 16k | [17] | +0.024 | +0.186 |
| 0820 · 右 · b16 · 6k | [17] | +0.002 | +0.376 |
| sep3-clean · 左 · 20k | [17] | +0.006 | −0.004 |
torch.manual_seed 之后跑的,说明那个种子并没有真正控制住采样,配对比较没有成立。policy.reset() 开始。而真机上横向对准发生在后面几十秒的闭环里。| 数据集 | elbow 斜率范围 |
|---|---|
| 0826(四个模型) | 0.76 – 0.86 |
| 0820(三个模型) | 0.19 – 0.38 |
| sep3-clean · 左臂 | −0.004 |
三倍以上的差距,跨四个模型稳定,远在噪声之上。 这是今天唯一一个可复现的跨模型差异。「伸多远」这一维,0826 确实教会了模型看图。
同数据、同配方、同 seed 的三个:
| 配置 | elbow 斜率 |
|---|---|
| state[17],不带 dropout,20k | +0.757 |
| state[17],带 dropout,12k | +0.851 |
| state[17],带 dropout,20k | +0.841 |
这曾经是个真实的担心:「伸多远」学得那么好,会不会有一部分是靠 state 撑着,一遮就塌。没有塌,四种喂法下都稳在 0.72–0.87。它是真视觉。
sep3-clean · 左 · 20k:杯位跨度 58.7°,它的 pan 输出只动 0.98°(敏感度 1.7%),elbow 斜率 −0.004。四种喂法全一样。离线斜率读不出东西,但实机 trace 读得出。trace_timing.py 从每次试跑的 trace 算三个数:
| trace | pan 行程 | 到位 | 闭爪 | 早了 | 开合次数 |
|---|---|---|---|---|---|
| 0826·state[6]·20k · T1 | 28.4° | 45.5 s | 6.7 s | +38.8 s | 14 |
| 0826·state[6]·20k · T2 | 24.6° | 24.5 s | 3.8 s | +20.8 s | 30 |
| 0826·+dropout·12k · T1 | 31.4° | 38.7 s | 4.5 s | +34.2 s | 8 |
| 0826·+dropout·12k · T2 | 33.6° | 31.7 s | 12.9 s | +18.9 s | 18 |
「早了」= 到达 pan 极值的时刻 − 闭爪时刻。正值 = 爪子先闭、手臂后到。
03-software/scripts/state_regime_sweep.py(四种喂法) · vision_sweep_phase.py(沿够取过程) · trace_timing.py(闭爪时机)run_policy_trials.py 的 install_state_guard() 同一判据 —— 否则不同模型之间不可比。