现有调酒机器人把「把酒做出来」解决得很好。我们做的是另一件事:让制作过程本身值得看——而且这一版,手臂的动作是学出来的,不是录好的。
Makr Shakr 240 杯/小时、Cecilia.ai $45,000、Yanu 封闭机柜:为吞吐和一致性优化,并且做到了。整套装置围绕机器设计——杯子在固定夹具、瓶子在固定管路、动作走固定轨迹。
“The recipe database contains pre-programmed ratios, sequences, and pour volumes.”
“machine learning tracks popular combinations, personalizes suggestions, and adjusts pours based on historical data.”
会聊天的调酒机器人有了,会动的机械臂也有了,没有一台把两者放在同一个身体上,而且所有手臂都是录好的轨迹。杯子挪 5 cm,同一条轨迹就抓空。
同一时刻只跑一个阶段,跑的时候其余按钮全禁用。策略进程和脚本阶段都要占两条串口总线。
阶段之间手臂手里是有东西的,所以每一段退出时都保住力矩。松掉力矩,饮料就落地了。
故意不做。每一段之间都要有人看一眼——这就是逐段手动按钮的意义。每个实跑阶段都从头相机录像存档。

一家 DQ 门店,玻璃后面是 sharpa 的人形机器人。它只做一个产品——暴风雪。而且不能直接进去买:得在小程序上预约,下一周的号周五、周六 10:00 放。我们去的时候现场人满为患。
一种口味、55 步写死的流程、动作不是学的、也没有视线——它照样能排队,照样养得起自己占的那块地。「被看着的那 40 秒」值钱,这件事已经有人替我们证明了。它同时也是这条路的天花板:每次演的是同一出,机器人从不抬头看人。我们这版会看着客人,手臂的动作是学出来的,不是录下来重放的。
证据等级:我们自己 2026-09-12 现场拍的照片和视频——上面那条就是原始素材,招牌和屏幕文字是从画面里逐字抄的。「人满为患」「受欢迎」「赚钱」是当天的主观印象;没有记客流和营收数字,运营方也没有公开数据。
酒吧卖的从来不只是液体。人坐在吧台前,是因为那里有人、有表演、有交流。现有系统优化出酒速度,适合排队的地方;我们优化被看着的那 40 秒,适合精品酒吧、展会、门店。
热情、嘴快、有点傻气。一次只说一两句,话没说完手已经伸向杯子;去拿酒那段的台词,要拿客人点的那杯做文章。
调侃酒,不调侃客人。从不提价钱。
它会听客人闲聊——只是不陪你往云上飘。客人一开始抒情,它就把话拽回地面:「这不是一个哲学问题。」
冷、干、务实,但它一直在听。两个温度,同一个身体。
在这里,一个调酒师就是一个文本文件。换掉文件就是换掉调酒师,头上的行头跟着换。这就是同一台机器既能进精品酒吧、又能上展会展台,而不用重做任何东西的原因。
「看着客人」需要一个能转的视线和一张会变的脸。视线在迎宾和递出时看人,制作时锁死。
54 集示范里头部两个自由度标准差 0.0000——模型从没见过「视线在动」的画面。深度相机装在头上,头一动标定全废。
pan 范围 342–3754 由深度相机线缆决定;标准视角 cup-grasp-v0 = pan 2003 / tilt 2617,每次开跑先对头、看图确认。
右臂模型 09-08 实机 0/14。诊断:40 集示范里杯位覆盖失衡 16 倍(最密档 16 集,最疏档 1 集),模型学的是节奏不是视觉——闭爪时刻和杯位的相关只有 r = 0.16–0.26。

「差点要把杯子推出去,推之前调整了,非常聪明。」
「一开始有点把杯子往外推,但马上调整把它抓起来了。」
这就是闭环的样子:抓歪 → 看到 → 修正。一次完美运行证明不了什么;一次纠错证明它在看画面。
两条手臂加起来 49 次实机跑有记录。左臂 2026-09-09:28 次跑、4 种物体,最好配置 15/20。右臂 2026-09-11:在训练过的那只杯子上 6/6——然后同一个 checkpoint、没有重训,在从没训练过的杯子和杯位上 3/8、1/5,位置横跨 −40° 到 +14° 的八个档。
这三个数分开摆着,没揉成一个好看的平均数——这正是第 8 页那条计数规矩在起作用。而分开摆,它们才说出有用的事:熟的场景稳,生的场景是衰减不是归零,而且边界指得出来。跑通一次的机器人谁都能给你看。
当众把杯子挪 10 cm,让它重新找到。观众从头到尾的疑问是「这是不是提前编好的」,这一下回答完毕,执行成本为零。
训练集每帧一只杯、一句话。桌上放两只,它往中间伸(09-11 三次);指令加 yellow,轨迹变乱,目标不变。SmolVLA 4.5 亿参数、板子 7.4 GB,要教它「按词选杯」得重录再训一夜,而且没有先例保证学得会。

原则从「按颜色点名抹掉一只」改成「只保留一个,其余全抹」。桌上多一个干扰物,不该要改一次配置。
在 25 帧评测集上,我们 09-11 白天量的那套颜色阈值只检出 1/25。夜里桌面和杯子的饱和度一起掉到 10–30,颜色根本不再是可分特征。按「限定桌面区 + 相对桌面亮度」重做之后:15/25。
夹爪也不能按颜色排除——米色杯和橙色支架的色相带完全重合(都在 H 8–30),排掉橙色就等于把杯子一起杀掉。改成按位置排:两条手臂永远从画面左下和右下进来。
还有一条:本来打算拿「空桌底片」去盖干扰物,实测发现那张底片并不空——那个位置当初摆着一只绿杯,盖上去等于往画面里塞一只不存在的杯子。改用中位色填充:不依赖底片、不引入形状、跟着当前光照走。
选择不进模型。头相机画面里除了选中的那只杯,桌上其余杯状物全被抹掉、用框外一圈的中位色填回;策略看到的就是它训练过的单杯场景。
一帧 3.3 ms(424×240,CPU),控制周期的 3%。同一个 checkpoint 不动,换指令只换掩膜颜色。
小模型的泛化用在它擅长的「抓」上;「抓哪只」是个 3 毫秒的经典视觉问题,不值得一夜 GPU。
实测25 帧真实头相机画面、白天加夜间:09-11 那套颜色规则检出 1/25,重做后的检测器 15/25。新增两条通道——--mask-keep(只留一只,其余全抹)和 --mask-box(按位置抹掉矩形)。管线里已按订单切换跑通,3 ms/帧。左臂模型上 8 集探索显示它无论抹哪只都去蓝杯——左臂模型自带偏好,不能当测试台。未测选杯准确率——要在右臂模型上预注册「抹蓝抓黄 / 抹黄抓蓝」各 5 集,判据写死为「闭爪时 pan 落在目标杯一侧」。2026-09-12 那组对照实验不算数:抓取区里根本没有目标杯,两轮 held=0 是必然的,2% 的安全层差异也在单次试验的噪声量级。要有意义,得桌上同时摆一只目标杯和一只干扰杯,而且需要有人在现场摆。
团队在中国,机器人在芬兰。2026-09-11 整天的试跑、判定、数据记录都是远程完成的:面板起任务、操作者现场摆杯按确认、结果自动归档。



三个地点,一台机器人。手臂在赫尔辛基;起跑、判定、写记录的人在 7,000 公里外的杭州和台湾。这份 deck 上没有一件事需要有人坐飞机。
遥操作 → 示范录制 → 数据集 → 云端训练 → 自主执行 → 人接管。这一整环 2026-09-11 当天全部跑过。
VR 头显遥操作、主从臂录制(8781)、8770 面板试跑与控制。Tailscale 直连,随机器走。
一个远程团队可以同时照看多台机器:现场只需要一个人摆杯、按急停。
为什么要费这个劲。不是谦虚——是为了让有意思的那些话说出来有人信。第 5 页那三个数就是这套规矩的产物:6/6、3/8、1/5,分开摆着,而不是揉成一个既讨好我们、又什么都没告诉你的平均数。
双臂 + 可动头 + 三路相机 + 移动底盘。这块板子装不下 70 亿参数的模型——所以选 4.5 亿参数的 SmolVLA,把「选杯」这类问题交给 3 毫秒的经典视觉(第 6 页)。约束逼出的是更聪明的做法,不是更大的模型。
| 今天做不到 | 证据 | 下一步 |
|---|---|---|
| 桌上两只杯,它往中间伸 | 09-11 三次,trace 可查 | 掩膜路线 5+5 预注册;或补录 50 集带颜色指令 |
| 左臂模型只抓右侧那只蓝杯,不管看到什么 | 09-11 四种条件 + 抹图 8 集一致 | 颜色实验改在右臂模型上做;左臂补录带两杯的数据 |
| 右臂对别的颜色的杯子有点不认得 | 蓝 1/2、粉 0/1、绿罐 0/1:到位不闭爪 | 同上,或掩膜把它变回训练杯场景 |
| 按语言选杯 | 加 yellow 的 A/B,目标不变 | 同上 |
| 倒酒是脚本,液体不上台 | pour_cup.py,09-09 真机一次 | 接进状态机 POUR 态;演示用空杯 |
| 换桌子 | 桌高差 3 cm 策略作废 | 搬场地流程已写:肩轴到桌面复现到 ±1 cm |
| 左肩舵机过热 | 50 °C+ 欠力 6–7° | 换舵机后全套重标 |
这是承诺,不是愿望清单。下面每一条都写了「算不算做到」的判据,每个结果都会带日期和 k/n 发到公开报告站——做砸的那些也一样发。你不需要信我们的口头描述。
✓ 已经做到:迎宾 → 抓取 → 递出,一次连续跑、一个进程,中间没人碰过机器人,有不剪的录像。
50 集,黄蓝各半、位置对调,和单杯数据集一起训。判据:数据集公开,杯位五档的覆盖变异系数报出来。
判据、集数、void 规则在跑之前写死,然后按第 8 页的规矩判。判据:k/n 公开——6/6 还是 3/10,都上同一页。
倒酒进管线:POUR 状态 + pour() 执行器。现在可乐、芬达、雪碧、水是同一个物理动作的四个名字,这一步终结它。判据:至少两款两种以上配料、按配方依次倒的酒,端到端跑通并有录像。
同一配置连续跑 10 次,全程没人伸手;递出方向取自实测的人脸方位,不是写死的坐标。判据:这 10 次的 k/n 按同一套规则公开。
新场地走 10 步进场流程,从箱子到能跑 2 小时;谈成并到场至少一场鸡尾酒活动或酒吧周;当晚现场收反馈。判据:活动办成了,反馈整理成文公开、说什么发什么;一家有名有姓的场地书面说明「要满足什么条件才愿意摆进店里」。
不承诺成功率。第 8 页那套计数规则不会为了好看而改:k/n 按配置分组、绝不合并、void 的试跑写清楚并剔除、每条结论标证据等级。如果颜色指令那轮跑出来是 3/10,报告上就写 3/10,和 6/6 放在同一页。
这个区别决定了每一个技术选择:为什么动作要学出来而不是录好,为什么视线按阶段切换,为什么把「选杯」放在模型前面,为什么每个数字都标出处。
