}


一台机器人为了分快递,真的需要两条腿和十根手指吗?

最近,自变量把一台双臂机器人放到传送带前,只给它装上工业里最常见的标准夹爪,面对一批大小、重量、材质和朝向完全随机的真实物流包裹。


连续一小时直播中,它完成了 1816 件有效分拣。按照短时吞吐量计算,超过了 Figure 03 此前连续运行 200 小时留下的 1248 件/小时标杆,幅度达到惊人的45%。

两家公司看似在做相同的任务,硬件配置却采用了不同的路线。Figure 03 拥有完整人形身体与五指灵巧手;自变量去掉了分拣用不到的腿和手指,把任务交给两条机械臂和夹爪完成。据公开信息,自变量所用方案的成本下降了70%,分拣准确率则超过98%。。


所以在观看这场直播的时候,APPSO 发现除了比拼谁分拣得更快更多,还有一些更值得关注的重点:当模型开始理解重量、摩擦和惯性,机器人或许可以少买很多昂贵的身体,在产业落地的速度也会快得多。

每小时 1816 件,机器人为何这么快

分拣任务看似简单,却蕴含着人类通过千百年进化习得的能力,这些能力对于具身智能并非理所当然。

机器人要完成物流分拣,需要先识别包裹的大小、形状、材质和摆放姿态,判断从哪里下手、使用多大力度,再规划机械臂的移动路径。遇到快递面单方向错误的包裹,则要完成翻转和重新摆放。

自变量这次直播里的包裹,也没有统一规格。纸箱、软袋、圆柱形快件和泡沫封装生鲜件混在一起,大小、重量和朝向也是完全随机,基本还原了物流仓库里人工处理的杂乱状态。


配备通用具身智能大模型 WALL-B 的机器人会根据每个包裹的属性,临时选择不同的处理方式。

当它面对体积小、重量轻的快递袋,一只夹爪便会直接抓起并快速搬运。如果遇到尺寸更大的纸箱,它会切换到双臂协作,用两只夹爪共同托住箱体,或者从侧面将它推向目标位置,避免强行抓取造成损坏。

调整面单时,它也可以根据包裹的属性,选择不同的动作。小件和轻件可以利用惯性快速翻转;重箱则被分成几个动作,逐步改变姿态。面对容易变形的衣物软包,机器人会先拨开、摊平,再校准面单方向。

机器人需要实时感知每一个包裹,再根据物体状态调整动作。整个过程连续运行,没有人工介入兜底,也没有故障停机。


两个标准夹爪能够处理如此多变化,关键在于其背后的模型。

更简单的手,配上更聪明的大脑

很长一段时间里,提高机器人能力最直观的办法,是增加硬件自由度。

通过增加更多的关节和传感器,来让机器人抓得又牢又稳;面对更复杂的奇形怪状物体,就换上自由度更高的五指灵巧手;而如果想要让机器人更好地进入人类工作的空间,双腿和完整的人形身体,几乎是必不可少的硬件配置。

自由度越高,机器人能够完成的动作仿佛越多,但随之增加的还有硬件成本、控制难度和故障概率。


一只五指灵巧手里包含大量精密关节、驱动器和传感器,需要持续进行校准和维护。当把它放进需要 7×24 小时运转的仓库,机器人身上每多一个零部件,都可能变成一个新的故障点。

自变量选择的是另一条路线:把更多复杂度放进底层模型,让硬件保持简洁。

2026 年 4 月,自变量发布 WALL-B。区别于 VLA 模型拼接视觉、语言、动作模块的思路,它采用 WUM,也就是世界统一模型架构,将视觉、语言、动作以及对物理变化的预测放在同一个网络中联合训练。


模型既要决定机器人下一步怎样动,也要预测这个动作会让周围物体发生什么变化。

用软包装来理解就很直观,机器人看见夹爪合拢还不够,它还要预判这个软袋子会不会从中间滑走。从侧面推箱子时,WALL-B 会估计箱子会平移、旋转还是翻倒。

按照这套思路,预测结果会继续影响动作,机器人可以改变夹取位置,换成双臂托举,或者借助工作台和惯性完成翻面。


夹爪少掉的自由度,正依靠自变量的 WALL-B 模型用更聪明的策略补回来。

这对模型本身提出了更高要求:夹爪开口、摩擦力、机械臂负载、摄像头位置和力控精度,依然决定机器人能够处理哪些物体。WALL-B 改变的是硬件的使用方式:过去只执行固定动作的夹爪,如今可以根据包裹状态,组合出夹、推、拨、摊和双臂托举等策略。

模型用更大的决策空间补足一部分机械自由度,也让标准硬件拥有了处理随机场景的能力。

Figure 和自变量各自都在硬件上做了取舍。Figure 选择完整人形本体和灵巧手,为移动、使用人类工具和精细操作保留更多可能;自变量在物流工位前采用双臂和标准夹爪,希望模型把有限的硬件能力用得更充分。

自变量自己也在做灵巧手,在 2025 年曾发布过单手 20 个自由度的五指灵巧手。


而这次选择用夹爪其实更多是从实际应用的角度去考虑,对长期守在传送带旁的机器人来说,仓库没有必要为走路、保持平衡和十根手指付费。

用「模型进步」取代「硬件堆叠」

自变量最早选择的落地场景其实是家庭。这也是具身智能应用的「终极考验」。

与目标和流程相对明确的物流工位相比,家庭任务更加分散,环境变化也更频繁:衣服会被随手扔在沙发上,杯子和餐盘的形状各不相同,抽屉里堆满杂物,同一项家务每天面对的物体与摆放位置都可能变化。

机器人很难依靠提前写好的程序覆盖所有情况,只能在真实环境中不断观察、判断和调整动作。


自变量也成为全球首个将具身机器人规模化带入普通家庭的企业。WALL-B 此前已经在真实家庭场景中进行验证和迭代,这次物流分拣,可以看作同一套模型能力向工业场景的自然延伸。

进入仓库后,机器人面对的物体从衣物、餐具和生活用品换成了纸箱、快递袋和生鲜件,底层任务依然相通:识别物体状态,理解空间关系,预测动作结果,再选择合适的操作方式。

当同一套模型跨越家庭与工业,积累下来的视觉理解、空间推理和物理预测能力也能继续复用。家庭可以使用更精细的灵巧手,仓库可以选择更耐用的标准夹爪,工厂则能将机械臂直接嵌入现有产线。

模型保持通用,身体按照任务选择。


这种复用首先改变的是新场景的开发成本。过去,机器人每进入一条新产线,都要重新采集数据、设计动作、匹配硬件,再进行漫长的现场调试。现在,模型更像是一个「通才」,可以把第一条产线积累的能力带到其他产线,后续的适配工作大幅减少,集中在硬件适配和流程调整上。

当一套方案能够从一个工位复制到十个、上百个工位,企业关心的问题也会从「它能不能完成任务」,继续推进到每小时能处理多少件、需要多久部署、运行中会出现多少故障,以及多长时间能够收回成本。

或许只有当单个工位的投入、持续吞吐、维护成本和回本周期进入可接受范围,机器人才能从一次项目交付走向规模采购。

而决定企业是否大规模采购的这条成本线,就是具身智能商业落地的「斩杀线」。

具身智能的「DeepSeek 时刻」

具身智能想要跨过这条斩杀线,需要同时满足两个条件:机器人已经拥有足够强的能力,这些能力也要以足够低的成本进入真实场景。

这也是自变量此次反超 Figure 更值得关注的地方。

两个月前的 Figure 03 用一场持续 200 小时的直播,证明人形机器人已经可以长时间站在仓库里工作。这次,自变量则进一步证明,只要模型足够聪明,复杂的任务也可以交给一套更简单、更便宜、更耐用的身体。

每一次,都是推动整个具身智能行业向产业落地更进一步。人们离「科技改变生活」的美好未来不再那么遥远。

硬件成本、部署周期和长期维护费用随之拥有了进一步下降的空间,机器人也更容易从一次直播演示,走进一个真实工位,再复制到整座仓库。


2024 年底,自变量发布第一代端到端具身基础模型 WALL-A;此后,机器人陆续进入养老院和真实家庭,完成折毛巾、整理桌面、收纳杂物和基础清洁等任务。

2026 年,自变量与 58 到家推出可以直接预约的智能保洁服务。机器人与保洁员共同上门,在约三小时的服务中负责客厅收纳、摆放鞋子、清理垃圾和擦拭桌面等家政服务,成为全球首个规模化进入普通家庭的具身企业。这也是机器人第一次走下舞台、大规模进入「寻常百姓家」。

WALL-B 就在这些随机、碎片化的环境中验证和迭代。

家庭场景提供的技术积累,也成为这次物流分拣的基础。同一颗机器人大脑,可以从家庭流向仓库,也可以根据任务换上一副更简单、更便宜的身体。


这和 DeepSeek 给大模型行业带来的变化有点类似。DeepSeek 曾用更低的成本交付足够强的模型能力,自变量则把这条路线带进了物理世界:让模型承担更多复杂度,让硬件只保留具体任务需要的能力。

过去,人们判断一台机器人是否先进,经常看它能不能跑半马、完成精细手工,或者做出几个令人惊讶的动作。进入真实产业后,所有能力最终都要被换算成四个数字:效率、成本、稳定性和复制速度。

未来的机器人或许没有更像人,但会变得更像一个用户愿意买单的伙伴。