四年不发新品的小米机器人,在做什么?

作者 | 肖恩

编辑 | 德新

如果不是最近发布的几段工厂测试视频,很多人对小米机器人的印象,可能还停留在2022年。

那年8月,雷军把CyberOne带上发布会。几分钟的亮相里,它和雷军完成了一段简单互动,最后以送花、扎马步合影收场。这是小米第一台全尺寸人形机器人,它还有一个更为人熟知的名字——"铁大"

那也是CyberOne迄今为止最后一次登上小米的发布会。此后四年,小米更新过机器狗CyberDog,但CyberOne的下一代却始终没有出现。

但在小米机器人几乎销声匿迹的四年间,国内具身智能行业发生了翻天覆地的变化。

2024年5月,公开统计的人形机器人本体企业只有50多家。不到两年,国内具身智能企业已超过230家,其中人形机器人企业超过150家。仅2026年上半年,这条赛道就发生了322笔融资,总额935亿元。

人们再次看到小米的人形机器人,是在2026年3月了。在小米官方发布的一段工厂测试视频中,机器人正在给汽车中控台安装左右两侧的自攻螺母,连续运行3小时,每次安装用时76秒,成功率90.2%。7月,小米又公布了一次测试结果,成功率提高到98%,同一工位上,人工的成功率是99%。

行业狂奔的四年里,低调的小米机器人,做了什么?

一、硬件迭代,从灵巧手开始

CyberOne能查到的完整参数,至今停留在2022年。这些年,小米很少披露这台机器人在整机层面的更新。直到今年,才对其中一个部件做了完整介绍:重新设计的五指灵巧手。

2022年亮相时,CyberOne的手臂末端还是一套两指夹爪。从结构上看,那更像一只做成手部轮廓的末端夹爪,与今天通常所说的多指灵巧手并不是一回事。

为什么第一个被拿出来讲的是手?答案在工厂的视频里——无论是安装自攻螺母,还是分拣尺寸更大、形状不规则且容易变形的中控台侧盖板,机器人都要随时调整抓取的位置和力度。一套固定开合的普通夹爪,很难胜任。

小米对这只手的改造,围绕三件事展开:尺寸、触觉和散热。

先是把它缩到接近人手大小。人手采集的操作数据,最终要交给机器人复现,机械手的尺寸和构型越接近人手,这些数据越容易迁移。优化版从228×105×64毫米,缩小到187×88×36毫米,体积压缩约60%,总自由度反而提升了50%,主动自由度提升83%。

其次是触觉。抓握时物体常被手指和手掌挡住,仅靠相机很难判断它有没有滑动、哪里受力更大。当时很难找到能覆盖全掌的仿生手方案,小米换了个思路:把传感器做成一层触觉手套,约8200平方毫米的传感区域覆盖指尖、指腹和掌心。

机器人戴上它,能感知抓握时的压力变化。人戴上它,可以直接采集数据,比遥操作更快,手套磨损后,还能单独更换。

由于在更小的手掌里塞进了更多电机,长时间重载作业带来了散热问题。小米在前臂加入金属3D打印的液冷通道和微型泵,再通过仿生"汗腺"蒸发散热,散热能力约每分钟10瓦。

硬件之外,触觉数据还需要模型来"读懂":压力变化与手指关节、手腕位置之间是什么关系,下一步该怎么动。

小米机器人团队研发的TacRefineNet,从抓取的最后一步切入:物体已经在手里,只是位置有偏差,能不能单凭触觉把它调整到目标姿态?

模型先记录一次理想抓握时五个指尖的压力分布,作为目标,机器人再次抓住物体后,比较两次压力的差别,判断手腕该往哪个方向移动、转动多少,随后松开手指、调整手腕、重新抓握。这个过程最多重复五次,让物体的姿态逐渐逼近目标。

训练完全在仿真中完成。小米在MuJoCo仿真平台中搭建了五指手和触觉传感器,用薄板、圆盘、细杆三类共15个物体生成了15.6万条触觉样本,模型不经真机数据微调直接部署。真机测试中,已见物体的固定目标成功率为80.7%,五轮调整后,平均位置误差约5.2毫米、角度误差约3.5度,明显优于先估计物体绝对位姿、再计算调整量的传统做法。

这些积累,在7月的测试视频里看到了结果。

换上外覆黑色触觉手套的优化版灵巧手后,CyberOne在自攻螺母工位的双侧作业成功率,从3月的90.2%提高到98%。在新增的中控台侧盖板分拣任务中,它会双手配合改变握持方式,在手中调整盖板姿态;折叠料箱时,则靠指尖触觉抠开拉环,再由双臂配合完成折叠。

两项新任务的成功率都达到了90%。

二、试水「十万小时数据」打造机器人大脑

灵巧手让动作更精细,但把动作串起来、完整做完一项任务,靠的是机器人的"大脑"。

过去四年,变化最大的正是它。

2022年,行业主流还是基于规则的规划和控制,工程师要提前把一项任务拆成一个个动作。到了2026年,VLA和世界模型成为两条主流技术路线,机器人开始从大量数据中学习看懂环境、理解指令,再生成动作。

理解小米的思路,可以从2026年2月开源的Xiaomi-Robotics-0(XR0)看起。

XR0由两部分组成:Qwen3-VL-4B-Instruct作为VLM底座,负责看懂画面、理解指令;后面接一个16层的Diffusion Transformer(DiT),负责生成动作。整个模型共47亿参数。

它首先要解决的,是机器人动作"一题多解"的问题。

拿起一条毛巾,抓左边可以,抓右边也可以。如果把这些不同的示范放在一起拟合,模型学到的可能只是几种做法的平均值——反而哪种都不像。XR0引入了"选择策略"(Choice Policies):模型同时预测多组候选动作,只让最接近示范的那一组继续学习,从而把不同的正确做法都保留下来。

部署到机器人上,还要解决动作衔接的问题。

在RTX 4090上,XR0生成一段动作约需80毫秒,如果每做完一段都停下来等计算,动作会明显卡顿。XR0的办法是异步执行:机器人还在执行当前动作时,模型已经开始算下一步。

在模型的效果上,小米拿它和pi 0.5做了对比。在考察空间理解、物体操作和长任务执行能力的LIBERO测试中,XR0平均成功率98.7%,pi 0.5为96.9%。步骤更多的长任务中,两者分别为97.2%和92.4%。

真机测试包括两项任务:把乐高逐块拆开、按颜色分盒,考察双臂配合和精细抓取;把毛巾取出、展开、折好,考验对柔性物体的控制。拆乐高任务中两者成功率接近,但XR0每秒处理约0.16块积木,pi 0.5约0.12块;折毛巾任务中,XR0每分钟完成1.2条,pi 0.5约1条。

五个月后,小米发布了Xiaomi-Robotics-1(XR1)。它沿用XR0的架构,但VLM和DiT不再分开训练,而是在预训练中共同学习;参数规模也从单一的47亿,扩展出26亿、51亿、105亿三档。

小米想在XR1上验证的是:具身模型能不能像大语言模型一样,跑出Scaling Law。

要把预训练规模做大,先要解决数据问题。

真机遥操数据质量高,但采集成本也高,小米因此选择了UMI——一种带第一视角相机的手持夹爪,并用它积累了超过10万小时、覆盖1700多个场景的操作数据。预训练先用这10万小时数据,让模型学会怎样操作物体;再用约1万小时不同机器人采集的数据继续训练,让它能控制真实机器人、听懂人类指令。

Scaling Law初步得到了验证。

在收纳鞋子、装包、整理桌面和沙发等任务中,XR1要面对训练时没见过的房间和物体:51亿参数模型没有动作预训练时,成功率只有26%,使用2万小时UMI数据后提高到75%;相同数据量下,参数从26亿扩大到105亿,成功率从61%提高到79%。

数据和参数的增长,确实会提高真机的表现。

学习新任务需要的数据量也更少。面对手机装盒、打印机加纸、洗衣机装衣、纸箱打包四项新任务,用36小时真机数据微调后,XR1成功率75%,π0.5为40%;数据加到144小时,两者分别为85%和53%。

从XR0到XR1,小米没有另起炉灶:XR0解决的是把动作做对,XR1开始探索的是,模型能不能从更多数据里学到通用的操作经验,再迁移到不同的机器人和任务上。

但无论UMI、真机还是触觉数据,都依赖现实采集,能覆盖的环境变化终究有限。光照、背景、物体外观和摆放方式一旦变化,机器人就会遇到训练中没见过的情况。

小米的方法是:采集不到的场景,让模型去生成。

三、真实场景采不完,就让模型生成

用世界模型生成机器人数据,已经是具身智能当前的一条主流路线。

NVIDIA的Cosmos世界模型和GR00T-Dreams方案,可以根据一张初始画面和一句指令,生成机器人在新任务、新环境中的操作视频,并据此构造训练轨迹。阿里千问6月发布的Qwen-RobotWorld,也能从当前画面和指令预测后续操作过程,还能同步生成2到4个摄像头视角。

这些模型解决的主要是"从无到有"的问题:生成一段新的操作视频,或一条新的动作轨迹。小米想解决的是另一个问题:一段已经采集好的真实操作,能不能在不改变机器人姿态和动作的前提下,扩展到更多环境中,同时让多个摄像头下的画面保持对应。

2026年7月,小米发布了Xiaomi-Robotics-U0(U0),380亿参数,底座来自EMU3.5和Qwen3-32B。

同一段拿盘子的动作,U0可以分别更换工作台、背景、物体和光线,同时尽量保持机器人姿态、盘子位置和动作过程不变。它还能生成不同摄像头下相互对应的画面,并从这些画面继续预测后续操作视频。

场景迁移的效果,可以参考两组数字。

小米把U0和GPT-Image-2放在一起,由人工比较两者生成的场景,看不同视角能否保持一致、画面是否符合文字描述。在简单和困难场景中,U0的胜率分别为82.0%和79.3%。

在专门评测具身世界模型视频生成能力的WorldArena测试中,U0以73.64分在100多个模型中名列第一。

更重要的是,生成的数据能用于模型的训练。在小米自己设计的三项真机测试中,研究人员把U0生成的数据加入pi 0.5的训练,面对没见过的桌布和光线,按任务完成步骤计算的平均进度得分从36.9提高到63.2——生成数据切实提高了机器人对视觉变化的适应能力。

从灵巧手到具身模型,小米在机器人的身体和"大脑"上都有了自己的答案。

剩下的问题是:机器人该去哪儿干活?

四、为什么小米选择先进工厂?

"未来五年,人形机器人将大面积在小米工厂上岗。"2025年11月,雷军在采访中作出了这个判断。

几个月后,被问到人形机器人什么时候能进家庭,他的回答是:"通用型机器人进家庭还早。"

首要原因是成本。

按雷军当时的说法,一台通用人形机器人的价格仍在二三十万元,普通家庭很难接受。而家庭本就是机器人最难应付的场景之一:每家布局不同,物品种类和摆放方式随时在变,还要面对老人、孩子和宠物,对安全性和泛化能力的要求都更高。

相比之下,工业场景任务明确、环境可控,一项工作的成功率、生产节拍和成本都能直接衡量。更何况,小米有自己的汽车和家电工厂,可以在真实产线上反复测试和调整。

家庭是长远目标,工厂才是现阶段最实际的落点。

进了工厂,小米也没有挑最简单的活。不少人形机器人进厂,会先从料箱搬运、零件分拣等相对简单的任务做起,配上夹爪或专用夹具就能完成,成本更低,结构也更简单。

但这类工作在小米工厂已经不缺"人手":武汉智能家电工厂用4.2公里的空中运输带连接六大车间,161台AMR负责核心部件配送,智能物流覆盖率达到94%。产品下线后的搬运、出入库,也由AMR、RGV穿梭车和立体仓库完成。在这些路线固定、物料标准的任务上,专用设备已经足够高效,再让一台结构更复杂、成本更高的人形机器人来做,意义不大。

所以,小米把机器人先放在了三个更难的工位上:安装自攻螺母、分拣中控台侧盖板、折叠回收料箱。

三个工位的难点各不相同。安装自攻螺母时,螺母内侧的花键让每次抓取后的姿态难以固定,定位销轴的磁吸力又会干扰安装,机器人要先在手中调整螺母,再完成对准和贴合。中控台侧盖板尺寸大、形状不规则且有柔性,放入料架时一旦卡滞或钩挂,机器人要根据末端受力自行调整。折叠料箱则要用手指抠开拉环、双臂配合折叠,处理第二面时还要先把箱体转向自己。

这些任务也回答了前面的问题:小米为什么愿意为机器人装上成本更高的灵巧手。

夹爪适合抓形状固定、位置明确的物体。当物体姿态不固定,需要调整、换手或依靠触觉完成操作时,灵巧手才有用武之地。

经过四个月测试,自攻螺母工位的成功率从90.2%提高到98%,接近人工的99%;另外两项任务的成功率都是90%。

不过,这些机器人现在仍然只能算"实习工"。

雷军曾这样形容实验室和工厂的差别:"实验室可以用一万次失败换来一次成功,真实工厂则需要一万次任务次次成功。"

五、结语

从2022年站上发布会舞台,到2026年进厂"实习",小米机器人走过了四年时间。小米没有急着推出CyberOne的下一代,而是把时间花在灵巧手、模型和数据上,再把这些技术放到真实产线上检验。

衡量一台机器人的标准,早已不是会不会走路、能不能完成一次表演,而是能否在一个工位上稳定工作,效率和成本算不算得过来。

小米的"慢",是把时间留给技术迭代;先落地工业场景,则是对现阶段能力边界的清醒判断。只有解决现有方案没有解决好的问题,机器人才能真正创造价值。

# 科技核心圈

免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。

举报

评论

  • 推荐
  • 最新
empty
暂无评论