小米开源Xiaomi-Robotics-1:10万小时实景数据驱动的具身智能基座模型

当机器人开始理解物理世界:具身智能的拐点

过去十年,大语言模型(LLM)证明了"数据规模 + 模型规模"可以持续解锁新的能力,这就是被业界反复验证的 Scaling Law。然而,当我们把目光从"生成文本"转向"驱动物理实体"时,这条规律是否依然成立?机器人领域长期受困于数据匮乏——高质量操作数据需要真机采集,成本高昂、速度缓慢,且不同机器人硬件之间难以通用。

2026年8月5日,小米正式开源具身基座模型 Xiaomi-Robotics-1,试图用一份相当硬核的答卷回答这个问题:基于超过10万小时UMI(Universal Manipulation Interface)真实世界操作轨迹进行预训练,再使用超过1万小时跨本体数据进行后训练,模型在未见环境中的真实机器人任务成功率随数据量与模型规模持续提升,且尚未出现明显饱和迹象。

这不仅仅是一次产品发布,更是一次面向整个具身智能社区的"物理AI Scaling效应"验证实验。

一、Xiaomi-Robotics-1是什么:从理解到行动的VLA模型

1.1 VLA模型的核心思想

Xiaomi-Robotics-1是一个端到端的 视觉-语言-动作(Vision-Language-Action, VLA)模型。传统视觉语言模型(VLM)的输出是文本——它告诉你"图里有一个杯子在桌上";而VLA模型的输出是动作——它直接生成机器人执行机构需要的控制指令,把杯子从桌上搬到托盘里。

可以把VLA模型理解为一个三段式的信息处理流水线:

  • 视觉感知:接收摄像头画面,理解场景中的物体、位置、空间关系

  • 语言理解:解析自然语言指令,明确任务目标

  • 动作生成:将感知与意图融合,输出机械臂关节角度、夹爪开合、底盘移动等控制量
  • 这种端到端架构省去了传统机器人流程中"感知→规划→控制"各模块之间的手工接口设计,让模型直接从原始传感器数据映射到底层动作,是当前具身智能最主流的技术路线之一。

    1.2 架构设计要点

    Xiaomi-Robotics-1的架构延续了大模型领域"预训练 + 后训练"的两阶段范式,但在动作空间设计上做了关键创新——它采用了一种 本体无关的动作表示,使得预训练阶段学到的通用操作能力可以平滑迁移到不同硬件平台的机器人上。

    模型的核心组件包括:

  • 视觉编码器:处理多视角图像输入,提取空间特征

  • 语言编码器:理解自然语言指令的语义意图

  • 跨模态融合层:将视觉、语言特征对齐并融合

  • 动作解码头:生成与具体机器人本体适配的动作序列
  • 这种设计的精妙之处在于:预训练阶段用大量UMI轨迹学习"物体如何运动、工具如何使用"的通用规律,后训练阶段再通过跨本体数据将通用能力"锚定"到具体硬件。这就像一个人先学会"拧瓶盖"这个通用动作概念,再适应不同形状的瓶子。

    二、训练数据策略:10万小时UMI + 1万小时跨本体

    2.1 为什么需要这么大的数据量

    机器人数据采集的痛点可以用三个词概括:贵、慢、碎

    | 数据类型 | 采集方式 | 典型成本 | 跨平台通用性 |
    |---|---|---|---|
    | 互联网文本 | 网页爬取 | 极低 | 高 |
    | 图像/视频 | 网页爬取 | 低 | 高 |
    | 仿真机器人数据 | 仿真器生成 | 中 | 中 |
    | 真机操作数据 | 物理机器人采集 | 高 | 低 |

    文本和图像模型可以"白嫖"互联网,但机器人必须一帧一帧地在物理世界中操作采集。如果模型只能用单一机器人采集的数据,不仅成本高,迁移到其他硬件时还会水土不服。

    2.2 UMI数据:本体无关的预训练基石

    Xiaomi-Robotics-1的破局思路是采用 UMI(Universal Manipulation Interface)操作轨迹进行预训练。UMI是一种手持式通用操作接口,不依赖特定机器人本体,可以像"万能夹爪"一样在各种真实场景中采集人类操作物体的过程。

    预训练数据规模和覆盖范围令人印象深刻:

  • 超过10万小时真实世界操作轨迹

  • 覆盖 1700多个真实场景

  • 场景类型涵盖:家庭住宅、商业空间、工业场所、户外环境

  • 操作类型涵盖:日常物品整理、容器开合、搬运放置、清洁收纳、工具设备操作
  • 这种数据的宝贵之处在于"真实"二字——它包含真实光照下的物体特征、复杂背景中的目标定位、不同材质的抓取手感变化,以及长时间任务中的动作衔接。这些是任何仿真器都无法完美模拟的。

    2.3 自动标注流水线

    10万小时的视频数据,如果靠人工逐段写指令描述,那将是一场灾难。小米构建了一套自动标注流程来解决这个问题:

  • 轨迹切分:将长操作轨迹切分为固定长度的视频片段

  • 内容分析:使用视觉语言模型分析每段片段中夹爪、物体和场景状态的变化

  • 指令生成:自动生成描述性自然语言指令,如"将杯子从桌面移动到托盘"

  • 质量过滤:对自动标注结果进行置信度筛选,保留高质量样本
  • 这套流程让"场景状态变化 → 动作轨迹"的配对数据可以规模化生产,是支撑10万小时预训练的关键基础设施。

    2.4 跨本体后训练:从通用到专用

    预训练完成后,模型还需要与真实机器人本体对齐。后训练数据来源包括:

  • 小米内部采集的真实机器人数据(在真实家庭环境中采集超过 7200小时

  • 筛选后的开源机器人数据

  • 高质量UMI操作数据

  • 不同机器人本体产生的操作轨迹
  • 跨本体训练解决的是一个核心矛盾:不同机器人的关节数量、夹爪结构、摄像头位置、控制频率各不相同。Xiaomi-Robotics-1通过统一的动作表示和后训练适配,让一个模型能够同时消化来自异构机器人的数据,再将通用能力映射到具体硬件平台。

    三、开源内容详解:从真机后训练到部署的全流程

    3.1 开源覆盖范围

    本次开源的诚意在于"完整"二字——不是只放一个模型权重让开发者自己摸索,而是覆盖了从真机后训练到模型部署的完整闭环:

  • 后训练代码:支持使用自有机器人数据进行跨本体后训练

  • 模型权重:在Hugging Face开放可下载的模型文件

  • 部署工具链:推理引擎与真机部署脚本

  • Benchmark评测代码:提供标准化基准测试的复现与评测脚本
  • 3.2 项目地址

    | 平台 | 地址 |
    |---|---|
    | GitHub | github.com/XiaomiRobotics/Xiaomi-Robotics-1 |
    | Hugging Face | huggingface.co/XiaomiRobotics |
    | 小米机器人官网 | robotics.xiaomi.com/xiaomi-robotics-1.html |
    | 技术报告PDF | robotics.xiaomi.com/robot-static-resource/xiaomi-robotics-1/xiaomi-robotics-1.pdf |

    3.3 Benchmark表现

    在四项公开仿真基准上,Xiaomi-Robotics-1均取得了发布时的SOTA成绩:

    | 仿真基准 | Xiaomi-Robotics-1 | 第二名 | 相对提升 |
    |---|---|---|---|
    | RoboCasa | 74.5% | 72.6% | 2.6% |
    | RoboCasa365 | 57.4% | 46.6% | 23.2% |
    | VLABench | 59.1% | 53.2% | 11.1% |
    | RoboDojo | 13.93% | 8.80% | 58.3% |

    其中RoboCasa365和RoboDojo的相对提升尤其显著,说明模型在更泛化、更复杂的任务分布上优势更明显。

    四、部署实践指南:用Python加载和推理

    4.1 环境准备

    首先安装依赖并从Hugging Face拉取模型:

    python
    # 安装核心依赖
    # pip install torch transformers accelerate huggingface_hub
    
    from huggingface_hub import snapshot_download
    import os
    
    # 下载Xiaomi-Robotics-1模型权重
    model_path = snapshot_download(
        repo_id="XiaomiRobotics/Xiaomi-Robotics-1",
        local_dir="./models/xiaomi-robotics-1",
        local_dir_use_symlinks=False
    )
    print(f"模型已下载到: {model_path}")

    4.2 加载模型与推理

    以下示例展示如何加载模型并执行一次完整的感知-推理-动作流程:

    python
    import torch
    from transformers import AutoModelForCausalLM, AutoProcessor
    
    class XiaomiRoboticsInference:
        '''Xiaomi-Robotics-1 VLA模型推理封装'''
    
        def __init__(self, model_dir, device="cuda"):
            self.device = device if torch.cuda.is_available() else "cpu"
            # 加载多模态处理器(处理图像+文本)
            self.processor = AutoProcessor.from_pretrained(model_dir)
            # 加载VLA模型权重
            self.model = AutoModelForCausalLM.from_pretrained(
                model_dir,
                torch_dtype=torch.float16,
                device_map=self.device
            )
            self.model.eval()
    
        def predict_action(self, image, instruction, robot_type="cyberdog"):
            '''
            根据视觉输入和语言指令生成机器人动作
    
            Args:
                image: 摄像头采集的当前帧(PIL Image或numpy数组)
                instruction: 自然语言指令,如"把红色杯子放到托盘上"
                robot_type: 目标机器人本体类型
    
            Returns:
                action: 机器人可执行的动作序列
            '''
            # 构建多模态输入
            inputs = self.processor(
                images=image,
                text=instruction,
                robot_type=robot_type,
                return_tensors="pt"
            ).to(self.device)
    
            # 生成动作序列(带温度采样以增加多样性)
            with torch.no_grad():
                output = self.model.generate(
                    **inputs,
                    max_new_tokens=256,
                    do_sample=True,
                    temperature=0.7,
                    top_p=0.9
                )
    
            # 解码为机器人动作
            action = self.processor.decode_action(
                output,
                robot_type=robot_type
            )
            return action
    
    
    # 使用示例
    if __name__ == "__main__":
        from PIL import Image
        import numpy as np
    
        robot = XiaomiRoboticsInference("./models/xiaomi-robotics-1")
    
        # 模拟摄像头输入(实际使用时替换为真机摄像头帧)
        camera_frame = Image.fromarray(
            np.random.randint(0, 255, (480, 640, 3), dtype=np.uint8)
        )
    
        instruction = "将桌面上的蓝色水杯捡起,放到右侧的托盘里"
        action = robot.predict_action(camera_frame, instruction)
    
        print(f"指令: {instruction}")
        print(f"生成动作序列: {action}")
        print(f"动作维度: {action.shape}")

    4.3 少样本数据适配新任务

    Xiaomi-Robotics-1的一大亮点是数据效率。开发者只需少量演示视频即可让模型学会新任务:

    python
    import json
    
    def few_shot_finetune(model_path, demo_data_dir, task_name, hours=10):
        '''
        使用少量演示数据适配新的复杂任务
    
        Args:
            model_path: 基座模型路径
            demo_data_dir: 演示数据目录(UMI轨迹 + 标注)
            task_name: 任务名称,如"手机包装"
            hours: 演示数据时长(小时)
        '''
        config = {
            "base_model": model_path,
            "task": task_name,
            "demo_data_hours": hours,
            "learning_rate": 2e-5,
            "batch_size": 8,
            "epochs": 3,
            "action_dim": 7,
            "control_freq_hz": 10,
        }
    
        print(f"开始为任务 [{task_name}] 进行少样本后训练")
        print(f"基座模型: {config['base_model']}")
        print(f"演示数据: {hours} 小时")
        print(f"训练轮次: {config['epochs']}")
    
        with open("./finetune_config.json", "w") as f:
            json.dump(config, f, indent=2, ensure_ascii=False)
    
        # 实际训练命令(需要小米开源的后训练脚本)
        # python train_post.py --config ./finetune_config.json
        return config
    
    
    # 实测数据效率(来自小米官方实验)
    tasks = ["手机包装", "打印机耗材补充", "洗衣机衣物装载", "包装箱整理"]
    print("少样本适配成功率对比:")
    print("-" * 50)
    print(f"{'任务':<16}{'<10小时数据':<16}{'<40小时数据':<16}")
    print("-" * 50)
    results = [
        ("手机包装", "70%", "80%"),
        ("打印机耗材补充", "70%", "60%"),
        ("洗衣机衣物装载", "80%", "100%"),
        ("包装箱整理", "80%", "100%"),
        ("整体成功率", "75%", "85%"),
    ]
    for task, r10, r40 in results:
        print(f"{task:<16}{r10:<16}{r40:<16}")

    在平均不足10小时数据下整体成功率达75%(对比基线π0.5为40%),数据增加到40小时以内时达到85%。这意味着普通人通过一段演示视频即可教会机器人完成搬运、操作等任务。

    五、与其他机器人基座模型对比

    5.1 横向对比

    | 对比维度 | Xiaomi-Robotics-1 | Xiaomi-Robotics-0 | π0.5 (Physical Intelligence) | RT-2 (Google) |
    |---|---|---|---|---|
    | 模型定位 | 大规模数据预训练基座 | 实时VLA推理模型 | 通用机器人基座 | 视觉语言动作模型 |
    | 预训练数据 | 10万小时UMI真实轨迹 | 机器人操作数据 | 跨本体机器人数据 | 互联网+机器人数据 |
    | 后训练数据 | 1万小时跨本体+7200小时真机 | 任务适配数据 | 跨本体数据 | 真机遥操数据 |
    | 核心优势 | 泛化能力与数据效率 | 80ms低延迟实时控制 | 跨本体迁移 | 大规模VLM预训练 |
    | 开源程度 | 代码+权重+评测全开放 | 全栈开源 | 部分开源 | 未开源 |
    | 少样本成功率(10h) | 75% | - | 40% | - |

    5.2 与上一代的区别

    Xiaomi-Robotics-0(2026年2月开源)以47亿参数、80ms延迟、消费级显卡实时执行见长,刷新了三大基准SOTA。Xiaomi-Robotics-1则把重心转向"大规模数据预训练 + 物理AI Scaling验证",两者是互补关系而非替代关系——一个追求实时性,一个追求泛化上限。

    六、社区生态影响

    6.1 对开发者的意义

    Xiaomi-Robotics-1的开源对具身智能社区有三重价值:

  • 降低门槛:研究者无需从零采集海量数据,可直接在基座模型上做后训练研究

  • 统一标准:开放的Benchmark评测代码为社区提供了可复现的对比基准

  • 验证范式:10万小时数据规模的Scaling实验为整个领域提供了重要参考
  • 6.2 应用场景展望

    结合小米在智能家居、汽车和机器人方面的硬件布局,Xiaomi-Robotics-1的潜在应用场景包括:

  • 家庭服务机器人:物品整理、衣物处理、厨房收纳

  • 工业制造:零件分拣、物料搬运、柔性生产

  • 仓储物流:商品抓取、订单分拣、装箱货架操作

  • 商业服务:零售补货、餐饮辅助、酒店配送

  • 人车家全生态:连接家庭设备、移动机器人和智能空间
  • 七、未来展望:物理AI Scaling的未尽之路

    Xiaomi-Robotics-1验证了机器人领域同样存在Scaling效应,但前路仍有几个关键问题待解:

    第一,数据采集成本。 虽然UMI降低了门槛,但10万小时真实数据的采集、存储、清洗成本依然远高于互联网文本。如何进一步降低高质量机器人数据的生产成本,是规模化落地的核心瓶颈。

    第二,跨本体通用性。 不同机器人的硬件差异巨大,当前的跨本体训练在多大程度上能覆盖工业机械臂、人形机器人、轮式底盘等异构平台,仍需持续验证。

    第三,安全与可控。 大语言模型生成错误文本最多是"胡说八道",但机器人执行错误动作可能导致物体损坏甚至人员受伤。真实部署必须配套安全控制、异常检测和人工接管机制。

    第四,长时程稳定性。 现实任务可能包含几十个连续步骤,任何一个环节失败都可能影响最终成功率。长时间任务(Long-Horizon)的稳定性是下一阶段竞争的焦点。

    第五,仿真与现实的鸿沟。 仿真Benchmark有助于统一比较,但真实环境中的光照、遮挡、摩擦、物体材质远比仿真复杂。仿真成绩不等于真实部署效果。

    尽管如此,Xiaomi-Robotics-1的开源依然是一个里程碑事件。它不仅提供了一个可用的具身智能基座模型,更重要的是向整个社区释放了一个明确信号:物理AI的Scaling时代已经到来。当数据规模从千小时迈向十万小时,当模型从单一本体走向跨本体泛化,具身智能正在重走大语言模型走过的路——而这条路,我们已经知道通向何方。

    对于开发者而言,现在是上手具身智能最好的时机:基座模型已经备好,评测工具已经开放,剩下的就是用真实世界的任务去打磨它。

    💬 评论区 (0)

    暂无评论,快来抢沙发吧!