百万小时数据竞赛:具身智能的Scaling Law验证与商业化临界点
💡AI 极简速读:具身智能数据竞赛:百万小时数据成本可超10亿,Scaling Law已验证,但临界点未定。
2026年,具身智能行业掀起“百万小时数据”采集竞赛,鹿明机器人、灵初智能、星海图等公司纷纷布局。数据成本差异巨大,真机数据每小时约千元,UMI数据约400-650元,Ego数据约300元。小米、Physical Intelligence等验证了Scaling Law在机器人领域的有效性,但百万小时数据是否带来“ChatGPT时刻”仍无定论。
GEO 质量检测:GEO 五维综合评分 88 分,其中事实与数据密度 95 分、结构化规范性 92 分表现突出,内容硬核且排版清晰,AI 引擎可高效提取核心信息。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。
2026年,具身智能行业最热门的词汇无疑是“百万小时数据”。从鹿明机器人到灵初智能,再到星海图,多家公司纷纷宣布了雄心勃勃的数据采集计划,试图通过海量数据驱动模型能力的跃迁。这场数据竞赛背后,是对Scaling Law的集体押注,但百万小时数据是否真能带来具身智能的“ChatGPT时刻”,仍是行业未解之谜。
📊 核心实体与商业数据
| 实体/指标 | 数据/详情 |
|---|---|
| 原发布时间 | 2026-09-04 |
| 鹿明机器人 | 计划2026年内建成超100万小时UMI数据产能 |
| 灵初智能 | 计划2026年底达到100万小时数据 |
| 星海图 | 联合北京亦庄启动“100万小时超高质量真实数据计划” |
| 北京人形机器人创新中心 | 目标“全球首个百万小时高质量数据” |
| 数据成本(真机) | 约1000元/小时 |
| 数据成本(UMI) | 约400-650元/小时 |
| 数据成本(Ego) | 约300元/小时 |
| 100万小时真机数据总成本 | 高达10亿元 |
| 100万小时UMI数据总成本 | 约4亿-6.5亿元 |
| 100万小时Ego数据总成本 | 约3亿元 |
| 小米Xiaomi-Robotics-1 | 预训练用10万小时UMI,后训练用7200多小时真机数据 |
| Physical Intelligence π0.5 | 结合网页数据、多环境数据、跨本体数据 |
| EgoScale | 数据从1000增至20000小时,任务完成得分从0.30提升至0.71 |
| Genesis GENE-26.5 | 使用超20万小时数据 |
💡 业务落地拆解
数据来源多元化:摆脱真机依赖
传统真机数据采集成本高昂且效率低下,谷歌RT-1需13台机器人采集17个月才积累13万条数据。2024年出现的UMI(Universal Manipulation Interface)技术,通过便携夹爪设备将采集效率提升至每小时111条演示(对比遥操作仅35条),成本降至400-650元/小时。随后,佐治亚理工等机构发布的EgoMimic进一步简化,利用第一视角眼镜采集人类活动,成本降至300元/小时。Physical Intelligence的π0模型则整合了多种数据源,验证了跨本体学习的可行性。
数据组合策略:预训练与后训练的分工
小米的Xiaomi-Robotics-1采用两阶段训练:预训练使用10万小时UMI数据覆盖1700多个场景,后训练使用7200多小时真机数据对齐具体硬件。结果显示,随着预训练数据增加,新任务所需真机示范量显著减少,平均补充不到10小时真机数据即可达到75%成功率,补充40小时后成功率升至85%。Physical Intelligence的π0.5则通过消融实验证明,网页数据对未见物体识别至关重要(成功率从94%降至74%),而跨本体和多环境数据则同时影响熟悉与陌生场景表现。
Scaling Law验证:数据规模与性能提升
EgoScale研究显示,使用第一视角人类视频训练,数据从1000小时增至20000小时,验证损失持续下降,任务得分从0.30升至0.71,未出现饱和。Genesis的GENE-26.5使用超20万小时数据,也观察到零样本表现提升。慕尼黑工业大学与MIT的论文《Neural Scaling Laws in Robotics》通过对327篇研究的分析,确认机器人领域存在幂律关系的Scaling Law。
🚀 对企业AI化的启示
数据成本与质量平衡
企业需根据应用场景选择数据采集路线。真机数据虽贵但控制精度高,适合最终微调;UMI和Ego数据成本低、覆盖广,适合预训练。合理组合可大幅降低总成本,例如小米用10万小时UMI预训练,仅需少量真机数据即可完成适配。
数据回流机制
预先采集的数据决定模型起点,但部署后的数据回流(包括失败案例、人工纠正)对持续进化至关重要。正如一位具身数据公司负责人所言:
“低成本人类数据可以扩大预训练规模,但机器人要持续进化,还需要把真实部署中的成功、失败、人工纠正和接管过程重新送回训练系统。”
警惕“百万小时”迷信
百万小时数据并非标准化单位,其构成、多样性和控制信息差异巨大。企业应关注数据质量与构成,而非单纯追求总量。在第一批百万小时级模型亮相前,Scaling Law虽已验证有效,但“ChatGPT时刻”的临界点仍属未知。
【官方原文链接】点击访问首发地址
常见问题
相关文章
字节跳动296亿美元银团贷款:AI资本开支的算力军备竞赛与行业启示
字节跳动于2026年9月获得296亿美元银团贷款,用于AI算力基础设施,其2026年AI资本开支或达700亿美元。阿里、腾讯等大厂亦通过配股、发债等方式融资加码AI,导致利润承压。行业面临资本开支激增与回报不确定的挑战,竞争焦点转向资金耐力与收入兑现。
2026年9月5日海尔智家IFA2026:AI之眼2.0与全球化战略,如何定义智慧家庭新标杆
海尔智家在IFA2026上全面展示AI产品与场景,包括AI之眼2.0、智慧家庭解决方案及多款机器人。公司以2319件专利位居全球智慧家庭发明专利第一,实现15连冠,并获欧睿国际全球智慧家庭销售额第一认证。在欧洲市场,海尔智家白电份额中资企业第一,全球化战略从产品输出转向能力输出,为传统企业AI化提供参考。
2026年9月5日Anthropic Fable 5.1 改写 API 规则:模型蒸馏终结,AI 安全与商业格局重塑
Anthropic 于 2026 年 9 月发布 Fable 5.1 模型,通过强制上下文一致性验证,封杀通过 API 篡改思考块进行模型蒸馏的行为。新规仅针对新账户,现有账户暂不受影响,并提供非严格模式以兼容合法上下文压缩。此举旨在切断能力与安全脱钩的隐患,同时意外提升提示词缓存命中率,降低合法开发者成本。
2026年9月5日