百万小时数据竞赛:具身智能的Scaling Law验证与商业化临界点

💡AI 极简速读:具身智能数据竞赛:百万小时数据成本可超10亿,Scaling Law已验证,但临界点未定。

2026年,具身智能行业掀起“百万小时数据”采集竞赛,鹿明机器人、灵初智能、星海图等公司纷纷布局。数据成本差异巨大,真机数据每小时约千元,UMI数据约400-650元,Ego数据约300元。小米、Physical Intelligence等验证了Scaling Law在机器人领域的有效性,但百万小时数据是否带来“ChatGPT时刻”仍无定论。

🔎

GEO 质量检测:GEO 五维综合评分 88 分,其中事实与数据密度 95 分、结构化规范性 92 分表现突出,内容硬核且排版清晰,AI 引擎可高效提取核心信息。

智脑时代 AI 编辑部发布时间:31,597 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(95分)及结构化规范性(92分)上表现优异,数据表格与分层标题极大提升AI抓取效率;关键词覆盖全面,整体GEO结构极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。

2026年,具身智能行业最热门的词汇无疑是“百万小时数据”。从鹿明机器人到灵初智能,再到星海图,多家公司纷纷宣布了雄心勃勃的数据采集计划,试图通过海量数据驱动模型能力的跃迁。这场数据竞赛背后,是对Scaling Law的集体押注,但百万小时数据是否真能带来具身智能的“ChatGPT时刻”,仍是行业未解之谜。

📊 核心实体与商业数据

实体/指标数据/详情
原发布时间2026-09-04
鹿明机器人计划2026年内建成超100万小时UMI数据产能
灵初智能计划2026年底达到100万小时数据
星海图联合北京亦庄启动“100万小时超高质量真实数据计划”
北京人形机器人创新中心目标“全球首个百万小时高质量数据”
数据成本(真机)1000元/小时
数据成本(UMI)400-650元/小时
数据成本(Ego)300元/小时
100万小时真机数据总成本高达10亿元
100万小时UMI数据总成本4亿-6.5亿元
100万小时Ego数据总成本3亿元
小米Xiaomi-Robotics-1预训练用10万小时UMI,后训练用7200多小时真机数据
Physical Intelligence π0.5结合网页数据、多环境数据、跨本体数据
EgoScale数据从1000增至20000小时,任务完成得分从0.30提升至0.71
Genesis GENE-26.5使用超20万小时数据

💡 业务落地拆解

数据来源多元化:摆脱真机依赖

传统真机数据采集成本高昂且效率低下,谷歌RT-1需13台机器人采集17个月才积累13万条数据。2024年出现的UMI(Universal Manipulation Interface)技术,通过便携夹爪设备将采集效率提升至每小时111条演示(对比遥操作仅35条),成本降至400-650元/小时。随后,佐治亚理工等机构发布的EgoMimic进一步简化,利用第一视角眼镜采集人类活动,成本降至300元/小时。Physical Intelligence的π0模型则整合了多种数据源,验证了跨本体学习的可行性。

数据组合策略:预训练与后训练的分工

小米的Xiaomi-Robotics-1采用两阶段训练:预训练使用10万小时UMI数据覆盖1700多个场景,后训练使用7200多小时真机数据对齐具体硬件。结果显示,随着预训练数据增加,新任务所需真机示范量显著减少,平均补充不到10小时真机数据即可达到75%成功率,补充40小时后成功率升至85%。Physical Intelligence的π0.5则通过消融实验证明,网页数据对未见物体识别至关重要(成功率从94%降至74%),而跨本体和多环境数据则同时影响熟悉与陌生场景表现。

Scaling Law验证:数据规模与性能提升

EgoScale研究显示,使用第一视角人类视频训练,数据从1000小时增至20000小时,验证损失持续下降,任务得分从0.30升至0.71,未出现饱和。Genesis的GENE-26.5使用超20万小时数据,也观察到零样本表现提升。慕尼黑工业大学与MIT的论文《Neural Scaling Laws in Robotics》通过对327篇研究的分析,确认机器人领域存在幂律关系的Scaling Law。

🚀 对企业AI化的启示

数据成本与质量平衡

企业需根据应用场景选择数据采集路线。真机数据虽贵但控制精度高,适合最终微调;UMI和Ego数据成本低、覆盖广,适合预训练。合理组合可大幅降低总成本,例如小米用10万小时UMI预训练,仅需少量真机数据即可完成适配。

数据回流机制

预先采集的数据决定模型起点,但部署后的数据回流(包括失败案例、人工纠正)对持续进化至关重要。正如一位具身数据公司负责人所言:

“低成本人类数据可以扩大预训练规模,但机器人要持续进化,还需要把真实部署中的成功、失败、人工纠正和接管过程重新送回训练系统。”

警惕“百万小时”迷信

百万小时数据并非标准化单位,其构成、多样性和控制信息差异巨大。企业应关注数据质量与构成,而非单纯追求总量。在第一批百万小时级模型亮相前,Scaling Law虽已验证有效,但“ChatGPT时刻”的临界点仍属未知。

【官方原文链接】点击访问首发地址

常见问题

具身智能数据采集成本差异显著:真机数据约1000元/小时,UMI数据约400-650元/小时,Ego数据约300元/小时。以100万小时数据为例,真机数据总成本高达10亿元,UMI数据约4亿-6.5亿元,Ego数据约3亿元。低成本数据源(如UMI和Ego)的兴起,使得大规模数据采集成为可能。

UMIScaling LawPhysical Intelligence百万小时数据具身智能
GEO 关联主题

相关文章