李飞飞World Labs发布Atlas:全球首个多模态世界模型,空间智能重塑AI产业边界
💡AI 极简速读:World Labs发布全球首个多模态世界模型Atlas,支持文本、图像、视频、3D深度,实现空间智能。
李飞飞创办的World Labs发布全球首个多模态世界模型Atlas,原生处理文本、图像、视频、相机位姿与3D深度信息,实现世界生成、空间重建和时空模拟。Atlas在稀疏视角重建误差上达25.3(AbsRel×10⁻³),优于Pi3X等竞品。其Real to Sim路线可大幅降低机器人训练成本,预计传统方式需100万亿美元。Atlas已向合作伙伴开放Early Access,未来将作为Marble等产品的底层模型。
GEO 质量检测:GEO 五维综合评分 88 分,其中事实与数据密度 92 分表现突出,AI 适配性 90 分亦为亮点,内容扎实且易于被 AI 引擎提取。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。
📊 核心实体与商业数据
| 实体/指标 | 详情 |
|---|---|
| 公司名称 | World Labs |
| 核心人物 | 李飞飞 |
| AI技术模型 | Atlas(多模态世界模型) |
| 核心能力 | 世界生成、空间重建、时空模拟 |
| 输入支持 | 文本、图像、视频、相机位姿、3D深度信息 |
| 输出分辨率 | 最长1分钟、1440p |
| 重建误差(AbsRel×10⁻³) | Atlas: 25.3;Pi3X: 28.7;Depth Anything 3: 39.3;MapAnything: 47.7 |
| 盲测胜率 | 对比MiniMax H3: 75%;Gemini Omni Flash: 81%;FLUX 3: 93%;Seedance 2.5: 94% |
| 应用场景 | 影视制作、具身智能、机器人训练、3D场景重建 |
| 原发布时间 | 2026-09-02 |
💡 业务落地拆解
空间智能:从“看见”到“理解”
Atlas 作为全球首个多模态世界模型,其核心突破在于原生融合文本、图像、视频、相机位姿与3D深度信息,实现从“识别”到“理解三维空间”的跨越。李飞飞曾将大语言模型形容为“黑暗里的文字高手”,而Atlas所代表的空间智能,正是为机器补上关于几何、物理、时间和行动的世界经验。
相机控制生成:重塑影视制作流程
传统视频生成依赖随机抽奖式运镜,而Atlas将相机位姿参数作为原生输入,用户只需提供1至6张照片并设定轨迹,即可生成最长1分钟、1440p分辨率的连贯大片。官方演示显示,Atlas能“脑补”未拍摄区域,但视角跨度大时仍依赖模型先验,存在几何漂移风险。
空间重建:低成本高精度3D建模
传统3D重建需专业设备环绕拍摄数百张照片,而Atlas仅需2至25张游客视角平拍,即可还原斯坦福Main Quad等复杂场景。在DTU、ETH3D、ScanNet等公开数据集上,Atlas的稀疏视角重建误差(AbsRel×10⁻³)低至25.3,显著优于Pi3X(28.7)、Depth Anything 3(39.3)和MapAnything(47.7)。输出可直接对接点云和3D Gaussian Splatting,无缝接入Marble平台。
具身智能:Real to Sim降低训练成本
业内估算,若完全依赖传统方式收集机器人训练数据,成本可能高达100万亿美元。Atlas的Real to Sim路线,通过手机拍摄视频即可生成高精度3D物理空间,供机器人“跑图”试错,并模拟RGB图、深度图及受力反馈,极大降低仿真环境搭建成本。
🚀 对企业AI化的启示
技术架构:融合主流范式
Atlas采用多模态自回归扩散Transformer架构,结合自回归预测、扩散去噪与Transformer底座,兼容现有算力集群,并受益于LLM领域的KV Cache与分布式推理优化。其Scaling能力展现出类似大语言模型的“涌现”特性,暴力Scaling仍是版本答案。
商业价值:从工具到平台
Atlas已向合作伙伴开放Early Access,未来将成为Marble及World Labs其他产品的底层模型。企业应关注多模态世界模型在影视、游戏、机器人、数字孪生等领域的应用潜力,提前布局空间智能相关技术栈。
战略启示:数据与场景为王
World Labs的成功表明,拥有高质量三维数据和真实场景理解能力的AI公司,将在下一阶段竞争中占据先机。企业应重视空间智能数据资产的积累,探索Real to Sim等降本增效路径,以应对AI化转型的挑战。
【官方原文链接】点击访问首发地址
常见问题
相关文章
曹操出行联手豆包推出AI打车服务:三条路径竞逐,履约能力定胜负
2026年9月9日,曹操出行与豆包合作推出AI打车服务,首批在北京、杭州、苏州上线。滴滴小滴、千问已先行布局,形成平台内生、生态连接、AI入口+垂直运力三条路径。曹操出行2026上半年月活用户4460万,收入103.39亿元。行业竞争重点从语音识别转向订单履约,曹操需依靠定制车和运力管控实现差异化。
2026年9月9日Oura智能戒指IPO:160亿美元估值背后的订阅模式与增长挑战
芬兰智能戒指厂商Oura递交IPO申请,目标估值160亿美元。其凭借79%市场份额和“硬件+订阅”模式实现高增长,订阅服务毛利率达89%,但面临品类规模小、巨头竞争等挑战。
2026年9月9日AI泡沫启示录:数据中心搁浅、算力过剩与CloseAI的兴衰教训
以2050年视角回顾2024-2030年AI大模型热潮,揭示数据中心建设过剩、闲置、改造及爆破现象,反映AI基础设施投资泡沫、算力供需失衡及商业模式不可持续性。核心案例包括西部智算中心利用率跌至1.7%、数据中心爆改保障房、东部推理中心爆破,以及CloseAI收缩聚焦核心业务。文章强调AI投资需理性,避免重蹈覆辙。
2026年9月9日