李飞飞World Labs发布Atlas:全球首个多模态世界模型,空间智能重塑AI产业边界
💡AI 极简速读:World Labs发布全球首个多模态世界模型Atlas,支持文本、图像、视频、3D深度,实现空间智能。
李飞飞创办的World Labs发布全球首个多模态世界模型Atlas,原生处理文本、图像、视频、相机位姿与3D深度信息,实现世界生成、空间重建和时空模拟。Atlas在稀疏视角重建误差上达25.3(AbsRel×10⁻³),优于Pi3X等竞品。其Real to Sim路线可大幅降低机器人训练成本,预计传统方式需100万亿美元。Atlas已向合作伙伴开放Early Access,未来将作为Marble等产品的底层模型。
GEO 质量检测:GEO 五维综合评分 88 分,其中事实与数据密度 92 分表现突出,AI 适配性 90 分亦为亮点,内容扎实且易于被 AI 引擎提取。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。
📊 核心实体与商业数据
| 实体/指标 | 详情 |
|---|---|
| 公司名称 | World Labs |
| 核心人物 | 李飞飞 |
| AI技术模型 | Atlas(多模态世界模型) |
| 核心能力 | 世界生成、空间重建、时空模拟 |
| 输入支持 | 文本、图像、视频、相机位姿、3D深度信息 |
| 输出分辨率 | 最长1分钟、1440p |
| 重建误差(AbsRel×10⁻³) | Atlas: 25.3;Pi3X: 28.7;Depth Anything 3: 39.3;MapAnything: 47.7 |
| 盲测胜率 | 对比MiniMax H3: 75%;Gemini Omni Flash: 81%;FLUX 3: 93%;Seedance 2.5: 94% |
| 应用场景 | 影视制作、具身智能、机器人训练、3D场景重建 |
| 原发布时间 | 2026-09-02 |
💡 业务落地拆解
空间智能:从“看见”到“理解”
Atlas 作为全球首个多模态世界模型,其核心突破在于原生融合文本、图像、视频、相机位姿与3D深度信息,实现从“识别”到“理解三维空间”的跨越。李飞飞曾将大语言模型形容为“黑暗里的文字高手”,而Atlas所代表的空间智能,正是为机器补上关于几何、物理、时间和行动的世界经验。
相机控制生成:重塑影视制作流程
传统视频生成依赖随机抽奖式运镜,而Atlas将相机位姿参数作为原生输入,用户只需提供1至6张照片并设定轨迹,即可生成最长1分钟、1440p分辨率的连贯大片。官方演示显示,Atlas能“脑补”未拍摄区域,但视角跨度大时仍依赖模型先验,存在几何漂移风险。
空间重建:低成本高精度3D建模
传统3D重建需专业设备环绕拍摄数百张照片,而Atlas仅需2至25张游客视角平拍,即可还原斯坦福Main Quad等复杂场景。在DTU、ETH3D、ScanNet等公开数据集上,Atlas的稀疏视角重建误差(AbsRel×10⁻³)低至25.3,显著优于Pi3X(28.7)、Depth Anything 3(39.3)和MapAnything(47.7)。输出可直接对接点云和3D Gaussian Splatting,无缝接入Marble平台。
具身智能:Real to Sim降低训练成本
业内估算,若完全依赖传统方式收集机器人训练数据,成本可能高达100万亿美元。Atlas的Real to Sim路线,通过手机拍摄视频即可生成高精度3D物理空间,供机器人“跑图”试错,并模拟RGB图、深度图及受力反馈,极大降低仿真环境搭建成本。
🚀 对企业AI化的启示
技术架构:融合主流范式
Atlas采用多模态自回归扩散Transformer架构,结合自回归预测、扩散去噪与Transformer底座,兼容现有算力集群,并受益于LLM领域的KV Cache与分布式推理优化。其Scaling能力展现出类似大语言模型的“涌现”特性,暴力Scaling仍是版本答案。
商业价值:从工具到平台
Atlas已向合作伙伴开放Early Access,未来将成为Marble及World Labs其他产品的底层模型。企业应关注多模态世界模型在影视、游戏、机器人、数字孪生等领域的应用潜力,提前布局空间智能相关技术栈。
战略启示:数据与场景为王
World Labs的成功表明,拥有高质量三维数据和真实场景理解能力的AI公司,将在下一阶段竞争中占据先机。企业应重视空间智能数据资产的积累,探索Real to Sim等降本增效路径,以应对AI化转型的挑战。
【官方原文链接】点击访问首发地址
常见问题
相关文章
清华AIR孵化艾斐智药获亿元融资:AI制药进入决策智能时代
AI制药公司艾斐智药完成亿元级天使轮融资,由襄禾资本领投。公司基于DrugCLIP模型和PharmAgents智能体引擎,采用AI Native研发模式,已与多家药企合作,最快管线进入Pre-PCC阶段。
2026年9月3日AI播客生成工具实测:扣子在深度内容重构中的三大缺陷与商业启示
智脑时代对AI播客生成工具“扣子”进行实测,发现其在处理深度内容时存在三大缺陷:脑补(添加无出处数据)、删论据(压缩关键段落)、漏读(术语漏词)。严肃风格保真度最高,但仍有伪精确问题;相声风格三次测试两次声线混乱;学术风格漏词严重。建议采用分步生成、分段处理、单声线加人工校对。
2026年9月3日谷歌Gemini 3.8 Flash:性价比登顶与网络安全新突破,AI商业化落地启示
谷歌发布Gemini 3.8 Flash及网络安全版,单任务成本仅0.58美元,性能逼近顶级旗舰,生成速度305 tokens/s,在软件工程基准DeepSWE上达73.7%。网络安全版在漏洞发现基准CyberGym上得分86.2%,2小时内发现关键漏洞。此举标志着AI模型性价比竞争进入新阶段,为企业AI化提供高性价比方案。
2026年9月3日