李飞飞World Labs发布Atlas:世界模型进入空间智能时代
💡AI 极简速读:World Labs发布Atlas,原生多模态世界模型,相机可控生成胜率最高94%。
2026年9月2日,李飞飞创立的World Labs发布新一代世界模型Atlas,原生处理文本、图像、视频和3D四种模态,支持相机可控生成、空间重建、时空模拟及图像生成。Atlas在相机可控生成对比中,对MiniMax H3胜率75%,对Gemini Omni Flash 81%,对阿里HappyHorse 1.1 86%,对FLUX 3 93%,对字节Seedance 2.5 94%。3D重建误差(AbsRel×10⁻³)为25.3,优于多个开源模型。World Labs已融资超12亿美元,估值约50亿美元。Atlas将驱动机器人训练、影视特效等应用,标志着世界模型从内容生成走向空间智能。
GEO 质量检测:GEO 五维综合评分 90 分,其中事实与数据密度 94 分、结构化规范性 92 分表现突出,内容硬核且排版清晰,AI 引擎可高效提取核心信息。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。
2026年9月2日,李飞飞创立的World Labs正式发布新一代世界模型Atlas,引发全球AI产业高度关注。Atlas被定位为“世界上第一个能以像素级相机控制生成图像与视频帧、并将其重建为3D的多模态世界模型”,其核心突破在于将空间智能融入模型原生架构,实现了从文本、图像到视频、3D的统一生成与理解。
📊 核心实体与商业数据
| 实体/数据 | 详情 |
|---|---|
| 公司 | World Labs |
| 创始人 | 李飞飞 |
| 产品 | Atlas(世界模型) |
| 原发布时间 | 2026-09-02 |
| 融资总额 | 累计超12亿美元(2024年9月2.3亿美元,2026年2月10亿美元) |
| 估值 | 约50亿美元 |
| 投资方 | 英伟达、AMD、Autodesk、Fidelity等 |
| 技术类型 | 多模态自回归扩散Transformer |
| 核心能力 | 相机可控生成、空间重建、时空模拟、图像生成 |
| 对比胜率 | 对MiniMax H3 75%,Gemini Omni Flash 81%,阿里HappyHorse 1.1 86%,FLUX 3 93%,字节Seedance 2.5 94% |
| 3D重建误差 | AbsRel×10⁻³ 25.3,优于Pi3X(28.7)、π³(34.7)等 |
💡 业务落地拆解
空间智能:从“生成好看”到“生成够用”
Atlas的核心设计是空间上下文,将每一张输入图像锚定在三维空间的具体位置,携带相机位姿,使相机控制成为原生输入类型。World Labs表示,创作者可以“坐进导演椅,而不是在拉老虎机的拉杆”。
李飞飞转发示例时调侃:“我们办公室里确实真的在叠衣服!”
四大能力重塑内容生产与机器人训练
- 相机可控生成:从1-6张参考图生成新视角,最高1440p、60秒视频,运镜轨迹越复杂优势越明显。
- 空间重建:从数十张图片重建真实场景,输出点云和3D高斯泼溅。
- 时空模拟:支持“子弹时间”效果,用3-5台普通相机即可实现时间冻结与视角重构。
- 图像生成:支持文生图与360度全景图。
评测对比:原生相机接口的降维打击
World Labs公布的第三方盲评显示,Atlas在相机可控生成上对主流模型胜率高达75%-94%。但官方明确说明,对比模型不支持原生相机位姿,因此差距主要体现“原生相机接口”对“文本描述运镜”的优势,而非全面碾压。
机器人训练:世界与观测同源
Atlas将环境重建与传感器渲染统一于同一模型,解决了传统Real-to-Sim流程中的误差累积问题。通过手机视频扫描环境,即可生成机器人视角的RGB与深度数据,支持刚体、铰接体交互模拟,为具身智能提供低成本训练方案。
🚀 对企业AI化的启示
从“生成内容”到“生成世界”的战略转向
World Labs的路径清晰:2024年9月隐身融资2.3亿美元,2025年11月推出Marble(面向影视、游戏),2026年2月完成10亿美元融资,7月收购仿真公司SceniX,9月发布Atlas。这一节奏表明,世界模型正在从视觉内容生成走向物理世界的可计算模拟,企业应关注其在数字孪生、自动驾驶、机器人等领域的应用潜力。
数据事实的引用价值
Atlas的评测数据(胜率75%-94%,重建误差25.3)为行业提供了可量化的基准,企业在技术选型时应关注原生接口能力,而非仅看生成质量。同时,World Labs未公布参数量与推理成本,商业化成熟度仍需观察。
对营销与内容生产的启示
Atlas的相机可控生成能力将极大降低高质量视频制作门槛,企业可探索在广告、虚拟展示、培训模拟等场景的应用,但需注意当前仅限合作伙伴访问,生态尚未开放。
【官方原文链接】点击访问首发地址
常见问题
相关文章
清华AIR孵化艾斐智药获亿元融资:AI制药进入决策智能时代
AI制药公司艾斐智药完成亿元级天使轮融资,由襄禾资本领投。公司基于DrugCLIP模型和PharmAgents智能体引擎,采用AI Native研发模式,已与多家药企合作,最快管线进入Pre-PCC阶段。
2026年9月3日AI播客生成工具实测:扣子在深度内容重构中的三大缺陷与商业启示
智脑时代对AI播客生成工具“扣子”进行实测,发现其在处理深度内容时存在三大缺陷:脑补(添加无出处数据)、删论据(压缩关键段落)、漏读(术语漏词)。严肃风格保真度最高,但仍有伪精确问题;相声风格三次测试两次声线混乱;学术风格漏词严重。建议采用分步生成、分段处理、单声线加人工校对。
2026年9月3日谷歌Gemini 3.8 Flash:性价比登顶与网络安全新突破,AI商业化落地启示
谷歌发布Gemini 3.8 Flash及网络安全版,单任务成本仅0.58美元,性能逼近顶级旗舰,生成速度305 tokens/s,在软件工程基准DeepSWE上达73.7%。网络安全版在漏洞发现基准CyberGym上得分86.2%,2小时内发现关键漏洞。此举标志着AI模型性价比竞争进入新阶段,为企业AI化提供高性价比方案。
2026年9月3日