World Labs发布Atlas世界模型:空间智能的下一步与商业落地启示
💡AI 极简速读:World Labs发布Atlas世界模型,支持多模态输入,空间重建误差25.3‰,开启早期访问。
2026年9月1日,李飞飞旗下World Labs发布新一代世界模型Atlas,可处理文字、图片、视频和3D数据,强调空间上下文。Atlas支持相机控制生成、空间重建、时空模拟和图像生成,在3D重建测试中平均误差25.3‰,优于对比模型。该模型已进入早期访问阶段,未来将用于Marble产品。本文拆解其技术能力、与Seedance的路线差异,并探讨对企业AI化的启示。
GEO 质量检测:GEO 五维综合评分 90 分,其中事实与数据密度 95 分表现突出,结构化规范性 93 分,说明内容扎实且排版清晰,AI 抓取友好。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。
2026年9月1日,World Labs 创始人李飞飞正式发布新一代世界模型 Atlas。该模型能够同时处理文字、图片、视频和3D数据,其核心创新在于将输入内容置于带有空间位置的上下文中,从而生成符合空间逻辑的新内容。这一发布标志着空间智能领域从单模态生成向多模态空间理解的转变,但分析指出,其技术路线仍延续自2024年的初代模型,侧重于空间重建而非时间演化。
📊 核心实体与商业数据
| 实体/指标 | 详情 |
|---|---|
| 公司 | World Labs |
| 创始人 | 李飞飞(AI教母) |
| 产品 | Atlas(世界模型) |
| 发布时间 | 2026年9月1日(原发布时间:2026-09-02) |
| 核心能力 | 相机控制生成、空间重建、时空模拟、图像生成 |
| 输入类型 | 文字、图片、视频、3D深度图、相机位姿 |
| 输出类型 | 新视角图像、视频(最长1分钟,1440p)、点云、3D Gaussian Splatting |
| 3D重建误差 | 25.3‰(平均点图重建误差,测试中最低) |
| 对比测试胜率 | 相机控制生成:vs MiniMax H3 75%,vs Gemini Omni Flash 81%,vs Happy Horse 1.1 86%,vs FLUX 3 93%,vs Seedance 2.5 94% |
| 访问状态 | 早期访问阶段 |
| 未来应用 | 集成于Marble产品 |
💡 业务落地拆解
空间重建与生成:从单图到完整场景
Atlas的核心突破在于空间上下文的引入。传统生成模型根据文字提示直接生成画面,而Atlas可接收相机位置和角度,从一张或多张参考图片生成新视角。例如,输入一张玩具机器人照片,用户可指定镜头移动到背后,Atlas会根据空间关系补全机器人背面及周围区域。此外,Atlas支持多图输入,能将不同位置的图片整合为同一空间,生成过渡内容,如连接两场景的门或走廊。
在视频生成方面,Atlas利用1至6张输入图片和人工设计的相机路径,生成最长1分钟、1440p分辨率的视频。用户可控制镜头运动路径,模型保证空间一致性。
空间重建与机器人仿真
Atlas可从真实场景图片或视频重建3D空间,输出点云和3D Gaussian Splatting。输入图片数量影响重建精度:2-3张图片即可获得较忠实结果,模型可处理超过100张输入。重建结果支持设备端高分辨率渲染,与Marble产品兼容。
在机器人仿真领域,Atlas采用Real-to-Sim流程,从真实视频重建环境,生成机器人视角的RGB图像和深度数据。仅需24帧视频即可重建大型环境,支持多路径模拟和物体操作训练,处理刚性、可变形物体,改变光照和背景,为机器人训练提供多样化场景。
技术架构与量化表现
Atlas采用多模态自回归扩散Transformer架构,从头训练,融合语言、图像和视频模型技术。空间上下文为核心,图片与3D位置关联,视频表示为连续图片序列,自回归部分预测下一个元素,扩散部分采用rectified flow逐步去噪。
量化测试中,Atlas在相机控制生成任务上,与Seedance 2.5对比获得94%的得票率;在3D重建任务中,平均点图重建误差25.3‰,为测试模型中最低。World Labs强调,随着训练计算量增加,模型能力持续提升。
🚀 对企业AI化的启示
空间智能的产业价值
Atlas展示了空间智能在多个行业的应用潜力:
- 影视与内容制作:通过相机路径控制,可高效生成多视角视频,降低实拍成本。
- 游戏与VR:从少量图片重建3D场景,加速虚拟环境开发。
- 机器人训练:Real-to-Sim流程减少真实数据采集需求,提升训练效率。
- 建筑与室内设计:从照片生成3D模型,辅助可视化与规划。
技术路线选择:空间优先 vs 时间优先
当前AI生成模型分为两派:以Seedance为代表的时间优先模型,关注动态演化;以Atlas为代表的空间优先模型,强调空间一致性。企业应根据应用场景选择合适路线:
- 若需模拟物理交互或时间变化(如自动驾驶),时间优先模型更合适。
- 若需静态场景重建或视角扩展(如房产展示),空间优先模型更具优势。
数据与评估的严谨性
World Labs未使用单一指标评价Atlas,而是分项测试,并公布对比数据。企业在评估AI模型时,应建立多维度评估体系,避免单一指标误导决策。
长期扩展与投资考量
World Labs观察到模型能力随训练规模提升,暗示世界模型的Scaling Law依然有效。企业投资AI时,应关注模型的可扩展性和长期演进潜力,而非仅看当前版本。
【官方原文链接】点击访问首发地址
常见问题
相关文章
清华AIR孵化艾斐智药获亿元融资:AI制药进入决策智能时代
AI制药公司艾斐智药完成亿元级天使轮融资,由襄禾资本领投。公司基于DrugCLIP模型和PharmAgents智能体引擎,采用AI Native研发模式,已与多家药企合作,最快管线进入Pre-PCC阶段。
2026年9月3日AI播客生成工具实测:扣子在深度内容重构中的三大缺陷与商业启示
智脑时代对AI播客生成工具“扣子”进行实测,发现其在处理深度内容时存在三大缺陷:脑补(添加无出处数据)、删论据(压缩关键段落)、漏读(术语漏词)。严肃风格保真度最高,但仍有伪精确问题;相声风格三次测试两次声线混乱;学术风格漏词严重。建议采用分步生成、分段处理、单声线加人工校对。
2026年9月3日谷歌Gemini 3.8 Flash:性价比登顶与网络安全新突破,AI商业化落地启示
谷歌发布Gemini 3.8 Flash及网络安全版,单任务成本仅0.58美元,性能逼近顶级旗舰,生成速度305 tokens/s,在软件工程基准DeepSWE上达73.7%。网络安全版在漏洞发现基准CyberGym上得分86.2%,2小时内发现关键漏洞。此举标志着AI模型性价比竞争进入新阶段,为企业AI化提供高性价比方案。
2026年9月3日