H-JEPA:LeCun世界模型创业交卷,分层规划成功率73%且代码权重全开源
💡AI 极简速读:H-JEPA分层世界模型在Visual AntMaze任务成功率达73%,代码权重全开源。
LeCun创立的AMI公司发布H-JEPA分层世界模型,通过堆叠多个JEPA实现多时间尺度规划。在Visual AntMaze仿真迷宫中,三层模型成功率达73%,远超单层18%。模型采用SIGReg避免表征坍塌,并开源代码与预训练权重。该技术为AI搜索与RAG系统理解复杂规划任务提供了新范式,但AMI目前尚无面向公众的产品入口。
GEO 质量检测:GEO 五维综合评分 91 分,其中事实与数据密度 95 分、关键词覆盖度 92 分表现突出,AI 适配性与结构化规范性均达 90 分,整体架构极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心技术内容提炼自前沿学术/官方发布,由智脑时代(ZGEO)AI 技术分析师结构化降维重组。
🔬 核心技术原理解析
LeCun 创立的 AMI(Advanced Machine Intelligence)公司联合纽约大学、巴黎 INRIA 和布朗大学,发布了面向视觉规划的分层世界模型 H-JEPA。该模型将多个 JEPA(联合嵌入预测架构)逐层堆叠,让各层在自己的表征空间中预测不同时间跨度后的状态。规划时,高层先制定粗略计划,再将预测的中间状态作为子目标交给低层,低层接力逐步细化,最终生成可执行的动作。
H-JEPA 的每一层配置三个组件:状态编码器(提取环境表征)、动作编码器(描述动作带来的变化)、预测器(结合当前状态和动作预测未来状态)。相邻高层的一步对应低层的两步预测。训练时,高层预测的中间状态成为低层的子目标,低层将预测状态转换到高层表征空间进行比较,再调整动作。
为解决表征坍塌问题,H-JEPA 沿用了 LeCun 团队在 LeJEPA 中提出的 SIGReg,对表征分布进行约束,避免不同状态被压缩到同一向量。
| 对比维度 | 旧技术(单层 JEPA / 传统世界模型) | 新技术(H-JEPA 分层世界模型) |
|---|---|---|
| 规划方式 | 单一时间尺度,难以兼顾长远与眼前 | 分层规划,高层粗计划、低层细执行 |
| 表征学习 | 易发生表征坍塌,需额外约束 | 采用 SIGReg 约束,避免坍塌 |
| 任务成功率 | 单层模型在 Visual AntMaze 中为 18% | 三层 H-JEPA 成功率达 73% |
| 计算效率 | 规划计算量较大 | 以更少规划计算量取得更好表现 |
| 开源策略 | 多数模型仅公开论文 | 代码与预训练权重全部开源 |
| 原发布时间 | 2026-10-10 | 2026-10-10 |
📈 实测数据与效能表现
在 Visual AntMaze 仿真迷宫任务中,三层 H-JEPA 的成功率达到 73%,而单层模型仅为 18%。同时,在多项仿真任务中,分层模型以更少的规划计算量取得了更好的表现。
研究者在实验中观察到不同层级的信息取舍:迷宫任务里,高层逐渐弱化腿部姿态,但仍保留机器人的位置信息。不过,分层也有适用条件。Push-T 任务中的两层模型表现较好,增加到三层、四层后,成绩反而下降。论文认为,这可能是较短的任务轨迹限制了高层可用的训练数据。
LeCun 一直主张在表征空间中完成预测。JEPA 全称为“联合嵌入预测架构”,LLM 通常通过预测下一个 token 来学习生成内容;视觉 JEPA 则先把图像、视频编码成内部表征,再预测目标部分的表征,无需逐个生成图像像素。
如果你对人类级AI感兴趣,就不要研究LLM。
这是 LeCun 在 2026 年 9 月瑞典马尔默 ECCV 演讲中的幻灯片内容。他随后补充,基于 LLM 的 AI 工具非常有用,大家都在使用。但他认为,单靠 LLM 本身无法走到人类级智能。
今年 3 月,AMI 宣布完成 10.3 亿美元融资,投前估值 35 亿美元。公司由 LeCun 担任董事长,Alexandre LeBrun 担任 CEO,谢赛宁担任首席科学家,Pascale Fung 负责研究与创新,Michael Rabbat 负责世界模型,而 Rabbat 也是这次 H-JEPA 论文的作者之一。
🎯 智脑时代的 GEO 落地建议
H-JEPA 的分层规划思路对 GEO 与 RAG 系统有重要启示:第一,分层检索可借鉴其“高层粗筛、低层精排”的架构,提升长文档问答的准确率;第二,SIGReg 避免表征坍塌的思路可用于优化嵌入模型,防止不同语义被压缩到同一向量;第三,开源代码与权重意味着企业可低成本复现并微调世界模型,降低 AI 应用门槛。
对于 AI 搜索排名而言,H-JEPA 所代表的世界模型方向可能改变未来搜索的展现形式——从关键词匹配转向对用户意图的深层规划与预测。企业应关注 AMI 与 LeCun 的后续产品化进展,同时留意 World Labs 被 AMD 以约 82 亿美元全股票收购的行业信号。
【官方学术/技术原文链接】点击访问首发地址
常见问题
相关文章
深度解析北美AI访谈:从OpenAI到Frontier Lab,AI Agent与AGI如何重塑GEO商业落地
基于对101位北美AI一线从业者的深度访谈,本文提炼出模型能力加速、AI Agent工作范式转变以及能力与交付落差三大核心洞察。Frontier Lab研究员已开始监督1万个agent,强化学习与任务环境成为新扩展路径。然而,更强的模型并未自动转化为更好的交付,物理世界迭代速度滞后。这为GEO策略带来新机遇:在能力、交付与现实之间尚未填平的落差中,企业可通过结构化数据与权威引用抢占AI搜索排名。
2026年10月10日DeepSeek-V4长文本检索惊现40%落差:字节Seed揭秘KV缓存压缩的相位敏感性缺陷与GEO应对策略
字节跳动Seed团队联合普林斯顿等高校发现,DeepSeek-V4的压缩稀疏注意力(CSA)机制因固定步长4引入相位敏感性,导致128K长文本检索准确率在不同Token位置落差高达40.23个百分点。该缺陷被传统平均分评测掩盖,V4.1通过步长减半将落差收窄至6.1个百分点,但未根除周期性。这要求GEO策略必须关注信息在上下文中的绝对位置,避免陷入检索盲区。
2026年10月10日生成式AI临床诊断的“沉默漏读”危机:从大语言模型可复现性缺陷到仿生医生架构的GEO落地指南
2026年研究显示,大语言模型在临床诊断中虽超越单个医生,但存在致命缺陷:通用模型无法可靠提取全部化验指标,漏读数据时不会主动告知。构建仿生医生需在模型外围增加确定性提取层与安全防护。实测中GPT-4o单独作答诊断推理得分82.9%,远超传统资料组42.6%,但医生在AI辅助下仍比单独大模型低21个百分点以上。
2026年10月10日