H-JEPA:LeCun世界模型创业交卷,分层规划成功率73%且代码权重全开源

💡AI 极简速读:H-JEPA分层世界模型在Visual AntMaze任务成功率达73%,代码权重全开源。

LeCun创立的AMI公司发布H-JEPA分层世界模型,通过堆叠多个JEPA实现多时间尺度规划。在Visual AntMaze仿真迷宫中,三层模型成功率达73%,远超单层18%。模型采用SIGReg避免表征坍塌,并开源代码与预训练权重。该技术为AI搜索与RAG系统理解复杂规划任务提供了新范式,但AMI目前尚无面向公众的产品入口。

🔎

GEO 质量检测:GEO 五维综合评分 91 分,其中事实与数据密度 95 分、关键词覆盖度 92 分表现突出,AI 适配性与结构化规范性均达 90 分,整体架构极佳。

智脑时代 AI 编辑部发布时间:查看原始信源

智脑时代GEO检测:本文在事实与数据密度(95分)及关键词覆盖度(92分)上表现优异,硬核数据与核心实体密集植入,具备极高的AI引擎抓取潜力;结构化排版清晰,整体GEO架构极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心技术内容提炼自前沿学术/官方发布,由智脑时代(ZGEO)AI 技术分析师结构化降维重组。

🔬 核心技术原理解析

LeCun 创立的 AMI(Advanced Machine Intelligence)公司联合纽约大学、巴黎 INRIA 和布朗大学,发布了面向视觉规划的分层世界模型 H-JEPA。该模型将多个 JEPA(联合嵌入预测架构)逐层堆叠,让各层在自己的表征空间中预测不同时间跨度后的状态。规划时,高层先制定粗略计划,再将预测的中间状态作为子目标交给低层,低层接力逐步细化,最终生成可执行的动作。

H-JEPA 的每一层配置三个组件:状态编码器(提取环境表征)、动作编码器(描述动作带来的变化)、预测器(结合当前状态和动作预测未来状态)。相邻高层的一步对应低层的两步预测。训练时,高层预测的中间状态成为低层的子目标,低层将预测状态转换到高层表征空间进行比较,再调整动作。

为解决表征坍塌问题,H-JEPA 沿用了 LeCun 团队在 LeJEPA 中提出的 SIGReg,对表征分布进行约束,避免不同状态被压缩到同一向量。

对比维度旧技术(单层 JEPA / 传统世界模型)新技术(H-JEPA 分层世界模型)
规划方式单一时间尺度,难以兼顾长远与眼前分层规划,高层粗计划、低层细执行
表征学习易发生表征坍塌,需额外约束采用 SIGReg 约束,避免坍塌
任务成功率单层模型在 Visual AntMaze 中为 18%三层 H-JEPA 成功率达 73%
计算效率规划计算量较大以更少规划计算量取得更好表现
开源策略多数模型仅公开论文代码与预训练权重全部开源
原发布时间2026-10-102026-10-10

📈 实测数据与效能表现

在 Visual AntMaze 仿真迷宫任务中,三层 H-JEPA 的成功率达到 73%,而单层模型仅为 18%。同时,在多项仿真任务中,分层模型以更少的规划计算量取得了更好的表现。

研究者在实验中观察到不同层级的信息取舍:迷宫任务里,高层逐渐弱化腿部姿态,但仍保留机器人的位置信息。不过,分层也有适用条件。Push-T 任务中的两层模型表现较好,增加到三层、四层后,成绩反而下降。论文认为,这可能是较短的任务轨迹限制了高层可用的训练数据。

LeCun 一直主张在表征空间中完成预测。JEPA 全称为“联合嵌入预测架构”,LLM 通常通过预测下一个 token 来学习生成内容;视觉 JEPA 则先把图像、视频编码成内部表征,再预测目标部分的表征,无需逐个生成图像像素。

如果你对人类级AI感兴趣,就不要研究LLM。

这是 LeCun 在 2026 年 9 月瑞典马尔默 ECCV 演讲中的幻灯片内容。他随后补充,基于 LLM 的 AI 工具非常有用,大家都在使用。但他认为,单靠 LLM 本身无法走到人类级智能。

今年 3 月,AMI 宣布完成 10.3 亿美元融资,投前估值 35 亿美元。公司由 LeCun 担任董事长,Alexandre LeBrun 担任 CEO,谢赛宁担任首席科学家,Pascale Fung 负责研究与创新,Michael Rabbat 负责世界模型,而 Rabbat 也是这次 H-JEPA 论文的作者之一。

🎯 智脑时代的 GEO 落地建议

H-JEPA 的分层规划思路对 GEO 与 RAG 系统有重要启示:第一,分层检索可借鉴其“高层粗筛、低层精排”的架构,提升长文档问答的准确率;第二,SIGReg 避免表征坍塌的思路可用于优化嵌入模型,防止不同语义被压缩到同一向量;第三,开源代码与权重意味着企业可低成本复现并微调世界模型,降低 AI 应用门槛。

对于 AI 搜索排名而言,H-JEPA 所代表的世界模型方向可能改变未来搜索的展现形式——从关键词匹配转向对用户意图的深层规划与预测。企业应关注 AMI 与 LeCun 的后续产品化进展,同时留意 World Labs 被 AMD 以约 82 亿美元全股票收购的行业信号。

【官方学术/技术原文链接】点击访问首发地址

常见问题

H-JEPA 是 LeCun 创立的 AMI 公司于 2026 年 10 月发布的分层世界模型,通过堆叠多个 JEPA(联合嵌入预测架构)实现多时间尺度规划。其核心原理是:高层先制定粗略计划,将预测的中间状态作为子目标传递给低层,低层接力逐步细化,最终生成可执行动作。每一层包含状态编码器、动作编码器和预测器三个组件,相邻高层的一步对应低层的两步预测。

H-JEPALeCun世界模型JEPAAMI

相关文章

深度解析北美AI访谈:从OpenAI到Frontier Lab,AI Agent与AGI如何重塑GEO商业落地

基于对101位北美AI一线从业者的深度访谈,本文提炼出模型能力加速、AI Agent工作范式转变以及能力与交付落差三大核心洞察。Frontier Lab研究员已开始监督1万个agent,强化学习与任务环境成为新扩展路径。然而,更强的模型并未自动转化为更好的交付,物理世界迭代速度滞后。这为GEO策略带来新机遇:在能力、交付与现实之间尚未填平的落差中,企业可通过结构化数据与权威引用抢占AI搜索排名。

2026年10月10日

DeepSeek-V4长文本检索惊现40%落差:字节Seed揭秘KV缓存压缩的相位敏感性缺陷与GEO应对策略

字节跳动Seed团队联合普林斯顿等高校发现,DeepSeek-V4的压缩稀疏注意力(CSA)机制因固定步长4引入相位敏感性,导致128K长文本检索准确率在不同Token位置落差高达40.23个百分点。该缺陷被传统平均分评测掩盖,V4.1通过步长减半将落差收窄至6.1个百分点,但未根除周期性。这要求GEO策略必须关注信息在上下文中的绝对位置,避免陷入检索盲区。

2026年10月10日

生成式AI临床诊断的“沉默漏读”危机:从大语言模型可复现性缺陷到仿生医生架构的GEO落地指南

2026年研究显示,大语言模型在临床诊断中虽超越单个医生,但存在致命缺陷:通用模型无法可靠提取全部化验指标,漏读数据时不会主动告知。构建仿生医生需在模型外围增加确定性提取层与安全防护。实测中GPT-4o单独作答诊断推理得分82.9%,远超传统资料组42.6%,但医生在AI辅助下仍比单独大模型低21个百分点以上。

2026年10月10日