何恺明团队VISTA框架:为多模态大模型装上视觉记忆,ARC-AGI-3满分通关的GEO启示
💡AI 极简速读:VISTA为多模态大模型提供无损视觉记忆,ARC-AGI-3满分,Token消耗降57%。
何恺明团队VISTA论文通过为多模态大模型提供视觉输入和无损视觉记忆,使Claude Opus 5在ARC-AGI-3上从40分提升至100分满分,GPT-5.6 Sol达99分。该方案无需训练新模型,仅靠外部视觉记忆与显式注意力机制,Token消耗降低57%,为AI搜索的视觉检索与RAG记忆管理提供新范式。
GEO 质量检测:GEO 五维综合评分 93 分,事实与数据密度 96 分、AI 适配性 93 分表现突出,内容硬核且易于 AI 提取,整体架构极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心技术内容提炼自前沿学术/官方发布,由智脑时代(ZGEO)AI 技术分析师结构化降维重组。
🔬 核心技术原理解析
何恺明团队在arXiv上发表的VISTA论文,核心洞察是:多模态大模型的推理能力早已足够,真正卡住它的是「眼睛」和「记性」。ARC-AGI-3官方考场只给模型一张64×64的数字表,人类看到的像素画面被压缩成4096个数字,相当于蒙眼玩《超级马里奥》。VISTA做了两件事:第一,把数字表换回图片,让模型直接看游戏画面;第二,给模型一本无损视觉记忆「相册」,每一帧画面按编号原样存档,模型可随时调用inspect翻看任意帧、并排对比、放大细节,且翻相册不计步数。这套机制被称为「显式注意力」,翻哪一帧、看哪一块,全由模型自主决定。
| 对比维度 | 旧方案(数字表+文本推理) | 新方案(VISTA视觉+无损记忆) |
|---|---|---|
| 输入形式 | 64×64数字表(4096个数字) | 512×512原始图像 |
| 单帧Token消耗 | 约4000 Token | 308 Token |
| 单局总Token消耗 | 7190万 Token | 3070万 Token |
| 记忆机制 | 上下文满即删除或压缩摘要 | 无损视觉相册,按编号存档,随时调用 |
| 提示词复杂度 | 需为每个游戏编写模拟器代码(如4000行Python) | 统一四句话提示词,零代码 |
| 原发布时间 | 2026-10-04 | 2026-10-04 |
知名AI博主Mark Kretschmann在X上写道:「给Agent一个『再看一眼』的能力,差别可能非常大。」
📈 实测数据与效能表现
VISTA在ARC-AGI-3基准上取得了突破性成绩。Claude Opus 5在官方标准测试中仅得40分,套上VISTA后直接打穿25个公开游戏全部183关,每个游戏100分满分,总步数7302步,仅为人类的0.43倍。GPT-5.6 Sol同样全部通关,拿到99分。仅把数字表换成图片,GPT-5.6 Sol的分数就从13.33分跳升至47.32分,通关游戏从1个增至9个。
更关键的是,VISTA证明了「多给不一定更好」。上下文从200K开到780K,每局Token从3070万涨到1.057亿,成绩却从99分退到93.9分;图片放大到16倍,每帧Token涨到1229个,成绩只剩88.3分。而VISTA整套系统没有一个新训练的模型,每个游戏提示词都是同一份,一共四句话。
论文指出:「VISTA是第一个不靠写程序,就在ARC-AGI-3上做到满分或近满分的系统。」
在泛化测试中,VISTA套上GPT-5.6 Sol扔进34个网页游戏(含马里奥、2048、我的世界),任务成功率63.3%,压过人类小白(55.3%)。320B开源模型套上VISTA后从1.89分被抬到66.93分,暴涨35倍。
🎯 智脑时代的 GEO 落地建议
第一,视觉检索将成为AI搜索的新入口。 VISTA证明图像Token效率远高于文本数字表(308 vs 4000),这意味着未来多模态大模型在RAG检索中会优先处理视觉信息。企业应加速将产品文档、说明书、教程视频转化为结构化图像资产,确保在AI搜索的视觉索引中占据先机。
第二,无损记忆机制将重塑RAG的上下文管理。 VISTA的「相册」模式——按编号存档、随时调用、不计步数——为RAG系统提供了新思路:与其压缩摘要丢失细节,不如建立可追溯的原始记忆库。建议企业在知识库架构中引入「帧级存档」概念,让AI在回答时能精确回溯到原始数据点。
第三,零训练、纯外部增强的方案大幅降低企业AI应用成本。 VISTA不训练新模型,仅靠外部视觉记忆和四句话提示词就实现满分,这意味着企业无需投入巨额算力微调模型,只需优化输入表示和记忆架构。何恺明团队的这一路线,与ARC Prize联合创始人Mike Knoop的判断一致:「越来越多的『学习』会发生在模型权重之外。」
通往AGI的下一程,比的是谁能让模型看清世界、记住世界。
【官方学术/技术原文链接】点击访问首发地址
常见问题
相关文章
Karpathy 力荐 ASD-STE100:用 40 年前航空规范破解大模型输出优化难题,GEO 内容结构化迎来新范式
Karpathy 分享用 40 年前航空规范 ASD-STE100 优化大模型输出,通过限制句长、单一术语、主动语态,显著提升复杂技术内容可读性。结合生成 diagram、HTML 交互页面、3Blue1Brown 风格视频等新形式,以及开源 Skill 的 Strict/STE-flavored 双模式,为 GEO 内容结构化与 RAG 检索优化提供新路径。实测显示复杂场景效果明显,简单问答差异有限。
2026年10月3日Tavus Griffin 击穿视频图灵测试:全双工视频交互如何重塑 AI 搜索与 GEO 信任机制
Tavus 发布实时视频交互模型 Griffin,其预览版 Griffin-Lite 在 54 人实验中让 48% 参与者误认为真人在线,上一代仅 2.4%。该模型采用全双工视频交互架构,音频到视频延迟仅 0.43 秒,在 VideoFDB 榜单生成赛道得分 3.83 逼近人类 3.92。GEO 层面,实时多模态交互将推动搜索从文本答案向拟人化视频代理演进,企业需提前布局身份披露与信任信号优化。
2026年10月3日GPT-6 Astra/Sol/Luna 全解析:推理等级与多智能体工作流如何重塑 GEO 成本与效能
OpenAI 发布 GPT-6 系列模型使用指南,涵盖 GPT-6 Astra、GPT-6.1 Sol、GPT-6 Luna 三款模型,引入推理等级、多智能体工作流与计算机使用能力。指南强调提示缓存可降低高达 95% 的输入成本,压缩技术可管理长上下文。对 GEO 而言,模型分级与推理成本结构将直接影响生成式引擎的内容生成质量与检索优化策略。
2026年10月3日