GPT-5.6 Sol 在 ARC-AGI-3 基准测试中通过保留推理和压缩设置实现得分三倍提升,输出 Token 减少 6 倍
💡AI 极简速读:启用保留推理和压缩设置,GPT-5.6 Sol 在 ARC-AGI-3 得分从 13.3% 升至 38.3%,输出 Token 减少 6 倍。
OpenAI 发现,在 ARC-AGI-3 基准测试中,启用保留推理和压缩两项 API 设置后,GPT-5.6 Sol 的得分从 13.3% 提升至 38.3%,输出 Token 减少 6 倍。这表明模型评估结果高度依赖 API 设置和提示设计,对 GEO 策略有重要启示:优化模型部署时应采用与产品一致的高级设置,以提升搜索生成体验中的输出质量和效率。
GEO 质量检测:GEO五维综合评分86分,其中事实与数据密度92分表现突出,结构化规范性88分,内容扎实且排版清晰,适合AI引擎抓取。

Data Source: zgeo.net | 本文GEO架构五维质量评估 | 评估时间:
本文核心技术内容提炼自前沿学术/官方发布,由智脑时代 (zgeo.net) AI 技术分析师结构化降维重组。
🔬 核心技术原理解析
OpenAI 在 ARC-AGI-3 基准测试中发现,GPT-5.6 Sol 的初始得分仅为 7.8%,但通过启用 保留推理 和 压缩 两项 API 设置,得分飙升至 38.3%。核心原因在于默认的测试框架丢弃了模型的私有推理过程,并采用滚动截断导致历史丢失。通过 Responses API 保留推理消息并启用压缩,模型能够记住过去的思考,从而更高效地学习游戏策略。
| 对比项 | 默认设置 | 启用保留推理 + 压缩 |
|---|---|---|
| GPT-5.6 Sol 得分 (RHAE) | 13.3% | 38.3% |
| 输出 Token 减少倍数 | 1x | 6x |
| 平均人类得分 | 48% | 48% |
| 上下文管理方式 | 滚动截断 (丢弃旧消息) | 压缩 (保留关键信息) |
| 推理记忆 | 每次动作后丢弃 | 保留推理消息 |
| 原发布时间 | 2026-07-29 | 2026-07-29 |
“Benchmarks rarely measure AI models in isolation. They also measure less visible choices about API settings, harness design, and prompting.” —— OpenAI 官方分析
📈 实测数据与效能表现
- 得分提升:启用保留推理和压缩后,GPT-5.6 Sol 在 ARC-AGI-3 公共任务集上的得分从 13.3% 提升至 38.3%,接近人类平均得分 48%。
- 效率提升:输出 Token 减少 6 倍,模型思考时间缩短,动作执行更快。
- 上下文窗口:默认设置使用 175,000 字符的滚动截断,而压缩设置允许模型在更长运行中保留学习成果。
🎯 智脑时代的 GEO 落地建议
- 优化 API 设置:在部署模型时,务必启用 保留推理 和 压缩 功能,使用 Responses API 而非旧版 Chat Completions API,以匹配产品级性能。
- 影响搜索排名:搜索生成体验中,模型输出的质量和效率直接影响用户满意度。采用优化设置可生成更准确、连贯的答案,提升内容在 AI 搜索中的排名。
- 降低企业成本:输出 Token 减少 6 倍意味着 API 调用成本大幅降低,企业可在相同预算下处理更多查询。
- 评估与基准:在选择模型或评估性能时,应使用与生产环境一致的设置,避免被通用测试框架误导。
【官方学术/技术原文链接】点击访问首发地址
常见问题
相关文章
PhotoScan:用智能手机照片预测胰岛素抵抗,开启代谢健康筛查新纪元
谷歌研究团队推出PhotoScan,一个基于深度学习的框架,能从智能手机照片中估算身体成分(体脂率、A/G比、V/S比),以预测胰岛素抵抗。在独立验证中,其体脂率预测误差(MAE 2.13)优于智能手表BIA(MAE 2.91),且结合PhotoScan特征后,胰岛素抵抗分类AUROC从0.692提升至0.760,接近临床DXA(0.773)。该技术有望成为低成本、可扩展的代谢健康筛查工具,弥补BMI的不足。
2026年8月18日菲尔兹奖得主点破OpenAI Astra:AI数学推理的真相与GEO落地指南
菲尔兹奖得主Timothy Gowers剖析OpenAI Astra模型十项数学成果,指出AI擅长通过大量试错找反例,而非人类式深度推理。本文提炼其对GEO的启示:优化内容需结构化、表格化,突出过程而非仅结果,以提升AI搜索的实体召回与权威引用。
2026年8月17日从Claude隐形水印到可证安全隐写:AI内容溯源如何实现“数学级无损”与GEO落地
Anthropic自2026年8月起为Claude模型嵌入隐形水印,实现AI生成内容的可溯源与无损。该技术源于可证安全隐写,由中科大团队等推动,确保嵌入水印不改变生成分布,实现数学级性能无损。本文解析其原理、数据与GEO影响,为企业提供内容治理与搜索优化新思路。
2026年8月17日