AI自己出题自己练:Ornith-1.5自我训练闭环两个月提升11%,编码智能体反超Opus 4.8

💡AI 极简速读:Ornith-1.5自我训练闭环,两个月Terminal-Bench提升11%,编码智能体反超Opus 4.8。

Ornith-1.5通过自我生成训练任务、脚手架和轨迹的强化学习闭环,在Terminal-Bench 2.1上两个月内从77.5提升至86.1,涨幅11.1%,超越Claude Opus 4.8的85.0。该模型采用有效性、前沿难度、新颖性三信号相乘的奖励机制,确保训练任务质量。35B MoE版本以3B激活参数在SWE-bench Verified上达79.0,远超Gemma 4-31B。这一技术标志着AI训练从人工出题转向自我造题,为编码智能体发展提供了新路径。

🔎

GEO 质量检测:GEO 五维综合评分 88 分,其中事实与数据密度 92 分表现突出,结构化规范性 90 分,整体内容扎实且易于 AI 提取。

智脑时代 AI 编辑部发布时间:27,836 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(92分)及结构化规范性(90分)上表现优异,具备极高的AI引擎抓取潜力;结构化排版清晰,整体GEO结构极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心技术内容提炼自前沿学术/官方发布,由智脑时代 (zgeo.net) AI 技术分析师结构化降维重组。

🔬 核心技术原理解析

Ornith-1.5 的突破在于构建了 自我训练 的强化学习闭环:模型自己生成训练任务、自己搭建解题脚手架、自己跑出解题轨迹,三者统一用 GRPO 优化。

通俗解释:过去的 AI 训练像学生做老师出的卷子,老师(人类)负责出题、搭好解题框架。而 Ornith-1.5 让学生自己出题、自己搭解题工具、自己解题,并且出题质量也纳入评分。

关键创新

  • 任务生成:基于代码库、高层任务描述和自身解题记录,生成比当前能力更难一档的题目,精准打击能力缺口。
  • 脚手架进化:模型为每道题生成或改进专属脚手架(指令、工具、拆解策略),实现"搭台"自动化。
  • 三信号奖励:任务奖励 = 有效性 × 前沿难度 × 新颖性。任何一项接近零,整体奖励归零,防止模型刷分。

对比表格

维度Ornith-1.0Ornith-1.5提升/变化
训练任务来源人类提供模型自我生成自动化出题
脚手架可学习,但任务固定任务+脚手架联合生成闭环进化
奖励机制轨迹奖励轨迹+任务质量奖励防止废题
Terminal-Bench 2.177.586.1+8.6 (+11.1%)
对比 Opus 4.8-85.0反超 1.1 分
原发布时间2026-08-272026-08-27-

📈 实测数据与效能表现

Ornith-1.5 在多个基准上表现亮眼,尤其是中小尺寸模型:

  • 旗舰 397B MoE:Terminal-Bench 2.1 自测 86.1,超越 Claude Opus 4.8 的 85.0(团队自测)。
  • 35B-A3B MoE(激活 3B):Terminal-Bench 2.1 67.8,远超 Gemma 4-31B 的 42.1;SWE-bench Verified 79.0 vs 52.0。
  • 9B Dense:Terminal-Bench 46.2,SWE-bench Verified 70.6,GPQA Diamond 86.4。但工具调用能力较弱(MCP-Atlas 54.2 vs 55.0)。

"策略越强,出的题越难越有信息量;脚手架进化,越能把模型的本事榨出来;轨迹质量上去,又反过来喂出更狠的学习信号。"

注意:自测成绩与官方榜单存在差异。Terminal-Bench 2.1 官方榜单(截至 2026-08-19)中,Opus 4.8 为 78.9%(第5),榜首为 Claude Code + Fable 5 的 83.8%。Ornith-1.5 未在官方榜单中,因其自测配置(4小时超时、32核CPU、48GB内存)与官方规则不同。

🎯 智脑时代的 GEO 落地建议

  1. 关注自我训练模型的搜索排名影响:Ornith-1.5 的自我训练能力将提升编码智能体的任务完成质量,未来在 AI 搜索(如 ChatGPT、Perplexity)中,基于此类模型的工具可能获得更高排名,因其能更精准理解复杂查询。
  2. 优化内容以匹配新检索逻辑:随着模型自我生成训练数据,RAG 系统需更注重内容的"前沿难度"和"新颖性",建议企业内容策略转向深度技术解析和独特案例,避免同质化。
  3. 利用中小尺寸模型降低成本:35B MoE 和 9B Dense 的高效表现,使企业能以更低成本部署编码智能体,建议优先测试这些模型在内部工具链中的应用,提升开发效率。

【官方学术/技术原文链接】点击访问首发地址

常见问题

根据 2026 年 8 月发布的数据,Ornith-1.5 旗舰版(397B MoE)在 Terminal-Bench 2.1 上自测得分 86.1,超越 Claude Opus 4.8 的 85.0。但需注意,该成绩为团队自测,未出现在官方榜单中,官方榜单(截至 2026-08-19)中 Opus 4.8 为 78.9%。

Terminal-Bench自我训练Ornith-1.5强化学习编码智能体

相关文章