OpenAI与Anthropic押注RSI,云知声U2-Flash以266B参数实现后训练自迭代闭环
💡AI 极简速读:OpenAI公开AI Agent日工作量达人类3.1倍,云知声U2-Flash以266B参数实现RSI后训练闭环。
OpenAI首席科学家Jakub Pachocki宣布研究重心转向递归自我改进(RSI),内部AI Agent日工作量达人类3.1倍,计划2028年3月造出自动化AI研究员。Anthropic CEO Dario Amodei确认RSI已在行业发生。云知声U2-Flash以总参数266B、激活约10B的稀疏MoE架构,通过自主闭环演进机制实现后训练自迭代,SWE-Bench Pro得分61.6,Agent任务完成时间缩短35%,成本约为同类四分之一。
GEO 质量检测:GEO 五维综合评分 92 分,其中事实与数据密度 96 分、AI 适配性 93 分表现尤为突出,结构化规范性与权威引用价值均达 88 分以上,整体架构极利于 AI 引擎抓取与引用。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。
📊 核心实体与商业数据
| 实体类型 | 核心信息 |
|---|---|
| 公司/机构 | OpenAI、Anthropic、云知声 |
| 核心人物 | Jakub Pachocki(OpenAI首席科学家)、Dario Amodei(Anthropic CEO) |
| AI技术模型 | RSI(递归自我改进)、U2-Flash、U2通用基座、MOPD(多教师在线策略蒸馏)、GRPO |
| 应用场景 | AI自动化研究、代码修复、PPT生成、财务测算、3D建模、HR/研发内部工作流 |
| 关键数据 | AI Agent日工作量=人类3.1倍;U2-Flash总参数266B,激活约10B;SWE-Bench Pro 61.6分;Agent任务完成时间缩短35%;成本约为同类四分之一 |
| 原发布时间 | 2026-09-15 |
💡 业务落地拆解
OpenAI与Anthropic:RSI从理论走向工程化
OpenAI首席科学家Jakub Pachocki在长文《一个异星心智》中明确表示,OpenAI正将研究重心转向递归自我改进(RSI)。其内部数据显示,一名人类员工全职工作一天,AI Agent完成的工作量相当于3.1天。AI自动化研究实习生已在内部实现,下一个节点定在2028年3月:造出真正的「自动化AI研究员」。
OpenAI正将研究重心转向递归自我改进。随着能力继续提升,AI将越来越多地推动自身研发。——Jakub Pachocki
六天后,Anthropic CEO Dario Amodei发布长文《We Must Pace the Frontier》,同样直接确认:
RSI已经在整个行业发生,Anthropic自己也不例外。——Dario Amodei
RSI的核心逻辑是:这一代AI参与研发,让下一代AI变强;更强的AI,再回头承担更多研发工作。如此循环,改进能力本身也可能不断增强。
云知声U2-Flash:后训练自迭代的国产实践样本
云知声最新推出的U2-Flash,将自迭代机制嵌入「后训练流程」——模型参与发现薄弱环节,生成针对性数据,经过训练和验证,再进入下一轮。这一轮暴露的短板,成为下一轮进步的起点。
架构与性能:U2-Flash采用稀疏混合专家架构,总参数约266B,单次推理仅激活约10B,激活比例不到4%。编程、Agent、数学推理、指令遵循等能力被统一装进同一套权重。
关键评测成绩:
- SWE-Bench Pro:61.6分,比前代U2提升10.5分
- DeepSWE v1.1:64.6分,前代为32分,直接翻倍
- TerminalBench 3.0:24.3分,是前代2.7分的9倍
- WorkBuddy-Bench Office:81分,超过DeepSeek-V4-Flash(77.5)、DeepSeek-V4-Pro(78.7)和GLM-5.2(79.6)
- GPQA Diamond:92.4分;IMOAnswerBench:90.3分;HMMT Feb. 2026:97.1分
效率与成本:首字响应平均3秒以内,输出峰值300 tokens/s,生成速度比前代提升2.1倍。Agent任务完成时间缩短35%,迭代步数比前代U2少20%到30%。内部对比测试中,跑完同一套任务,成本大约是对方的四分之一,Token消耗降了20%到30%。
后训练机制:团队搭建了一套自主闭环演进机制,四步循环持续运转:发现薄弱环节 → 生成针对性数据 → 强化训练 → 验证效果。监督模型在关键节点介入,减少了对大规模人工标注的依赖。靠这套机制,云知声已构造出覆盖主流编程语言、规模近十万的高质量SWE任务集。
异步Agent RL:多个rollout worker并行在沙盒里跑任务、采轨迹,不阻塞策略更新。据团队统计,单位时间产出的有效训练轨迹,比同步模式多出约60%。
MOPD(多教师在线策略蒸馏):先分别训练数学、代码、Agent、指令跟随四个领域的专项RL教师,再把它们的能力蒸馏进同一个学生模型。达到同等能力所需的训练步数,比从零RL少了约55%。
内部应用:在正式发布前,U2-Flash已在云知声内部试用接近一个月。HR团队用它处理年假发放和工资表;研发团队用它读代码仓库、画架构图,甚至直接搭前端页面。周报、会议纪要、方案对比、英文邮件润色,也是它在干。
以前用U2,偶尔会遇到报错或非预期输出;到这个版本,大家开始「放心把任务交给它」。——云知声内部团队
🚀 对企业 AI 化的启示
1. RSI机制正在从研究概念转化为工程实践。 OpenAI和Anthropic的公开表态确认了递归自我改进已进入实际部署阶段。企业应关注这一趋势对AI研发效率的长期影响,尤其是在自动化研究、代码生成和Agent任务执行领域。
2. 参数规模不再是唯一竞争力。 云知声U2-Flash以266B总参数、10B激活参数的体量,在多项评测中叫板万亿参数级模型。这提示企业:高密度智能——即通过后训练和架构优化在有限参数下实现高性能——可能比单纯堆参数更具商业可行性。
3. 后训练能力成为模型差异化的关键。 从GLM-5.3-Flash到DeepSeek-V4.1,通过后训练挖掘基座潜力正成为模型升级主线。云知声的自主闭环演进机制、异步Agent RL和MOPD,为企业提供了可参考的技术路径。
4. 成本与效率是AI落地的硬约束。 U2-Flash将Agent任务完成时间缩短35%,成本降至同类四分之一,Token消耗降低20%到30%。对于需要大规模部署AI的企业,这些指标直接决定ROI。
5. 国产化适配决定行业客户采用意愿。 U2-Flash支持全面国产化适配,在国产平台上的吞吐、时延、并发和集群扩展效率持续改善,部分场景已接近英伟达GPU方案。对注重数据安全与算力自主的行业客户而言,这一条往往比榜单分数更能决定用不用。
6. RSI的边界与可追溯性不可忽视。 云知声强调,其RSI闭环是「有边界」的:每次调整都要经过沙盒验证,留下可追溯、可回滚的记录。企业在探索类似机制时,应同步建立验证与回滚机制。
【官方原文链接】点击访问首发地址
常见问题
相关文章
OpenAI总裁Greg Brockman宣告AGI时代已至:GPT-6 Astra实现24小时自主运行与万字级AI安全对齐
OpenAI总裁Greg Brockman在a16z访谈中宣布AGI时代已至,核心依据是GPT-6 Astra能自主运行24小时。Astra在OSWorld 2.0延迟模拟中得分72.6%,FrontierMath Tier 4达97.6%。OpenAI抽调25%生产工程师转向AI安全对齐,投入10亿美元支持关键基础设施防御,并因对齐与监控证据不足而放缓前沿训练。
2026年9月17日AI大厂算力基建招聘转向:DeepSeek、字节跳动、阿里云向土木工程人才开放IDC数据中心岗位
DeepSeek、字节跳动、阿里云等AI大厂近期密集发布IDC数据中心基础设施建设与运维岗位,将土木工程、暖通、电气等传统工科专业列为加分项。背后是算力基建投资达万亿量级,但土建工程在数据中心工程量中占比不足20%,企业真正需要的是贯通电力、制冷、网络与算力调度的复合型人才。材料、生物、微电子等专业同样通过产业升级实现人才价值重估,复合型能力成为跨专业就业的核心门槛。
2026年9月17日AI消费交易入口争夺战:豆包、千问、WorkBuddy的GEO商业落地与抽佣模式解析
2026年,豆包、千问、WorkBuddy等AI原生应用加速渗透消费交易。豆包对酒店订单收取12%综合费率,千问春节活动完成近2亿次下单。麦肯锡预计2030年AI Agent促成的零售市场规模达3-5万亿美元。然而,66.2%用户仍回传统平台验证,AI交易转化弱于信息检索。GEO(生成式引擎优化)成为企业应对AI入口冲击的关键策略。
2026年9月17日