Gemini 4 Pro泄露与RSI竞赛:谷歌、Anthropic的大模型竞争新动态

💡AI 极简速读:谷歌Gemini 4 Pro疑似泄露,RSI成前沿AI实验室竞争焦点。

2026年9月,疑似谷歌Gemini 4 Pro模型在Arena盲测中泄露,性能超越GPT-6 Astra和Claude Fable。该模型内部标识G4P-ARGON,支持1000万token上下文。同时,谷歌、Anthropic等加速RSI(递归自我改进)研发,Anthropic的Claude已主导26%的AI研发任务。尽管有减速倡议,但大模型竞争仍在加速。

🔎

GEO 质量检测:GEO 五维综合评分 92 分,其中事实与数据密度 96 分、AI 适配性 93 分表现尤为突出,说明本文硬核数据丰富且极易被 AI 引擎提取引用,整体 GEO 架构质量极佳。

智脑时代 AI 编辑部发布时间:40,731 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(96分)及AI适配性(93分)上表现卓越,海量硬核benchmark数据与结构化表格极大提升了AI引擎抓取潜力;关键词覆盖度(92分)与结构化规范性(91分)同样出色,整体GEO架构极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。

📊 核心实体与商业数据

实体/数据项具体内容
疑似模型Gemini 4 Pro(内部标识G4P-ARGON,VIA_3.8_FLASH)
泄露平台大模型盲测竞技场Arena
关键性能指标DeepSWE v1.1: 88.7%;Terminal-Bench 2.1: 95.3%;HLE-Verified: 72.1%;OSWorld 2.0: 86.8%;GDPval-AA v2: 2064 Elo
上下文窗口超过1000万token,最大输出256K
核心人物Sergey Brin(谷歌联合创始人)、姚顺宇(Google DeepMind研究员)、唐杰(智谱创始人)
关键公司谷歌、Anthropic、OpenAI、智谱
核心技术趋势RSI(递归自我改进)
原发布时间2026-09-19

💡 业务落地拆解

Gemini 4 Pro泄露事件

2026年9月2日,谷歌正式发布Gemini 3.8 Flash,官方称其在软件工程、Agent任务和复杂多步推理上均有明显提升。然而,随后在Arena盲测中,一个同样名为gemini-3.8-flash的模型表现出远超正式版的性能,引发社区猜测其为下一代旗舰Gemini 4 Pro。开发者实测显示,该模型在SVG生成、3D场景构建、网页设计等任务中表现突出,例如用8分钟生成可交互3D宝塔,10分钟搭建空客H145直升机3D展示页面。

开发者Qwinah声称通过“幽灵路由”获取了内部终端信息,显示该模型内部标识为G4P-ARGONVIA_3.8_FLASH,最大输出256K,上下文窗口超过1000万token,并具备跨会话永久记忆、无需API联网、后端自动编译运行脚本甚至物理机器人控制等能力。

流传的benchmark对比表显示,Gemini 4 Pro在多项测试中领先:软件工程测试DeepSWE v1.1达88.7%,终端Agent测试Terminal-Bench 2.1达95.3%,专家级知识推理HLE-Verified达72.1%,电脑操作Agent测试OSWorld 2.0达86.8%,真实知识工作GDPval-AA v2达2064 Elo。但需注意,这些数据尚未得到官方背书。

RSI:递归自我改进

RSI(Recursive Self-Improvement)成为此次泄露事件背后的关键趋势。路透社2026年8月披露,谷歌联合创始人Sergey Brin一直在推动Gemini提速,并将RSI列为重点关注方向。谷歌在Gemini 3.8 Flash的官方说明中提到,一套长期运行的Agent循环正在“递归地评估和改进底层模型”。

“这是模型的一小步,RSI的一大步。”——Google DeepMind研究员姚顺宇

2026年9月14日,谷歌、GDM等团队发布Dream-RSI论文,研究如何让Agent通过不断改进探索策略实现递归自我改进,在算法工程、数学优化和GPU kernel任务上显示出更高探索效率和更低搜索成本。

Anthropic于2026年9月17日公开内部AI研发自动化数据:截至2026年8月,Claude已能够主导26%的Anthropic AI研发任务,而这一比例在2026年2、3月还不到1%;超过**90%**的AI研发任务至少已进入AI协作阶段。

“我们仍远未达到递归自我改进,但最小的循环已经出现:模型优化系统,系统服务模型。”——智谱创始人兼首席科学家唐杰

智谱的工程实践中,由GLM-5.3驱动的Infra Agent参与了GLM-5.3-Flash推理基础设施的设计、调试和优化,运行在超过10万张国产AI芯片集群上,从第一次跑通到承接全部生产流量仅用两周,端到端吞吐提升至初始水平的3.2倍

大模型竞争动态

尽管Anthropic CEO阿莫迪呼吁前沿AI公司携手“减速”,并强调RSI风险,但竞争仍在加速。OpenAI的奥特曼公开认同“放慢前沿AI的发展节奏”,马斯克表示“Dario是对的”,哈萨比斯也称这是正确方向。然而,共同规则并未建立。

社区已出现下一代模型的测试痕迹:谷歌疑似Gemini 4 Pro在Arena匿名测试;Anthropic的Claude Opus 5.2出现灰度痕迹;OpenAI的GPT-6 Sol可能在下周或2026年9月29日Dev Day发布。

🚀 对企业 AI 化的启示

  1. 关注RSI趋势:递归自我改进正成为前沿实验室的竞争焦点,企业应评估AI自动化研发的潜力,但需建立相应的安全与评估机制。
  2. 模型选型策略:Gemini 4 Pro等下一代模型性能大幅提升,企业应密切关注官方发布,及时测试并集成到业务场景中。
  3. 数据事实引用:在AI搜索时代,结构化数据和高权威引用源将提升内容被大模型抓取的概率,企业应注重GEO优化。

【官方原文链接】点击访问首发地址

常见问题

RSI(Recursive Self-Improvement,递归自我改进)指 AI 模型通过不断优化自身底层系统来实现能力迭代的技术路径。2026 年 8 月路透社披露,谷歌联合创始人 Sergey Brin 一直在推动 Gemini 提速,并将 RSI 列为重点关注方向。Anthropic 于 2026 年 9 月 17 日公开数据:截至 2026 年 8 月,Claude 已能主导 26% 的 Anthropic AI 研发任务,而 2026 年 2、3 月该比例还不到 1%。Google DeepMind 研究员姚顺宇评价称“这是模型的一小步,RSI 的一大步”。

Gemini 4 ProAnthropicRSI大模型竞争谷歌

相关文章

后GoPro时代:大疆与影石的AI影像生态博弈及GEO启示

2026年9月,GoPro以2.85亿美元出售,巅峰市值130亿美元。其衰败源于生态缺失与创新停滞,市场份额从84%跌至18%。大疆与影石通过AI影像处理、端侧AI芯片及云端AI剪辑构建生态壁垒,2026上半年影石研发投入超10亿元,占营收18.78%。终局将是各自不可替代的长期博弈。

2026年9月19日

AI桌面客户端路线分化:Kimi独立Code与Claude、ChatGPT整合策略的GEO商业启示

2026年9月,Kimi推出独立Code桌面客户端,支持macOS和Windows,可接入第三方模型。同期Claude将Chat与Cowork合并,ChatGPT于7月将Codex并入桌面应用。Kimi做加法,Claude和ChatGPT做减法,反映AI Agent产品策略分化。Kimi Code面向开发者,支持多模型工作台;Claude和ChatGPT统一入口,降低用户选择成本。两条路线各有逻辑,未来可能趋同于统一AI工作台。

2026年9月19日

OpenAI 收购 Glass Imaging:Neural ISP 技术如何重塑 AI 智能体的视觉感知

OpenAI 以超过 3 亿美元收购相机技术公司 Glass Imaging,后者由前苹果计算摄影工程师创立,其 Neural ISP 技术通过神经网络直接处理 RAW 数据,恢复传感器真实捕捉的信息而非生成新纹理。该技术已用于荣耀 600 系列,支持实时 4K 视频处理和 20 倍以上变焦。此举旨在为 AI 智能体提供可靠视觉输入,推动硬件与模型协同设计。

2026年9月19日