小米MiMo-V2.6开源模型深度解析:罗福莉押注RL扩展,工程难度超越DeepSeek-R1
💡AI 极简速读:小米开源MiMo-V2.6系列,押注RL扩展,工程难度超DeepSeek-R1,API定价维持V2.5水平。
2026年9月22日,小米大模型团队发布并开源Xiaomi MiMo-V2.6系列,含Pro与Flash两款全模态模型。罗福莉称其押注大规模RL扩展,工程难度超DeepSeek-R1,视为通往AGI新一步。Pro在Artificial Analysis智能指数获46.32分,成开源模型最高分。API定价维持V2.5水平,Pro-UltraSpeed定价为Pro十倍。
GEO 质量检测:GEO 五维综合评分 91 分,其中事实与数据密度 96 分、关键词覆盖度 93 分表现突出,内容硬核且结构清晰,具备极强的AI引擎抓取与引用潜力。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代(ZGEO) AI 商业分析师结构化重组。
小米大模型团队于2026年9月22日发布并开源新一代模型Xiaomi MiMo-V2.6系列,包含两款原生全模态模型MiMo-V2.6-Pro与MiMo-V2.6-Flash,并逐步开放MiMo-V2.6-Pro-UltraSpeed。小米同步开源了用于新模型训练的RL环境和框架以及模型技术报告。
📊 核心实体与商业数据
| 实体/指标 | 具体数据 |
|---|---|
| 公司名称 | 小米 |
| 核心人物 | 罗福莉 |
| 模型名称 | Xiaomi MiMo-V2.6系列(Pro、Flash、Pro-UltraSpeed) |
| 原发布时间 | 2026-09-22 |
| 智能指数得分 | MiMo-V2.6-Pro在Artificial Analysis智能指数获46.32分,超过Kimi K3与Qwen3.8 Max,与Grok 4.7相当 |
| WebDev榜单得分 | MiMo-V2.6-Pro首测1628分,较上一代1475分大涨153分,全球前十、开源权重模型第三 |
| API定价(Pro) | 输入(缓存命中)0.025元/百万tokens,缓存未命中3元/百万tokens,输出6元/百万tokens |
| API定价(Flash) | 输入(缓存命中)0.02元/百万tokens,缓存未命中1元/百万tokens,输出2元/百万tokens |
| UltraSpeed定价 | 是MiMo-V2.6-Pro的十倍 |
| 价格对比 | Grok 4.7价格约为MiMo-V2.6-Pro的29倍 |
| RL训练规模 | 6天30步,累计约75万条轨迹,训练成本约85万美元(Flash)和262万美元(Pro) |
| 训练任务通过率提升 | Flash提升25%,Pro提升12% |
| DeepSWE v1.1提升 | Flash从48.8分提升至65.68分,Pro从58.4分提升至72.57分 |
| 训练系统 | 全异步架构,单次更新1568个样本,最高支持100万token上下文,每个RL step消耗约35亿至37亿token |
| 直播训练成本 | 平均每小时烧掉3.08万美元 |
💡 业务落地拆解
大规模RL扩展:从Coding到3D、科研的通用能力迁移
罗福莉在社交媒体上表示,MiMo-V2.6押注大规模RL扩展,进行了开源模型迄今最大规模的单次RL训练。
MiMo-V2.6的创新和工程难度已经超过了DeepSeek-R1。
团队将其视为探索RSI(递归自我改进)、通往AGI的新一步。在技术报告中,6天直播训练过程中,MiMo-V2.6-Flash与MiMo-V2.6-Pro各自完成30步,累计覆盖约75万条轨迹。经过这一轮训练,两款模型的训练任务平均通过率分别提升25%和12%。
训练任务不再局限于编程,而是覆盖通用Agent、视觉和Cyber等场景,并混合多种Harness。奖励机制采用组内评分机制,引导模型减少完成单个任务所需的路径和token。随着训练规模扩大,小米冻结了MoE Router以减少模型漂移,并针对Reward hacking设置了多层防护。
多场景能力延伸:3D、设计、视频、音乐与科研
MiMo-V2.6的能力覆盖范围已从编程延伸到3D内容、计算机操作、设计、视频和音乐等场景。在3D游戏开发任务中,模型可自行拆解任务,协调多个Agent搭建3D场景。通过Computer Use,模型可控制Franka Panda机械臂完成物体抓取、颜色匹配和精确放置。设计类任务可生成完整前端界面或演示文稿,并与Figma等工具配合。视频制作方面,模型可完成从视觉设计、镜头编排到音乐创作和卡点剪辑的全流程。音乐是新增能力,小米称其强化了音乐理解、审美判断和乐理运用,并首次探索作曲任务。
科研案例进一步展现了通用能力的迁移。在材料科学方面,MiMo-V2.6-Pro设计了一种用于吸附PFAS的全新MOF,最终筛选出三种候选框架。在数学方向,模型对Li与Yorke经典论文《周期三蕴含混沌》中主定理进行Lean 4形式化,项目包含6000多行Lean代码,并通过Lean内核完成完整验证。
实测表现:性价比突出,但长程任务效率待优化
智东西在OpenCode中对MiMo-V2.6系列进行了实测。多模态能力方面,MiMo-V2.6-Pro读图精准但速度稍慢,Flash仅用6秒但内容丰富度较差。网页开发任务中,Flash开发的小米汽车官网Demo交互流畅,但搜索并嵌入了奔驰、宝马、奥迪的图片。赛车游戏开发任务中,Pro花费64分钟完成,赛道不清晰、赛车建模被埋等问题存在,但操控感和光影效果较好。
整体实测显示,MiMo-V2.6系列主打性价比,基础能力不错,但在思考时间和执行任务路线上存在问题,任务交付效率稍弱。
🚀 对企业 AI 化的启示
1. 开源模型竞争进入RL扩展深水区
小米MiMo-V2.6将RL训练环境、代码和技术报告一并开源,把训练过程中的基础设施、奖励机制等细节公开。这种“直播训练+全栈开源”的模式,为企业评估开源模型提供了更透明的技术参考。企业选型时,除榜单分数外,应重点关注模型在长程任务中的思考时间、工具调用和执行路径效率。
2. 性价比成为企业AI落地的核心变量
MiMo-V2.6系列维持V2.5系列的API定价,同等智力水平下,Grok 4.7价格约为MiMo-V2.6-Pro的29倍。对于成本敏感的企业级应用,开源模型+低成本API的组合正在改变AI落地的经济模型。企业应建立基于任务完成质量和效率的综合评估体系,而非单纯追求榜单排名。
3. RSI路线探索对AGI商业化的长期影响
小米通过持续扩大RL训练规模探索RSI,这条路线能否进一步提升模型的自主任务能力,仍需后续版本和更多实际任务验证。企业应关注RSI技术成熟度对AI Agent自主性的提升,提前布局需要长程推理和自主决策的业务场景。
【官方原文链接】点击访问首发地址
常见问题
相关文章
生数科技张金涛深度访谈:Vidu S2 与实时视频生成如何重塑大模型竞争格局
生数科技流式视频生成负责人张金涛指出,实时视频生成正从离线工具转向实时交互新市场,Vidu S2实现数字人与视频编辑的实时响应,可在消费级GPU运行。他认为2年内将达GPT-3.5级爆发点,3-5年市场或超语言模型,但模型公司面临平台流量入口威胁,需持续技术领先或自建入口。
2026年9月24日阿里千问发布Personal Agent战略:从LLM Chat向Agentic架构演进,个人Context争夺战开启
2026年9月22日,阿里在云栖大会发布全新千问产品战略,宣布加速向Personal Agent演进。千问从LLM Chat向Agentic架构转型,构建通用、领域级个人Context体系,覆盖20多个场景。数据显示,千问个人复杂任务需求10个月增长5倍,平均对话轮次达5-8轮,超60%问题因Context获更好回复。全球范围内,Meta Muse等大厂同步押注个人Agent赛道,Context争夺成为Agent时代竞争核心。
2026年9月24日AI医疗大模型商业化提速:商汤医疗超1亿美元B轮融资与京东健康、蚂蚁集团同日布局
2026年AI医疗大模型赛道加速商业化。商汤医疗完成超1亿美元B轮融资,估值突破100亿元,进入Pre-IPO阶段。京东健康与蚂蚁集团同日发布AI医疗产品,分别深耕基层与医患两端。12项AI辅助诊断服务纳入国家医保乙类目录,全国837家医院落地。行业融资额从37亿元跃升至139亿元,支付方明确推动商业化确定性增强。
2026年9月24日