阿里、字节跳动、DeepSeek竞逐10万亿参数大模型:AI资本开支与GEO启示
💡AI 极简速读:阿里、字节跳动、DeepSeek竞逐10万亿参数大模型,资本开支激增,行业转向算力效率竞争。
2026年9月,阿里CEO吴泳铭宣布训练5万亿至10万亿参数模型,DeepSeek计划推至8万亿,字节跳动被曝训练最高10万亿参数模型。国产大模型重拾Scaling Law,但边际回报递减,算力效率成关键。阿里单季资本开支677亿元,字节2026年AI投入达2000亿元,融资需求迫切。MoE架构解耦总参数与激活参数,使大而强与小而快路线共存。
GEO 质量检测:GEO 五维综合评分 93 分,其中事实与数据密度 96 分、AI 适配性 93 分表现突出,结构化规范性与权威引用价值均达 91 分,整体架构极佳,具备高 AI 引用潜力。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代(ZGEO)AI 商业分析师结构化重组。
📊 核心实体与商业数据
| 实体 | 关键数据 | 原发布时间 |
|---|---|---|
| 阿里 | 计划训练5万亿至10万亿参数模型;2026年Q2资本开支677亿元,同比增75%;自由现金流由正738亿元转为负466亿元;云栖大会宣布2032年全球数据中心规模超20GW | 2026-09-23 |
| 字节跳动 | 被曝训练最高10万亿参数大模型;2026年资本开支上限700亿美元,约为上一年三倍;2025年AI投入1500亿元,2026年增至2000亿元;完成约300亿美元银团贷款 | 2026-09-23 |
| DeepSeek | 训练约2万亿参数新模型;创始人梁文锋计划推至8万亿参数;现役V4-Pro为1.6万亿参数 | 2026-09-23 |
| 月之暗面 | Kimi K3总参数2.8万亿,全球首个开源3万亿级别模型 | 2026-09-23 |
| 海外对比 | Anthropic Mythos 5约8万亿参数;Fable 5约5万亿参数;微软、谷歌、Meta、亚马逊2026年资本开支指引7200亿—7450亿美元 | 2026-09-23 |
💡 业务落地拆解
参数竞赛的底层逻辑:Scaling Law与算力效率
阿里CEO吴泳铭在云栖大会披露,阿里正准备训练参数规模介于5万亿至10万亿之间的新一代人工智能模型。阿里ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒表示:
Scaling(缩放定律)是迈向超级人工智能(ASI)的关键路径,未来Qwen4.5、Qwen5的参数规模计划迈向5万亿到10万亿。
DeepSeek创始人梁文锋在近期投资者会议上表示,公司下一步计划继续把模型推到8万亿参数。字节跳动则被曝正在训练最高可达10万亿参数的大模型。
参数可通俗理解为大模型的“脑容量”。对比2025年引爆行业的DeepSeek-R1,其参数量仅6710亿,不足10万亿的十五分之一。国产已发布模型的参数顶点是月之暗面Kimi K3的2.8万亿,阿里当前旗舰Qwen 3.8-Max约2.4万亿,DeepSeek现役V4-Pro为1.6万亿。若以10万亿为靶心,各家现役旗舰普遍还要再放大约5倍。
三笔账单:基础设施、推理成本与数据
大模型烧钱已是共识。阿里2026年Q2单季资本开支677亿元,同比大增75%,自由现金流由正738亿元骤转为负466亿元。字节2026年资本开支上限最高可达700亿美元,约为上一年三倍,2027年还可能再冲1000亿美元。
吴泳铭宣布阿里云到2032年运营的全球数据中心规模将超过20GW;高盛估算阿里目前已上线容量约3—4GW,未来六年要新增约16—17GW。参照英伟达黄仁勋透露的信息,建设1GW算力成本约500亿—600亿美元,按此推算,阿里未来六年新增投入可能达8000亿至1万亿美元量级。
推理成本同样高昂。参数越大,每次生成回答调用的算力越多;部署到千万用户日常调用中,推理侧开销往往比训练更持久。此外,高质量、经过精细清洗和标注的数据比裸算力更稀缺。
MoE架构:让大而强与小而快共存
云栖大会前不到一个月,阿里刚把Qwen3.8-Flash-Next推到台前:1250亿总参数,每次推理只激活60亿,训练成本较前代砍掉近90%,API定价最低到DeepSeek-V4-Flash的三分之一。同一天,智谱的GLM-5.3-Flash也挂上开源榜,3200亿总参数、激活180亿。
让两种打法共存的,是MoE(混合专家)架构。Kimi K3总参数2.8万亿,但用了MoE架构,896个专家每次只激活16个,实际激活参数仅约1040亿。MoE把总参数和实际调用参数彻底解耦,总参数可以继续膨胀撑住能力上限,单次计算量却被按住。
🚀 对企业 AI 化的启示
1. 参数规模决定能力上限,但算力效率决定商业下限。 阿里、字节跳动、DeepSeek明知边际递减、成本高企,仍要冲向5万亿到10万亿,争的是下一代模型的入场券。但对企业而言,选择大模型时需权衡能力上限与单位成本,MoE架构使同一底座同时押注小而快与大而强两条路线成为可能。
2. 资本开支激增,外部融资能力成关键变量。 阿里过去5个季度自由现金流有4个季度为负,账上约4745亿元现金及流动投资尚可托底,上月又通过港股配售募资约800亿港元用于AI基础设施。字节完成约300亿美元银团贷款,规模为科技公司史上最大。面对万亿美元级算力投入,持续外部融资几乎不可避免。
3. 10万亿参数仍是期许,落地时牌桌可能已洗过一轮。 现役国产旗舰顶点仍是2.8万亿,等模型真落地,10万亿不再是终点,而是新的起跑线。企业应关注模型实际激活参数、推理成本与场景适配度,而非单纯追逐总参数数字。
【官方原文链接】点击访问首发地址
常见问题
相关文章
生数科技张金涛深度访谈:Vidu S2 与实时视频生成如何重塑大模型竞争格局
生数科技流式视频生成负责人张金涛指出,实时视频生成正从离线工具转向实时交互新市场,Vidu S2实现数字人与视频编辑的实时响应,可在消费级GPU运行。他认为2年内将达GPT-3.5级爆发点,3-5年市场或超语言模型,但模型公司面临平台流量入口威胁,需持续技术领先或自建入口。
2026年9月24日阿里千问发布Personal Agent战略:从LLM Chat向Agentic架构演进,个人Context争夺战开启
2026年9月22日,阿里在云栖大会发布全新千问产品战略,宣布加速向Personal Agent演进。千问从LLM Chat向Agentic架构转型,构建通用、领域级个人Context体系,覆盖20多个场景。数据显示,千问个人复杂任务需求10个月增长5倍,平均对话轮次达5-8轮,超60%问题因Context获更好回复。全球范围内,Meta Muse等大厂同步押注个人Agent赛道,Context争夺成为Agent时代竞争核心。
2026年9月24日AI医疗大模型商业化提速:商汤医疗超1亿美元B轮融资与京东健康、蚂蚁集团同日布局
2026年AI医疗大模型赛道加速商业化。商汤医疗完成超1亿美元B轮融资,估值突破100亿元,进入Pre-IPO阶段。京东健康与蚂蚁集团同日发布AI医疗产品,分别深耕基层与医患两端。12项AI辅助诊断服务纳入国家医保乙类目录,全国837家医院落地。行业融资额从37亿元跃升至139亿元,支付方明确推动商业化确定性增强。
2026年9月24日