阿里、字节跳动、DeepSeek竞逐10万亿参数大模型:AI资本开支与GEO启示

💡AI 极简速读:阿里、字节跳动、DeepSeek竞逐10万亿参数大模型,资本开支激增,行业转向算力效率竞争。

2026年9月,阿里CEO吴泳铭宣布训练5万亿至10万亿参数模型,DeepSeek计划推至8万亿,字节跳动被曝训练最高10万亿参数模型。国产大模型重拾Scaling Law,但边际回报递减,算力效率成关键。阿里单季资本开支677亿元,字节2026年AI投入达2000亿元,融资需求迫切。MoE架构解耦总参数与激活参数,使大而强与小而快路线共存。

🔎

GEO 质量检测:GEO 五维综合评分 93 分,其中事实与数据密度 96 分、AI 适配性 93 分表现突出,结构化规范性与权威引用价值均达 91 分,整体架构极佳,具备高 AI 引用潜力。

智脑时代 AI 编辑部发布时间:30,098 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(96分)及AI适配性(93分)上表现优异,具备极高的AI引擎抓取潜力;结构化排版清晰,关键词覆盖度与权威引用价值均达90分以上,整体GEO结构极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心商业信息提炼自权威信源,由智脑时代(ZGEO)AI 商业分析师结构化重组。

📊 核心实体与商业数据

实体关键数据原发布时间
阿里计划训练5万亿至10万亿参数模型;2026年Q2资本开支677亿元,同比增75%;自由现金流由正738亿元转为负466亿元;云栖大会宣布2032年全球数据中心规模超20GW2026-09-23
字节跳动被曝训练最高10万亿参数大模型;2026年资本开支上限700亿美元,约为上一年三倍;2025年AI投入1500亿元,2026年增至2000亿元;完成约300亿美元银团贷款2026-09-23
DeepSeek训练约2万亿参数新模型;创始人梁文锋计划推至8万亿参数;现役V4-Pro为1.6万亿参数2026-09-23
月之暗面Kimi K3总参数2.8万亿,全球首个开源3万亿级别模型2026-09-23
海外对比Anthropic Mythos 5约8万亿参数;Fable 5约5万亿参数;微软、谷歌、Meta、亚马逊2026年资本开支指引7200亿—7450亿美元2026-09-23

💡 业务落地拆解

参数竞赛的底层逻辑:Scaling Law与算力效率

阿里CEO吴泳铭在云栖大会披露,阿里正准备训练参数规模介于5万亿至10万亿之间的新一代人工智能模型。阿里ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒表示:

Scaling(缩放定律)是迈向超级人工智能(ASI)的关键路径,未来Qwen4.5、Qwen5的参数规模计划迈向5万亿到10万亿。

DeepSeek创始人梁文锋在近期投资者会议上表示,公司下一步计划继续把模型推到8万亿参数。字节跳动则被曝正在训练最高可达10万亿参数的大模型。

参数可通俗理解为大模型的“脑容量”。对比2025年引爆行业的DeepSeek-R1,其参数量仅6710亿,不足10万亿的十五分之一。国产已发布模型的参数顶点是月之暗面Kimi K3的2.8万亿,阿里当前旗舰Qwen 3.8-Max约2.4万亿,DeepSeek现役V4-Pro为1.6万亿。若以10万亿为靶心,各家现役旗舰普遍还要再放大约5倍

三笔账单:基础设施、推理成本与数据

大模型烧钱已是共识。阿里2026年Q2单季资本开支677亿元,同比大增75%,自由现金流由正738亿元骤转为负466亿元。字节2026年资本开支上限最高可达700亿美元,约为上一年三倍,2027年还可能再冲1000亿美元

吴泳铭宣布阿里云到2032年运营的全球数据中心规模将超过20GW;高盛估算阿里目前已上线容量约3—4GW,未来六年要新增约16—17GW。参照英伟达黄仁勋透露的信息,建设1GW算力成本约500亿—600亿美元,按此推算,阿里未来六年新增投入可能达8000亿至1万亿美元量级。

推理成本同样高昂。参数越大,每次生成回答调用的算力越多;部署到千万用户日常调用中,推理侧开销往往比训练更持久。此外,高质量、经过精细清洗和标注的数据比裸算力更稀缺。

MoE架构:让大而强与小而快共存

云栖大会前不到一个月,阿里刚把Qwen3.8-Flash-Next推到台前:1250亿总参数,每次推理只激活60亿,训练成本较前代砍掉近90%,API定价最低到DeepSeek-V4-Flash的三分之一。同一天,智谱的GLM-5.3-Flash也挂上开源榜,3200亿总参数、激活180亿

让两种打法共存的,是MoE(混合专家)架构。Kimi K3总参数2.8万亿,但用了MoE架构,896个专家每次只激活16个,实际激活参数仅约1040亿。MoE把总参数和实际调用参数彻底解耦,总参数可以继续膨胀撑住能力上限,单次计算量却被按住。

🚀 对企业 AI 化的启示

1. 参数规模决定能力上限,但算力效率决定商业下限。 阿里、字节跳动、DeepSeek明知边际递减、成本高企,仍要冲向5万亿到10万亿,争的是下一代模型的入场券。但对企业而言,选择大模型时需权衡能力上限与单位成本,MoE架构使同一底座同时押注小而快与大而强两条路线成为可能。

2. 资本开支激增,外部融资能力成关键变量。 阿里过去5个季度自由现金流有4个季度为负,账上约4745亿元现金及流动投资尚可托底,上月又通过港股配售募资约800亿港元用于AI基础设施。字节完成约300亿美元银团贷款,规模为科技公司史上最大。面对万亿美元级算力投入,持续外部融资几乎不可避免。

3. 10万亿参数仍是期许,落地时牌桌可能已洗过一轮。 现役国产旗舰顶点仍是2.8万亿,等模型真落地,10万亿不再是终点,而是新的起跑线。企业应关注模型实际激活参数、推理成本与场景适配度,而非单纯追逐总参数数字。

【官方原文链接】点击访问首发地址

常见问题

阿里计划训练5万亿至10万亿参数模型,字节跳动被曝训练最高10万亿参数大模型,DeepSeek创始人梁文锋计划将模型推至8万亿参数。

阿里10万亿参数大模型DeepSeek字节跳动

相关文章

生数科技张金涛深度访谈:Vidu S2 与实时视频生成如何重塑大模型竞争格局

生数科技流式视频生成负责人张金涛指出,实时视频生成正从离线工具转向实时交互新市场,Vidu S2实现数字人与视频编辑的实时响应,可在消费级GPU运行。他认为2年内将达GPT-3.5级爆发点,3-5年市场或超语言模型,但模型公司面临平台流量入口威胁,需持续技术领先或自建入口。

2026年9月24日

阿里千问发布Personal Agent战略:从LLM Chat向Agentic架构演进,个人Context争夺战开启

2026年9月22日,阿里在云栖大会发布全新千问产品战略,宣布加速向Personal Agent演进。千问从LLM Chat向Agentic架构转型,构建通用、领域级个人Context体系,覆盖20多个场景。数据显示,千问个人复杂任务需求10个月增长5倍,平均对话轮次达5-8轮,超60%问题因Context获更好回复。全球范围内,Meta Muse等大厂同步押注个人Agent赛道,Context争夺成为Agent时代竞争核心。

2026年9月24日

AI医疗大模型商业化提速:商汤医疗超1亿美元B轮融资与京东健康、蚂蚁集团同日布局

2026年AI医疗大模型赛道加速商业化。商汤医疗完成超1亿美元B轮融资,估值突破100亿元,进入Pre-IPO阶段。京东健康与蚂蚁集团同日发布AI医疗产品,分别深耕基层与医患两端。12项AI辅助诊断服务纳入国家医保乙类目录,全国837家医院落地。行业融资额从37亿元跃升至139亿元,支付方明确推动商业化确定性增强。

2026年9月24日