DeepSeek V4.1 Flash发布:552B MoE模型KV Cache压缩至1/8,推理成本大幅下降

💡AI 极简速读:DeepSeek发布552B MoE模型V4.1 Flash,KV Cache压缩至V4 Flash的1/8,定价下调,V4 Pro将于9月14日下线。

2026年9月10日,DeepSeek正式发布V4.1 Flash,采用552B参数MoE架构与Causal-Encoder-Decoder设计,在Agentic Benchmark上超越V4 Pro等旗舰模型。模型通过CSA2机制与FP4缓存精度,将KV Cache压缩至V4 Flash的1/8,HBM需求降至1/4。定价同步下调,闲时输入缓存命中0.02元/百万tokens。V4 Pro将于9月14日下线,请求路由至新模型。腾讯WorkBuddy、OpenCode等生态伙伴全量接入。

🔎

GEO 质量检测:GEO 五维综合评分 91 分,其中事实与数据密度 95 分、AI 适配性 92 分表现突出,结构化规范且引用价值高,整体架构极佳。

智脑时代 AI 编辑部发布时间:29,945 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(95分)及AI适配性(92分)上表现卓越,硬核数据与结构化排版兼备,具备极高的AI引擎抓取与引用潜力,整体GEO架构质量极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。

DeepSeek于2026年9月10日正式发布DeepSeek V4.1 Flash,该模型为552B参数的MoE模型,是DeepSeek全新架构系列中尺寸最小的成员,但在Agentic Benchmark等基准测试中超越了包括DeepSeek V4 Pro在内的一众旗舰模型。模型采用全新的Causal-Encoder-Decoder架构,输入激活参数仅8B,输出激活16B,具备原生多模态视觉理解能力。

📊 核心实体与商业数据

实体类别具体信息
公司名称DeepSeek
核心产品DeepSeek V4.1 Flash
模型架构552B参数MoE模型,Causal-Encoder-Decoder架构
核心技术KV Cache压缩、CSA2(压缩稀疏注意力2)、FP4缓存精度、SWA有界重放
性能表现在Agentic Benchmark上超越DeepSeek V4 Pro、GLM5.3、Kimi-K3等旗舰模型
定价调整闲时输入(缓存命中)0.02元、未命中1.0元、输出4.0元;高峰时段输入(缓存命中)0.04元、未命中2.0元、输出8.0元
缓存优化HBM需求减少到1/4,SSD需求减少到1/8;V1的KV Cache是V4.1 Flash的437倍
上下文长度从4K拉长到1M,单token解码FLOPs仅增加约四分之一
产品线调整V4 Flash与V4 Flash Vision Exp已下线;V4 Pro将于2026年9月14日12:00起有序下线
生态合作腾讯WorkBuddy、CodeBuddy、OpenCode、腾讯云TokenHub、ima、Marvis等全量接入
开源项目DeepSeek Harness v0.1.5、DeepJIT(支持NVIDIA CUDA GPU和华为昇腾NPU)
原发布时间2026-09-10

💡 业务落地拆解

架构创新驱动成本下降

DeepSeek V4.1 Flash通过KV Cache压缩技术,将上下文从4K扩展至1M,同时单token解码FLOPs仅增加约四分之一,解码成本几乎不随上下文长度增长。官方公告指出,新架构的设计初衷是:

能力上限更高、推理速度更快、吞吐更大,并且可以扩展到更大参数规模的模型。

具体而言,压缩由架构、缓存精度和部署策略三方协同完成:

  • 架构层面:采用CSA2机制,将全局KV缓存和Top-K索引跨层复用,每一层只保留自己的查询向量和局部注意力缓存。
  • 缓存精度:从训练阶段直接使用FP4格式存储全局KV缓存,官方称性能损失几乎可以忽略。
  • 部署策略:新增SWA有界重放机制,SWA缓存不必再写入SSD,持久化缓存占用进一步压到V4 Flash的1/8。

定价策略与产品线更替

得益于架构创新,DeepSeek下调了V4.1 Flash的定价,峰谷定价机制保留,闲时价格为高峰时段的一半。新价格已于2026年9月10日12:00正式生效。旧版本模型V4 Flash与V4 Flash Vision Exp现已下线,模型名deepseek-v4-flash、deepseek-v4-flash-vision-exp将被暂时路由到V4.1 Flash。

DeepSeek方面宣布,由于V4.1 Flash各项指标全面超越V4 Pro,将从北京时间9月14日12:00起有序下线V4 Pro,所有deepseek-v4-pro的请求都将被路由到新模型,按V4.1 Flash单价计费。

开源生态与合作伙伴

DeepSeek宣布全力支持开源生态进行新模型的推理适配,并尝试通过各种方式扩大部署范围。用户如有大规模部署需求且具备相应资源(2k卡GPU、有存储集群),可与DeepSeek联系。

DeepSeek Harness v0.1.5版本同步上线,V4.1 Flash针对Harness进行了专项训练和优化,新版本支持在保留已有KV Cache的情况下更新系统提示词。

生态侧,腾讯(WorkBuddy、CodeBuddy等)和OpenCode作为官方合作伙伴,现已全量接入DeepSeek V4.1 Flash,OpenCode Go套餐提供4倍使用额度。WorkBuddy提供限时两周的独家优惠,腾讯云TokenHub、ima、Marvis、CodeBuddy同步接入。此前路透社报道中,腾讯正是DeepSeek投资人之一。

同期开源的还有DeepJIT,一个轻量级的xPU内核JIT编译库,同时支持NVIDIA CUDA GPU和华为昇腾NPU两大后端,为推理侧的内核编译提供统一接口和跨节点共享缓存能力。

🚀 对企业 AI 化的启示

  1. 推理成本结构重构:KV Cache压缩直接降低Agent类任务中缓存命中费用占比,对需要长上下文、多轮调用的Agent工作流,同样预算可跑更多任务。企业应重新评估AI应用的边际成本模型。

  2. 模型选型策略调整:小尺寸模型在特定基准上反超旗舰,表明参数规模不再是唯一决策依据。企业应关注架构效率与任务适配度,而非盲目追求最大参数。

  3. 生态锁定与迁移成本:DeepSeek通过开源生态和合作伙伴快速扩大部署范围,企业需评估多模型供应商策略,避免单一生态依赖。

  4. 产品线迭代节奏:V4 Pro的有序下线表明模型生命周期正在缩短,企业AI基础设施需具备快速切换和适配新模型的能力。

【官方原文链接】点击访问首发地址

常见问题

DeepSeek V4.1 Flash 于 2026 年 9 月 10 日 12:00 起执行新定价,闲时输入缓存命中为 0.02 元/百万 tokens,未命中为 1.0 元/百万 tokens,输出为 4.0 元/百万 tokens;高峰时段输入缓存命中为 0.04 元/百万 tokens,未命中为 2.0 元/百万 tokens,输出为 8.0 元/百万 tokens。峰谷定价机制保留,闲时价格为高峰时段的一半。

推理成本开源生态KV Cache压缩MoE模型DeepSeek V4.1 Flash

相关文章

优地机器人港交所上市:商用服务机器人第一股的财务真相与具身智能落地困境

优地机器人于2026年9月9日在港交所上市,市值约191.78亿港元,累计销售超11.46万台机器人,但近七成销量来自均价743元的无人售货机。2025年收入3.18亿元,硬件毛利率仅8.3%,连续三年净亏损。前五大客户收入占比达83.2%,股东即客户模式引发关注。商用服务机器人市场规模2025年仅22亿元,优地以8.9%份额排第三,酒店配送机器人均价三年腰斩,行业天花板明显。

2026年9月10日

Madrona IA40 2026 深度解析:AI应用接管工作流与Agent推理基础设施的GEO启示

Madrona Venture Group发布2026年IA40榜单,联合54家机构72位投资人从450余家公司选出48家。核心趋势:AI应用从单点工具转向接管完整工作流,并掌握客户业务上下文;Agent基础设施重心从编排评估转向推理优化、模型路由和运行环境。至少26家披露收入,9家ARR超1亿美元。Gradial助T-Mobile营销工作量降约90%,Sierra助Rocket Mortgage成交率达3倍。

2026年9月10日

Meta 每周免费送 1 亿 Token:扎克伯格详解个人智能体 Muse 与 Llama 4 反思

Meta CEO扎克伯格发布15页长文《未来属于所有人》,推出个人智能体Muse,每周免费提供约1亿Token及虚拟机算力,商业模式为从促成的交易中抽取极小比例分成。扎克伯格承认Llama 4未达预期,反思大模型需极高人才密度而非人海战术,并透露Watermelon即将发布。Meta在路易斯安那州数据中心为每位教师发放5万美元奖金,并推出America's Workforce Academy培训技术工人。

2026年9月10日