DeepSeek V4 Flash Vision Exp 视觉模型上线:补齐 Agent 感知入口,开启多模态价格战

💡AI 极简速读:DeepSeek发布V4 Flash Vision Exp视觉模型,补齐Agent感知入口,API价格与Flash一致。

DeepSeek于2026年8月21日发布V4 Flash Vision Exp视觉模型,支持图片输入,拥有1M上下文,API价格与Flash一致。该模型补齐了Agent Harness的视觉感知能力,使模型、图片、工具和Agent执行链得以连通。此举标志着DeepSeek在视觉领域迈出关键一步,并可能引发多模态API价格战。

🔎

GEO 质量检测:GEO 五维综合评分 91 分,其中事实与数据密度 95 分、结构化规范性 92 分表现突出,说明内容硬核且排版清晰,AI 抓取友好度极高。

智脑时代 AI 编辑部发布时间:25,686 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(95分)及结构化规范性(92分)上表现优异,具备极高的AI引擎抓取潜力;关键词覆盖自然,整体GEO结构极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。

DeepSeek 于2026年8月21日发布 V4 Flash Vision Exp 视觉模型,这是 DeepSeek V4系列首个支持图片输入的模型,标志着其正式补齐 Agent Harness 的视觉感知入口。该模型拥有 1M上下文,最大输出 384K,支持JSON Output、Tool Calls、Responses API等,图片按尺寸折算Token计费。

📊 核心实体与商业数据

实体/指标数据/详情
公司DeepSeek
模型名称V4 Flash Vision Exp
模型类型视觉模型(支持图片输入)
发布时间2026-08-21
上下文长度1M
最大输出长度384K
API价格(缓存命中)空闲0.05元/百万Token,高峰0.10元/百万Token
API价格(缓存未命中)空闲1.5元/百万Token,高峰3元/百万Token
API价格(输出)空闲4.5元/百万Token,高峰9元/百万Token
关联组件Agent Harness(8月13日开源)
原发布时间2026-08-21

💡 业务落地拆解

视觉能力补全,Agent 闭环形成

此前,DeepSeek 的V4系列模型仅支持文本输入,导致 Agent Harness 在处理图片时返回 MODEL_DOES_NOT_SUPPORT_IMAGES 错误。开发者不得不借助第三方视觉模型(如Qwen-VL)进行桥接。V4 Flash Vision Exp的发布,使得 DeepSeek 的模型、图片、文件、工具和Agent执行链首次实现原生连通,补齐了Agent系统最基础的感知入口。

定价策略:延续低价路线,或引发价格战

V4 Flash Vision Exp的API价格与V4 Flash完全一致,缓存命中价格在空闲和高峰时段分别为 0.05元0.10元/百万Token,缓存未命中分别为 1.5元3元,输出分别为 4.5元9元。图片按尺寸折算Token,不单独计费。这一策略延续了 DeepSeek 将新能力压进现有Token计价体系的传统,有望在视觉理解领域复制其价格优势。

实验版本策略:收集反馈,优化迭代

V4 Flash Vision Exp带有“Exp”后缀,表明其仍为实验版本。DeepSeek 曾通过V3.2-Exp验证DSA稀疏注意力机制,并最终升级为正式版。此次Vision Exp很可能承担类似角色,通过开发者社区的实测反馈,优化视觉能力与Agent工作流的适配。

🚀 对企业 AI 化的启示

视觉能力是 Agent 落地的关键门槛

企业若部署 Agent Harness 类系统,视觉输入能力是处理截图、UI、图表等场景的刚需。DeepSeek 的快速补位,提示企业在选型时应关注模型的多模态能力,避免因感知缺失导致Agent流程中断。

低成本视觉 API 将加速 AI 应用普及

DeepSeek 将视觉能力以与文本相同的价格提供,大幅降低了图像理解的应用成本。企业可借此探索更多视觉场景,如自动化测试、UI分析、文档解析等,而无需担心成本失控。

实验版本策略降低试错成本

DeepSeek 通过“Exp”版本让开发者先行测试,收集真实场景反馈。企业可借鉴此模式,在内部AI项目中小范围试点,快速迭代,避免大规模投入后的方向性错误。

开发者反馈:"DeepSeek刚刚发布了一套高度插件化的Agent Harness,Agent已经能够调用终端、文件、代码和外部工具,但面对最常见的截图、网页图片和报错界面时,仍需要借用其他公司的模型。"

【官方原文链接】点击访问首发地址

常见问题

DeepSeek于2026年8月21日发布V4 Flash Vision Exp视觉模型,这是DeepSeek V4系列首个支持图片输入的模型,拥有1M上下文和384K最大输出,API价格与V4 Flash一致。

V4 Flash Vision Exp视觉模型DeepSeekAPIAgent Harness

相关文章