DeepSeek V4 Flash 正式版上线:284B 开源模型 Agent 能力反超自家 Pro,价格仅三分之一
7 月 31 日,DeepSeek 发布了 DeepSeek-V4-Flash-0731,将 4 月的 Preview 版升级为正式版。模型架构和参数量完全不变——依然是 284B 参数的 MoE 架构,每次推理只激活 13B——但仅靠重新后训练(re-post-training),Agent 能力就实现了质的飞跃,在多项基准上全面超越自家更大更贵的 V4-Pro-Preview。
Agent 基准:Flash 反超 Pro
最让人意外的数据来自 Terminal Bench 2.1:V4-Flash-0731 拿到 82.7 分,而 V4-Pro-Preview 只有 72.1。在 DeepSWE 上差距更夸张——54.4 对 12.8,Flash 是 Pro 的四倍多。其他 Agent 基准如 NL2Repo(54.2 vs 38.5)、Cybergym(76.7 vs 52.7)、Toolathlon-Verified(70.3 vs 55.9)上,Flash 同样全面领先。
这意味着在 Agent 场景下,"更小更便宜"的 Flash 模型反而比 Pro 更强。DeepSeek 官方也确认,这次更新仅涉及 V4-Flash,V4-Pro API 和 App/Web 端模型均未变动,Pro 正式版将"很快发布"。
价格:Pro 的三分之一
API 定价方面,V4-Flash 维持 $0.14/百万 input token、$0.28/百万 output token,而 V4-Pro 的 output 价格是 $0.87/百万。Flash 的输出价格仅为 Pro 的约三分之一,并发上限 2500。对于需要大量 Agent 循环调用的开发者来说,这个价差意味着成本可以差出数倍。
开源与自部署
权重已上传 HuggingFace,MIT 协议、无门控,商业部署无障碍。但自部署门槛不低:284B MoE 意味着所有专家都需常驻内存。DeepSeek 官方示例用 4×GB300 节点提供服务;Unsloth 的动态 GGUF 量化方案中,8-bit 版本需 162GB,3-bit 版本需约 103GB(加上运行时约 110GB 内存)。适合有 GPU 集群的中大型企业,或愿意用激进量化的个人工作站。
新增能力
V4-Flash-0731 原生支持 OpenAI Responses API 格式,并专门适配了 Codex。DSpark 推测解码模块随权重一起发布,官方称可带来 60-85% 的单用户生成加速。推理模式支持 low/high/max 三档,max 模式下输出 token 上限可达 384K。
需要注意
所有 Agent 基准数据均为 DeepSeek 自行报告,且使用了尚未公开的 DeepSeek Harness minimal mode 作为测试框架。不同框架下的结果可能存在差异,建议开发者自行跑评测后再做决策。此外,DSBench-FullStack 和 DSBench-Hard 为内部测试集,外部无法复现。
基于多家媒体转述整理,核心数据来源为 DeepSeek 官方 API 文档 changelog 及 HuggingFace 模型卡。