DeepSeek-V4.1-Flash 发布:新架构+原生多模态,Agent 成本大降
9月10日,DeepSeek 正式发布全新模型 DeepSeek-V4.1-Flash。这是 DeepSeek 新一代架构家族中"最小"的版本,但官方明确表示,它的能力已经超越了上一代旗舰 V4 Pro。同时,API 价格同步下调,V4 Pro 将于9月14日下线,请求自动转至新模型。
它是什么?
DeepSeek-V4.1-Flash 是 DeepSeek 首款采用全新 Causal-Encoder-Decoder(CED) 架构的模型。简单说,这个架构把模型分成两部分:输入侧只激活 8B 参数(轻量快速),输出侧激活 16B 参数(保证质量)。这种"非对称设计"大幅降低了推理成本,同时维持了高智能水平。
整体是一个 552B 参数的 MoE(混合专家)模型,在多项基准测试中超越了 DeepSeek V4 Pro,包括 GPQA Diamond(90.9分)、HLE(36.8分)、Codeforces Rating(3471)等。
另一个重大变化:原生多模态视觉理解。以前 DeepSeek 的多模态版本是单独模型,现在视觉能力直接融入主力模型,用户只需调一次 API 就能处理文本和图像。
为什么对开发者重要?
Agent 成本大降
在长上下文 Agent 场景中,KV Cache 是最大开销之一。V4.1 Flash 通过架构优化,将 KV Cache 体积压缩了 437 倍——相比初代模型,显存需求降至 1/4,SSD 缓存需求降至 1/8。这意味着跑一个长对话或复杂 Agent 任务,成本可能只有之前的几分之一。
价格下调
得益于架构创新,DeepSeek 同步下调了 API 定价。同时保留峰谷计费,闲时价格为高峰的一半,鼓励错峰使用。
V4 Pro 即将下线
从9月14日12:00起,所有对 deepseek-v4-pro 的请求将自动路由到 V4.1 Flash,并按新价格计费。旧模型名 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 也暂时会路由到新模型。
开源情况
模型权重已在 Hugging Face 上线,采用 MIT 协议开源,附带 51 页技术报告,开发者可以自由部署和二次开发。腾讯(WorkBuddy、CodeBuddy)和 OpenCode 已全量接入 V4.1 Flash。
这意味着什么?
对普通用户来说,DeepSeek 这次的更新意味着:同样任务可能更便宜、更快,而且能同时看图了。对开发者来说,Agent 场景的成本优势最明显——长上下文不再那么烧钱。对开源社区来说,MIT 协议 + 完整架构细节,为后续研究提供了坚实基础。
---
*来源:DeepSeek 官方 API Changelog、DeepSeek 官方博客、Hugging Face 模型卡及 51 页技术报告;腾讯新闻、AIHub、V2EX、ProgressiveRobot 等媒体报道。基于多家媒体转述整理。*