返回行业动态
模型与产品

DeepSeek发布V4.1 Flash:552B MoE新架构、KV缓存需求降至1/4,V4-Pro将于9月14日下线

DeepSeek于2026年9月10日正式发布V4.1 Flash,采用全新Causal Encoder-Decoder架构,总参数552B的MoE模型输入仅激活8B、输出激活16B,并原生支持多模态视觉理解。官方称其KV Cache对HBM的需求降至上一代的1/4、对SSD的需求降至1/8,上下文扩展至100万token输入、38.4万token输出。第三方测试显示该模型在性能、费用、速度与总用时上全面超越V4-Pro,DeepSeek据此同步下调API定价,并计划自9月14日起把V4-Pro请求全部路由至V4.1 Flash并按Flash单价计费。模型以MIT许可在Hugging Face开源,腾讯WorkBuddy(含CodeBuddy)与OpenCode成为官方合作伙伴。

来源:DeepSeek 官方发布原标题:DeepSeek V4.1 Flash:更强、更快、更普惠查看原文
深蓝色科技背景中,数据中心机架与发光神经网络光效组成的AI算力主题封面

图片来源:北京拓实科技(AI 生成)

发生了什么

2026年9月10日,DeepSeek正式发布新一代模型DeepSeek V4.1 Flash。官方将其定位为「全新模型结构系列中最小尺寸的模型」,但它同时是本次架构切换的起点:模型采用非对称的Causal Encoder-Decoder结构,输入侧与输出侧分离,输入仅激活8B参数、输出激活16B参数,而总参数量为552B的混合专家(MoE)规模。模型原生具备多模态视觉理解能力,上下文窗口为100万token输入、最高38.4万token输出。

  • 架构与效率:KV Cache对HBM的需求降至上一代的1/4,对SSD的存储需求降至1/8,官方称这对缓存命中费用占比较高的Agent类任务影响最直接。
  • 开源方式:权重已在Hugging Face发布并附带技术报告,采用MIT许可,官方表示将支持社区进行推理适配,并寻求更大规模部署。
  • 价格调整:闲时输入(缓存命中)0.02元、未命中1.0元、输出4.0元(每百万token);高峰时段翻倍,高峰定义为工作日9:00—12:00、14:00—18:00(北京时间)。新价格自9月10日12:00生效。
  • 旧模型退役:V4 Flash与V4 Flash Vision Exp已下线,旧模型名暂时路由到V4.1 Flash;自北京时间9月14日12:00起,deepseek-v4-pro的请求全部路由至V4.1 Flash并按Flash单价计费,直至V4.1 Pro上线。

为什么重要

本次发布的实质是企业侧推理成本的重新定价。长上下文、多轮工具调用的Agent工作负载中,缓存命中费用往往占账单的主要部分;在KV Cache内存占用压缩到四分之一、SSD占用压缩到八分之一的条件下,同样的上下文长度可以服务更多并发请求。对于以代码审查、知识库问答、流程自动化为主的企业用户,这意味着单位任务成本的下降幅度可能显著大于单纯的价格表下调。

另一个值得注意的变化是供应商切换的强制性。V4-Pro将在四天后被统一路由到V4.1 Flash,使用V4-Pro构建的生产系统实际上被安排了一次「未主动选择的模型替换」。DeepSeek表示V4.1 Pro后续会推出,但未给出时间表。

市场反应与尚待观察

受竞品发布新模型并下调价格影响,港股AI板块当日承压,智谱收跌10.34%、MiniMax收跌8.98%。同期有媒体报道DeepSeek正筹备科创板IPO,但该消息尚未获得官方确认,本刊不作事实认定。

需要审慎看待的是官方基准测试的边界:DeepSeek公布的部分跑分来自其自建的Agentic评测集,第三方独立复现数据仍然有限;此外,官方未公布自托管552B权重所需的硬件门槛与吞吐指标,这对计划本地化部署的企业是关键缺口。已基于V4-Pro构建业务的企业应尽早用自有评测集验证V4.1 Flash的实际表现。

「经多方测试,V4.1 Flash在性能、费用、速度、总用时等各项指标上已全面超越DeepSeek V4 Pro。」——DeepSeek官方公告
编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。