发生了什么
2026年9月10日,DeepSeek正式发布新一代模型DeepSeek V4.1 Flash。官方将其定位为「全新模型结构系列中最小尺寸的模型」,但它同时是本次架构切换的起点:模型采用非对称的Causal Encoder-Decoder结构,输入侧与输出侧分离,输入仅激活8B参数、输出激活16B参数,而总参数量为552B的混合专家(MoE)规模。模型原生具备多模态视觉理解能力,上下文窗口为100万token输入、最高38.4万token输出。
- 架构与效率:KV Cache对HBM的需求降至上一代的1/4,对SSD的存储需求降至1/8,官方称这对缓存命中费用占比较高的Agent类任务影响最直接。
- 开源方式:权重已在Hugging Face发布并附带技术报告,采用MIT许可,官方表示将支持社区进行推理适配,并寻求更大规模部署。
- 价格调整:闲时输入(缓存命中)0.02元、未命中1.0元、输出4.0元(每百万token);高峰时段翻倍,高峰定义为工作日9:00—12:00、14:00—18:00(北京时间)。新价格自9月10日12:00生效。
- 旧模型退役:V4 Flash与V4 Flash Vision Exp已下线,旧模型名暂时路由到V4.1 Flash;自北京时间9月14日12:00起,deepseek-v4-pro的请求全部路由至V4.1 Flash并按Flash单价计费,直至V4.1 Pro上线。
为什么重要
本次发布的实质是企业侧推理成本的重新定价。长上下文、多轮工具调用的Agent工作负载中,缓存命中费用往往占账单的主要部分;在KV Cache内存占用压缩到四分之一、SSD占用压缩到八分之一的条件下,同样的上下文长度可以服务更多并发请求。对于以代码审查、知识库问答、流程自动化为主的企业用户,这意味着单位任务成本的下降幅度可能显著大于单纯的价格表下调。
另一个值得注意的变化是供应商切换的强制性。V4-Pro将在四天后被统一路由到V4.1 Flash,使用V4-Pro构建的生产系统实际上被安排了一次「未主动选择的模型替换」。DeepSeek表示V4.1 Pro后续会推出,但未给出时间表。
市场反应与尚待观察
受竞品发布新模型并下调价格影响,港股AI板块当日承压,智谱收跌10.34%、MiniMax收跌8.98%。同期有媒体报道DeepSeek正筹备科创板IPO,但该消息尚未获得官方确认,本刊不作事实认定。
需要审慎看待的是官方基准测试的边界:DeepSeek公布的部分跑分来自其自建的Agentic评测集,第三方独立复现数据仍然有限;此外,官方未公布自托管552B权重所需的硬件门槛与吞吐指标,这对计划本地化部署的企业是关键缺口。已基于V4-Pro构建业务的企业应尽早用自有评测集验证V4.1 Flash的实际表现。
「经多方测试,V4.1 Flash在性能、费用、速度、总用时等各项指标上已全面超越DeepSeek V4 Pro。」——DeepSeek官方公告

