返回行业动态
模型与产品

DeepSeek 上线多模态视觉模型 V4-Flash-Vision-Exp:Agent 多模态能力接近 Opus-4.8

8月21日,DeepSeek 官方宣布全新实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 上线 API 平台。该模型在纯文本能力上与 V4-Flash 正式版持平,在需要视觉理解的 Agent 基准上大幅跃升,多模态 Agent 能力已接近 Claude Opus-4.8。开发者可通过 model='deepseek-v4-flash-vision-exp' 调用,图片按 token 计费、单张最多折算 384 tokens,价格与 V4-Flash 一致;同步上线的免费 Files API 支持先上传再按 file_id 复用图片,减少重复传输带宽。对国内开发者而言,这意味着可以低成本为 Agent 应用接入图像理解、截图分析、图表识别等能力,扩展了多模态 Agent 的应用场景。

来源:DeepSeek 官方 API 文档原标题:V4-Flash-Vision-Exp 上线,开启多模态 API 服务查看原文
蓝色科技风格封面插画:一只由数据流光构成的抽象眼睛,瞳孔中呈现图片与图表识别界面,周围环绕代码符号与神经网络节点,象征多模态视觉 AI 模型

图片来源:北京拓实科技原创(AI 生成)

发生了什么

8月21日,DeepSeek 官方宣布多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 DeepSeek API 平台。这是一个实验性质模型,开发者将模型名称设置为 deepseek-v4-flash-vision-exp 即可调用。模型支持图文混合输入,可完成图片描述、截图文字识别、图表分析等任务,支持 JPEG、PNG、GIF、WebP 四种格式。

能力与定价

官方介绍显示,在 Agent、推理、世界知识等纯文本能力上,V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 正式版持平;在需要视觉理解的 Agent Benchmark 上相比 V4-Flash 实现大幅跃升,多模态 Agent 能力已接近 Anthropic Claude Opus-4.8。计费方面,图片会转换为 token 后按 token 计费,单张图片最多折算 384 tokens,整体价格与 V4-Flash 保持一致。

对开发者的意义

  • 多模态 API 支持 Chat Completions、Messages、Responses 三种调用格式,可接入 LangChain、AutoGen、CrewAI 等主流 Agent 框架
  • 图片支持 Base64 内联、外部 URL、Files API 三种传入方式,适配不同开发场景
  • 同步上线的 Files API 免费开放,图片先上传后按 file_id 复用,适合多轮 Agent 工作流,节省带宽开销
  • 官方配套的 DeepSeek Harness 0.1.1 已默认支持新模型,开箱即用

企业视角

此前 DeepSeek V4 系列为纯文本模型,在需要视觉的 Agent 任务中常需借助虚构工具或外部 OCR 服务。V4-Flash-Vision-Exp 以接近 V4-Flash 的价格补齐了视觉短板,为商业 PPT 制作、网站视觉重构、前端 Demo 开发、截图分析与图表解读等真实场景提供了低成本多模态路径,也为国产大模型在多模态 Agent 赛道上增添了新的选择。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

DeepSeek 上线多模态视觉模型 V4-Flash-Vision-Exp:Agent 能力接近 Opus-4.8|北京拓实科技