DeepSeek推出多模态模型deepseek-v4-flash-vision-exp,面向Agent场景

2026-08-22 03:10 4 次浏览 前沿资讯

DeepSeek发布实验性多模态模型deepseek-v4-flash-vision-exp,在保持V4-Flash文本能力基础上新增视觉理解,支持图片输入,定价延续低费率,并同步推出Files API简化图片复用,重点提升多模态Agent任务执行能力。

近日,DeepSeek正式上线了一款面向Agent时代的多模态模型——deepseek-v4-flash-vision-exp。该模型在保持DeepSeek-V4-Flash出色文本能力的基础上,新增了视觉理解能力,能够处理图片输入,并进一步提升了多模态Agent任务的表现。这一动作标志着DeepSeek在多模态能力上从单纯的“看图问答”走向更复杂的任务执行场景。

事件概览

deepseek-v4-flash-vision-exp目前已在DeepSeek API平台上开放使用,开发者可通过设置model=’deepseek-v4-flash-vision-exp’进行访问。官方将其定位为实验性模型,旨在为Agent工作流提供视觉支持。与此同时,DeepSeek Harness 0.1.1版本也加入了对该模型的原生支持,开发者可以直接调用该模型,将图像理解能力接入现有Agent工作流。

核心信息

模型能力与定位

deepseek-v4-flash-vision-exp在文本能力方面与V4-Flash保持一致,包括Agent能力、推理能力以及世界知识。新增的视觉理解能力使之能够处理混合文本和图片输入,图片可以通过Base64、外部URL或Files API方式提供。在多模态Agent基准测试中,该模型相比V4-Flash有明显提升,表现接近Opus-4.8等高端模型。

API调用方式

开发者可以通过Chat Completions、Messages以及Responses API调用该模型,使图片理解能力融入不同类型的应用。例如,在办公场景中,Agent可以读取截图、分析文档页面、理解表格内容;在开发场景中,可以识别界面问题、分析错误信息;在内容生产场景中,可以根据图片素材辅助生成内容。

定价策略

deepseek-v4-flash-vision-exp延续了V4-Flash的价格体系。输入和输出均按token计费,其中图片会根据尺寸转换为token,与文本token一同计算。每张图片最高换算为384 tokens。具体价格为:

  • 输入价格(百万tokens):缓存命中时,空闲时段0.05元,高峰时段0.10元;缓存未命中时,空闲时段1.5元,高峰时段3元。
  • 输出价格(百万tokens):空闲时段4.5元,高峰时段9元。

高峰时段为北京时间每天9:00至12:00以及14:00至18:00,其余时间按空闲时段计费。这一定价延续了DeepSeek相对低成本的API策略,旨在降低开发者调用视觉模型的门槛。

Files API解决图片复用问题

伴随视觉模型上线,DeepSeek同步推出了Files API。此前,开发者在使用视觉模型时,需要在每次请求中重新上传图片,当图片需要在多个请求或多轮对话中重复使用时,不仅增加网络传输成本,还会受到请求大小限制。Files API允许开发者先上传图片文件,随后通过file_id在不同请求中引用同一文件,无需重复上传。目前,Files API支持JPEG、PNG、GIF和WebP格式,单个文件最大64 MiB,单用户最大存储空间25 GiB,最多可保存10000个文件。这一功能对于需要长期分析产品资料、反复调用素材的复杂Agent工作流尤为重要。

影响与观察

此次DeepSeek上新模型,并未单独强调图像生成或视觉娱乐能力,而是将重点放在多模态Agent场景,这与行业趋势高度吻合。AI Agent正在从处理文字指令,走向理解现实世界中的各种信息。文字是人类交流的重要方式,但大量真实工作依赖图片、文件、界面和环境信息。一个只能处理文本的Agent,很难真正进入办公、设计、开发等复杂场景。因此,多模态能力正在成为Agent进一步发展的基础设施。DeepSeek通过V4-Flash-Vision-Exp、Files API以及Harness生态支持,正在尝试补齐这一环节。从定价策略来看,DeepSeek继续以较低成本吸引开发者,尤其关注长尾应用场景,这有助于推动多模态Agent的普及。

结语

deepseek-v4-flash-vision-exp的发布,意味着DeepSeek在多模态方向上迈出了实质性一步。虽然目前仍为实验性模型,但其在Agent任务中的表现已经接近业界先进水平。随着Files API等配套工具的完善,开发者将能够更便捷地构建支持视觉理解的智能应用。未来,多模态Agent或许会成为AI落地的关键形态,而DeepSeek正在为此铺路。


信息来源:爱范儿,查看原始信息。本文由 AI ONLINE 基于公开资料整理,信息可能随时间变化,请以官方发布为准。