DeepSeek开源首款多模态模型V4-Flash-Vision-Exp:视觉Agent能力接近Opus-4.8
9月1日,DeepSeek今日在Hugging Face正式开源DeepSeek-V4-Flash-Vision-Exp模型,采用MIT License,这是DeepSeek V4系列首款原生支持图片输入的视觉语言模型。公开内容包括模型文件、Tokenizer、Prompt Encoding参考实现,以及最小化PyTorch推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections与DSpark等核心模块。
该模型于2026年8月21日上线DeepSeek API平台,官方标注为“Exp”实验版本,支持在文本之外输入图片,可完成图片描述、截图文字识别、图表分析等任务,支持JPEG、PNG、GIF、WebP格式。
在性能表现上,V4-Flash-Vision-Exp在Agent、推理、世界知识等纯文本任务上与V4-Flash正式版持平,原有优势完整保留。在需要视觉理解的Agent基准测试中较V4-Flash大幅提升,多模态Agent能力已接近Opus-4.8。
深度求索官方表示,该模型在各类Agent框架内展现出较好的多模态适配能力,能够有效支持开发者借助多样化的Agent工具解锁更多实用工作场景。模型已在GitHub同步开源。
此次开源标志着DeepSeek V4系列正式从纯文本模型拓展至多模态领域,为开发者提供了低成本、高性能的视觉语言模型选择。不过,作为实验版本,其稳定性和长期支持情况有待社区进一步验证。