DeepSeek开源首款多模态模型V4-Flash-Vision-Exp:视觉Agent能力接近Opus-4.8

2026-09-01 17:20:46   |   探索者   |   5476

9月1日,DeepSeek今日在Hugging Face正式开源DeepSeek-V4-Flash-Vision-Exp模型,采用MIT License,这是DeepSeek V4系列首款原生支持图片输入的视觉语言模型。公开内容包括模型文件、Tokenizer、Prompt Encoding参考实现,以及最小化PyTorch推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections与DSpark等核心模块。

该模型于2026年8月21日上线DeepSeek API平台,官方标注为“Exp”实验版本,支持在文本之外输入图片,可完成图片描述、截图文字识别、图表分析等任务,支持JPEG、PNG、GIF、WebP格式。

在性能表现上,V4-Flash-Vision-Exp在Agent、推理、世界知识等纯文本任务上与V4-Flash正式版持平,原有优势完整保留。在需要视觉理解的Agent基准测试中较V4-Flash大幅提升,多模态Agent能力已接近Opus-4.8。

深度求索官方表示,该模型在各类Agent框架内展现出较好的多模态适配能力,能够有效支持开发者借助多样化的Agent工具解锁更多实用工作场景。模型已在GitHub同步开源。

此次开源标志着DeepSeek V4系列正式从纯文本模型拓展至多模态领域,为开发者提供了低成本、高性能的视觉语言模型选择。不过,作为实验版本,其稳定性和长期支持情况有待社区进一步验证。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

DeepSeek开源首款多模态模型V4-Flash-Vision-Exp:视觉Agent能力接近Opus-4.8

2026-09-01 17:20:46 浏览量: 5476 作者: 探索者

9月1日,DeepSeek今日在Hugging Face正式开源DeepSeek-V4-Flash-Vision-Exp模型,采用MIT License,这是DeepSeek V4系列首款原生支持图片输入的视觉语言模型。公开内容包括模型文件、Tokenizer、Prompt Encoding参考实现,以及最小化PyTorch推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections与DSpark等核心模块。

该模型于2026年8月21日上线DeepSeek API平台,官方标注为“Exp”实验版本,支持在文本之外输入图片,可完成图片描述、截图文字识别、图表分析等任务,支持JPEG、PNG、GIF、WebP格式。

在性能表现上,V4-Flash-Vision-Exp在Agent、推理、世界知识等纯文本任务上与V4-Flash正式版持平,原有优势完整保留。在需要视觉理解的Agent基准测试中较V4-Flash大幅提升,多模态Agent能力已接近Opus-4.8。

深度求索官方表示,该模型在各类Agent框架内展现出较好的多模态适配能力,能够有效支持开发者借助多样化的Agent工具解锁更多实用工作场景。模型已在GitHub同步开源。

此次开源标志着DeepSeek V4系列正式从纯文本模型拓展至多模态领域,为开发者提供了低成本、高性能的视觉语言模型选择。不过,作为实验版本,其稳定性和长期支持情况有待社区进一步验证。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号