DeepSeek大范围开放“识图模式”:正式跨入图文交互时代
5月9日,上个月底开始灰度测试的DeepSeek“识图模式”,现已大范围向用户开放体验。该模式并非简单的文字OCR,而是具备了真正的图片识别理解能力。目前几乎所有测试账号都能看到该入口,但DeepSeek中仍标注为“图片理解功能内测中”。
拥有灰度测试资格的用户会发现,输入框上方与“快速模式”和“专家模式”并列,新增了一个“识图模式”按钮。开启该模式后,用户可以直接上传图片让DeepSeek“看”世界,其能力边界远超简单的文字提取。
在实测体验中,DeepSeek展现出多方面的能力。作为“博物学家”,有网友上传博物馆拍摄的不明文物后,开启深度思考的DeepSeek不仅详细描述了纹理与材质,甚至准确推断出某件玉器属于18世纪清代乾隆时期的“痕都斯坦风格”。面对高难度空间推理题——需要在脑海中拼合立方体时,虽然不开启思考模式容易给出错误答案,但一旦开启深度思考并耗费约4分钟,最终给出了正确答案。它还展现出极强的“网感”,能够精准识别表情包或梗图中的人物,例如从一张合影中同时精确区分出特朗普和鲁路修,甚至能解读出小猫的无奈情绪。在生产力方面,它可以充当“截图转码器”,将包含代码、复杂UI界面的技术报告或网页截图进行解析,提取所有文字,甚至一键反向生成可交互的HTML代码。
伴随识图模式上线,DeepSeek还公开了其背后的多模态模型技术细节,公布了名为“以视觉原语思考”的核心框架。据技术报告解释,传统多模态大模型在面对密集场景时存在“指代鸿沟”——模型虽能看见图片,但在推理过程中用模糊的自然语言构建逻辑链时,容易因描述不准导致注意力漂移。DeepSeek的解法是将点、边界框等代表空间位置的视觉元素直接融入推理链条,使其成为“思维的基本单元”,让模型像人类用“赛博手指”精确指出目标物一样,边想边指,从而解决复杂空间布局中的逻辑难题。
这一高效框架对算力资源非常友好。处理一张800×800分辨率的图片时,DeepSeek仅消耗约90个tokens,而GPT和Claude等其他主流模型需要消耗约870到1100个tokens。在多项计数与空间推理基准测试上,DeepSeek达到了比肩甚至超越前沿模型的水平。
不过,目前识图模式仍存在明显不足。知识库更新存在滞后性,例如识别2025年底发布的最新型号手机时,虽能通过副屏细节推断旧型号,但因知识库停留在2025年,仍给出完全错误的具体型号。面对数图中老虎数量、视错觉等高难度反直觉图形题目时,答案存在较大不确定性,有时经过长时间深度思考后反而出现更严重的幻觉。此外,目前的识图模式本质上是纯视觉理解模块,主要集中在图片识别与分析层面,尚未集成图像生成、视频理解或跨模态交互等更广义的多模态功能。