在国内大模型竞争日趋白热化的背景下,多模态能力已成为标配。
6月18日,DeepSeek正式上线识图模式,支持App和网页端使用。
这意味着DeepSeek正在补齐多模态能力的短板,从纯文本模型向全能型AI助手演进。

识图模式是什么?不是OCR,是真正的“看图”
很多人可能觉得,识图功能不是早就有吗?之前不也能让DeepSeek提取图片里的文字?但这次不一样。DeepSeek的识图模式并不是从OCR中提取文字,而是终于“认识”图片了。
以前的图片功能是“读图上的字”,现在的识图模式是“看懂图里的内容”。
比如你上传一张博物馆文物的照片,它不仅能描述纹理材质,还能推断出这是元末明初的典型青花瓷。

你上传一张复杂的UI截图,它能反向生成可交互的HTML代码,连跳转按钮都能复原。


DS 还原的腾讯云首页
这种能力远超简单的文字提取,是真正的视觉理解。
技术核心:“以视觉原语思考”框架
DeepSeek识图模式背后的技术框架叫“Thinking with Visual Primitives”,翻译过来是“以视觉原语思考”。这名字听起来有点学术,但核心思想其实很直观。
传统多模态大模型在面对复杂图片时,会遇到一个叫“指代鸿沟”的问题。
简单说就是,模型能看见图片,但在推理过程中用“左边那个大的”这种模糊描述来指代目标时,很容易指错地方。
就像你跟朋友描述照片里的东西,说“右边那个红色的”,对方可能完全找不对。
DeepSeek的解法是:把点、边界框这些代表空间位置的视觉元素,直接融入模型的推理链条。模型在思考时,会像人类用“赛博手指”在图片上精确指出目标一样,边想边指。这样就解决了复杂场景下的定位难题。
更厉害的是,这种框架对算力非常友好。处理一张800×800的图片,DeepSeek只消耗约90个tokens,而GPT和Claude需要870到1100个tokens。效率差了将近10倍。

能力实测:能鉴定文物,也能转截图
从用户实测来看,DeepSeek的识图能力确实可圈可点。
文物鉴定:我上传了一张元青花瓷器,开启“深度思考”后,DeepSeek不仅详细描述了纹理材质,甚至准确推断出它属于明代早期的典型器物。
逻辑推理:在一项需要在脑海中拼合立方体的高难度空间推理题中,虽然不开思考模式容易出错,但一旦开启深度思考,耗费约4分钟后给出了正确答案。这说明它的推理能力确实在线。
表情包解读:上传时下流行的梗图,它能精准识别合照中的人物,甚至能解读出小猫的无奈情绪,准确理解网民的转发笑点。这“网感”比很多人类都强。
截图转码:直接将包含代码、复杂UI界面的技术报告或网页截图进行解析,提取出所有文字,甚至能一键反向生成可交互的HTML代码。
有趣现象:认不出梁文锋,但能认出马斯克
最有趣的测试结果来了。DeepSeek的识图模式无法识别自家创始人梁文锋的照片。
我上传了一张梁文锋的照片,DeepSeek将其识别为聚美优品的陈欧(网上有测试识别成字节跳动的张一鸣)的。而同一张照片上传到豆包、元宝和千问,都能正确识别。

为什么认不出自家老板?业内推测,梁文锋行事非常低调,网络公开照片和信息较少,模型难以形成稳定识别特征。这也说明DeepSeek没有针对自家老板进行特殊识别优化——挺实在的,不搞个人崇拜。
当前限制:不支持联网,知识库有滞后
当然,刚学会“睁眼”的DeepSeek并没有完美。从实测反馈来看,目前的识图模式存在几个明显不足:
知识库滞后:在某些测试中,虽然模型的推理过程和分析逻辑完全正确,但最终答案却张冠李戴。比如识别某款2025年底发布的最新型号手机时,因其知识库停留在2025年,虽然能通过副屏细节推断出旧型号,但仍给出了完全错误的具体型号。
反直觉图形题不稳定:在面对数图中老虎数量、视错觉等高难度题目时,答案存在很大不确定性,甚至有时在经过长时间“深度思考”后,反而出现更严重的幻觉。
不支持联网搜索:识图功能目前无法实时分析图片内容。如果图片背后依赖的是昨天刚发生的新闻,或者今天刚火起来的梗,它就会出现知识盲区。它更像是一个“看图推理器”,而不是“看图搜索引擎”。
功能范围有限:目前的识图模式本质上是纯视觉理解模块,主要集中在图片识别与分析层面,尚未集成图像生成、视频理解或跨模态交互等更为广义的多模态功能。

行业意义:补齐多模态短板,竞争白热化
从行业角度看,DeepSeek识图模式的上线意义重大。
在国内大模型竞争中,多模态能力已成为标配。百度文心一言、阿里通义千问、腾讯混元、字节豆包等玩家早已布局多模态,DeepSeek此前主要聚焦文本推理,这次识图功能的上线标志着它正式补齐了多模态能力的短板。
从技术路线看,DeepSeek选择的“以视觉原语思考”框架,在效率上具有明显优势。(极致性价比这一块真是不得不服 DS)
90个tokens处理一张图片,相比其他模型动辄上千tokens的消耗,在成本控制上更具竞争力。这对于API调用场景来说,意味着更低的成本和更快的响应速度。
从产品演进看,DeepSeek正在从纯文本模型向全能型AI助手演进。识图模式只是第一步,未来如果集成图像生成、视频理解、跨模态交互等能力,DeepSeek的产品形态将更加完整。
不过,目前的识图模式仍处于初始阶段,提示“图片理解功能内测中”。
对于普通用户来说,现在就可以在网页端和App端体验识图模式。虽然还有些小毛病,但整体体验已经相当不错。至少,下次再有人问“DeepSeek老板长啥样”,你可以把梁文锋的照片发给DeepSeek,看看它会认成谁——这本身就挺有趣的。

以上就是这次的侦察。
如果对你有用,顺手点个赞 +「♡」,转发给可能踩坑的同事;
想第一时间收到前线情报,给「硅基斥候S01」加个星标⭐。我们,下次侦察见。

