DeepSeek终于支持图片识别了。我第一时间就去试了试,拿它来算命看看效果。
就在刚刚,DeepSeek的多模态功能悄悄开始了灰度测试。部分被选中的用户会发现,界面上多了一个“识图模式”的入口。上传一张图片,DeepSeek就能像人一样看懂画面里的东西,而不仅仅是识别文字了。
DeepSeek的好几位研究员第一时间就发文官宣了这个新功能。其中一位研究员陈德里说,这个功能是多模态团队的成果,现在小鲸鱼终于有了“看见世界”的能力。我们也正好被灰度到了,于是赶紧做了一轮测试。
先是基础识物。我们上传了一张兔子的照片,DeepSeek一眼就认出了品种,还能描述出兔子的姿态。接着加了一点难度,上传了它老家杭州灵隐寺的照片。图中只有右下角路灯上用草书刻着“灵隐寺”三个字,对普通人来说其实不太好认。我们让它判断这是哪座城市、哪个地点,结果它很快根据建筑风格和路灯上的字判断出是灵隐寺,给出的坐标也完全正确,而且生成速度非常快,不开思考模式的话几乎就是眨眼的功夫。
我们又上传了一张带有视觉陷阱的图片。图中几个物品摆放的角度很容易让人误以为有个人正坐在椅子上。结果DeepSeek没被骗,它看出了墙面修补痕迹、垃圾堆放区这些细节,完全没掉进视觉陷阱里。
DeepSeek的视觉模式也支持深度思考。我们上传了一张随手拍的街景照片,上面没有任何文字信息,想看看它能不能找到蛛丝马迹来判断位置。开启推理之后,它的视觉能力明显更强了。它一步步拆解画面,把前景、中景、背景的信息都梳理出来,再根据地标特征和地理区域做匹配,直接判断出山脉是燕山山脉,建筑风格像北京昌平一带常见的样式,最后把范围缩到了昌平区或者海淀山后地区。其中有些猜测选项,离我们实际的位置已经不到10公里了。如果未来再接入联网搜索,估计它能直接顺着网线把我们地址给“开盒”出来。
我们也试了一下最近流行的“看手相”玩法。上传一张手掌照片后,DeepSeek第一眼先把左右手给看反了——我们上传的是左手,它判断成了右手。不过接下来的分析倒是有模有样,对手相形态的描述基本符合事实,分析得头头是道。至于该信多少,那就见仁见智了。
DeepSeek多模态这块拼图,总算是补上了。在很长一段时间里,缺少多模态能力一直是个遗憾。其实DeepSeek一直有在做相关研究,早期也发布过像Janus这样的开源多模态模型,只是始终没有在公开产品里面向大众开放。多模态已经是AI发展的大趋势了,画面里蕴含的丰富信息能帮助AI更好地认知这个世界,也更贴近人类理解世界的方式。虽然目前这个识图模式还只是个测试功能,但已经能让人看到它在视觉解析和跨模态推理上的潜力了。





