美国国家标准与技术研究院旗下的AI标准与创新中心专门针对DeepSeek V4 Pro做了一份评估报告,结果显示这款模型的能力跟美国最前沿的AI相比,大概有8个月的差距。
DeepSeek V4系列大模型在4月24日正式发布,距离上一次DeepSeek R1的更新已经过去了15个月。V4的性能到底怎么样,在国内外的讨论中都挺受关注,美国那边也很上心。
关于DeepSeek V4的能力,已经有不少测试了。美国外交关系委员会之前组织三位高级研究员做过研究,报告显示它大约落后美国顶级大模型7个月。现在美国国家标准与技术研究院下属的人工智能标准与创新中心也来评估了,他们的结论是DeepSeek V4跟美国相比大约落后8个月,跟前面的结论差不多。
在他们的评估结果里,DeepSeek V4得分在800分左右,而当前最强的GPT-5.5分数超过1200分,GPT-5.4和Opus 4.6也都在1000分以上。DeepSeek V4的整体性能跟8个月前的GPT-5差不多,但官方之前在发布报告里认为它跟GPT-5.4是差不多的。不过CAISI也承认,DeepSeek V4是他们评测过的中国最强AI大模型,在网络、软件工程、自然科学、抽象推理和数学这五个领域里的九项测试中表现都很强。
更重要的是,DeepSeek V4的性价比更强。就算跟美国最有成本优势的GPT-5.4 mini比,DeepSeek V4在七个基准测试里也有四个测试的成本更优,高出41%到53%不等。





