Google的AI搜索每天可能会生成数千万条错误答案。
有测试显示,Google在搜索结果中默认展示的AI总览内容,虽然大部分时间是准确的,但在当前超大规模的搜索量下,哪怕只有一小部分出错,也意味着用户每天会看到数以千万计的错误答案。
《纽约时报》援引AI初创公司Oumi的评估称,大约每10条Google AI总览中就有1条包含虚假信息。按Google每年处理约5万亿次搜索来推算,用户每小时可能会接触到超过5700万条不准确的回答,换算下来几乎是“每分钟近百万条”。
Oumi应《纽约时报》要求,使用广泛采用的生成式AI测试基准SimpleQA,对Google搜索中的Gemini准确率做了量化评估。在4326条搜索样本中,去年10月Gemini 2提供准确AI总览的比例约为85%,到了今年2月升级到Gemini 3后,这一比例提升到了91%。不过,Oumi之所以能在大样本规模下进行评估,本身也依赖其他AI工具,这可能会引入新的误差。与此同时,Google在实际使用中有时会对同一个搜索请求给出不同的AI总览内容,即便两次搜索之间只隔了几秒钟,这也加大了评估的难度。
Google方面则认为Oumi的测试方法“有缺陷”,并不符合真实世界的搜索行为。按照Google内部测试数据,在脱离搜索、单独运行的情况下,Gemini 3的“幻觉率”(生成错误内容的比例)约为28%。
报道指出,信息来源也是一大难题。Google会尝试在AI总览中附上相关链接,但这些链接经常无法真正支撑Gemini给出的结论——无论这些结论本身是对是错。测试发现,在一些情况下,错误的AI总览后面紧跟着的链接却给出了正确信息;也有时候,总览内容准确,但引用的是含有错误信息的网页;还有一部分结果中,链接页面根本没有与总览相关的内容。
更值得注意的是,AI总览与其引用来源之间的不一致现象在升级后更加突出:使用Gemini 2时,有37%的搜索存在这种不一致,而升级到Gemini 3后,这一比例升至56%。
研究人员还发现,AI总览容易被外部内容“操控”。一位BBC记者在个人博客中刻意发布了错误信息,随后便发现Google在第二天的搜索总览中重复了这些不实内容。
在使用条款的细则中,几家主流科技公司事实上都承认了当前生成式AI对“真实性”的把握仍然不牢靠。微软在条款中把其Copilot工具界定为“仅供娱乐”,不适宜用来做出重要决策。Google则在AI总览界面明确提示用户要对回答进行再次核查,而xAI也公开承认,其模型存在产生“幻觉”的可能性。





