谷歌发布了一项突破性算法,震惊硅谷,也引发了华尔街激烈争论:AI对内存的需求,是不是要降温了?
美东时间周二,Google发布了一项震惊硅谷的全新算法——TurboQuant,一种超高效的AI内存压缩技术。Google宣称,这项算法能在完全不损失模型准确性的前提下,将大型语言模型运行时所需的缓存内存占用减少至少6倍,同时提升性能达8倍。简单说,就是让AI在用更少内存的同时,记住更多、跑得更快。
消息一出,美股芯片股应声下跌。市场立刻掀起激烈讨论:困扰科技巨头已久的内存短缺危机,是不是要结束了?
那么,TurboQuant到底是什么?
根据Google官网介绍,TurboQuant是一种专为键值缓存(KV Cache)和向量搜索设计的压缩方法,核心目标是在不牺牲精度的情况下大幅缩小模型运行时的内存开销。它通过两个关键步骤实现:
第一,高质量压缩(PolarQuant方法):先对数据向量进行随机旋转,简化其几何结构,再对每个部分分别应用高精度量化器。这一步保留了原始向量的主要信息和语义特征,承担了大部分压缩任务。
第二,消除隐藏误差:用仅1比特的剩余压缩能力,把QJL算法用在第一阶段留下的微小误差上,相当于一个“数学纠错器”,确保注意力机制的计算结果依然精准。
整个过程无需预处理或特定校准数据,直接嵌入现有模型即可生效。
Google用Gemma和Mistral等开源长上下文模型,在LongBench、Needle In A Haystack、ZeroSCROLLS等多个权威基准上测试了TurboQuant,并与PolarQuant、KIVI等其他压缩方案对比。结果显示,TurboQuant在点积失真和召回率等关键指标上全面领先,同时将KV缓存内存占用压低了至少6倍,下游任务表现却毫无损失。
他们计划在下个月的ICLR 2026会议上正式公布这项成果,并详细介绍背后的两种核心技术:PolarQuant量化方法和QJL优化训练框架。
有人甚至把这次突破比作Google的“DeepSeek时刻”——就像HBO剧《硅谷》里Pied Piper公司用压缩算法颠覆行业那样,现实中的TurboQuant也可能彻底改变AI部署的成本结构。Cloudflare CEO Matthew Prince就在X上写道:“AI推理在速度、内存、功耗和利用率上还有巨大优化空间,而TurboQuant正踩在了这个点上。”
眼下正值全球内存芯片严重短缺之际。各大科技公司疯狂扩建AI数据中心,HBM和DRAM供不应求,价格持续攀升。TurboQuant的出现,被不少人视为可能给这轮“内存狂热”降温的关键技术。
市场反应迅速:周三美股开盘后,存储芯片股集体跳水——闪迪一度大跌6.5%,美光跌4%,西部数据和希捷跌幅均超4%。周四亚洲交易时段,SK海力士跌4.42%,三星也下滑3.02%。
Futurum分析师Shay Boloor直言:“市场担心,长上下文AI推理所需的内存可能因此大幅减少,这对内存厂商是潜在利空。”
但并非所有人都这么悲观。摩根士丹利就提出了相反观点。
他们指出,Google所说的“8倍性能提升”是相对于老旧的32-bit模型而言,而当前主流推理早已采用4-bit甚至更低精度量化,实际增益没那么夸张。更重要的是,TurboQuant只压缩推理阶段的键值缓存,并不影响模型权重所占的HBM内存,也不涉及训练环节。
换句话说,它并没有让总内存需求减少6倍,而是通过提升效率,让单块GPU能处理4到8倍更长的上下文,或在不爆内存的前提下跑更大批量的任务。
更关键的是,大摩援引了经济学中的“杰文斯悖论”:效率提升往往不会降低资源消耗,反而会刺激更多使用。就像蒸汽机越高效,煤炭用得越多一样,AI推理成本一旦大幅下降,可能会让更多人用得起长上下文模型,甚至推动本地部署普及,最终反而拉高整体硬件需求。
事实上,去年DeepSeek刚发布时,市场也曾担忧AI芯片需求会降温,结果却是应用爆发、算力需求再创新高。
所以,TurboQuant或许不是内存需求的“刹车”,而是AI普及的“油门”。





