4月23日消息,美国时间周三,Google正式发布了第八代TPU,这次在战略上做了一个大调整:第一次把AI模型的训练和推理任务分开了,由两款独立芯片分别负责。这两款新处理器预计今年晚些时候上市。



这一步也意味着Google在AI硬件领域对英伟达发起了新一轮竞争。

Google高级副总裁兼AI与基础设施首席技术官阿明·瓦达特在官方博文里解释说,之所以要走向算力专属化,是因为随着AI智能体的兴起,他们觉得分别针对训练和推理做专门的芯片优化,对整个技术生态更有好处。

现在,AI推理速度已经成了大厂之间博弈的重点。今年3月,英伟达大力宣传了一款新芯片,能让模型快速回应用户提问,这主要得益于他们花200亿美元收购芯片初创公司Groq时拿到的技术。在这种背景下,Google虽然还是英伟达的大客户,但同时也在通过向云服务企业提供TPU,打造另一种算力方案。

其实,科技巨头自己造芯片、做算力自主,已经成了行业共识。通过底层架构的深度定制,企业能最大程度提升特定应用场景的运行效率。比如苹果多年来在iPhone里集成的神经网络引擎,微软今年1月迭代的第二代AI芯片,还有Meta最近被曝正和博通联手研发多款AI处理器,都是这个趋势的体现。

在这轮造芯热潮里,Google算是先行者。他们从2015年就开始部署自研AI处理器,并从2018年起通过云平台把算力开放给外部客户。相比之下,亚马逊AWS是在2018年和2020年分别推出了专门做推理的Inferentia芯片和专门做训练的Trainium处理器。

投资银行D.A. Davidson在去年9月的一份报告里预估,Google的TPU业务加上DeepMind AI部门,合并估值大约9000亿美元。

目前英伟达在AI算力市场还是绝对的主导者。Google这次发布没有直接对标英伟达的产品,但公开了自己的性能迭代数据:在成本相同的情况下,新款训练芯片的性能是去年11月发布的第七代TPU(代号Ironwood)的2.8倍,新款推理芯片的性能提升了80%。

另外值得一提的是,业界在技术路线上不约而同地开始押注静态随机存取存储器(SRAM)。不管是英伟达即将推出的Groq 3 LPU,还是本月刚提交IPO申请的AI芯片独角兽Cerebras,都很依赖这项技术。Google这次推出的新款推理芯片TPU 8i也跟上了一趋势,单颗芯片的SRAM容量达到384MB,是上一代Ironwood的三倍。

Alphabet首席执行官桑达尔·皮查伊在博文里说,新架构的设计目标是把吞吐量做大、延迟做低,从而以很高的成本效益支持数百万个AI智能体同时运行。

在终端应用方面,Google透露说,他们的AI芯片正在扩大商业化落地。比如做市商城堡证券已经基于TPU开发量化研究软件;美国能源部下面的17个国家实验室也正在全面部署基于这款芯片的“AI协同科学家”系统。另外AI初创公司Anthropic也承诺会调用规模达到数吉瓦的Google TPU算力资源。