TL;DR: 谷歌将其TPU与流行的vLLM引擎集成,标志着对GPU在AI领域主导地位的一次新的、严峻的挑战。AI推理硬件市场的这一转变意味着,企业必须制定拥抱硬件多样性的战略,以优化成本和性能。
我们身在何处
过去几年,企业AI基础设施的故事几乎只有一个主题色:英伟达绿。在该公司成熟的CUDA软件生态系统支持下,其GPU已成为训练和推理领域事实上的标准。这种主导地位构筑了一条强大的护城河,让竞争对手难以立足。然而,谷歌云最近的一项声明预示着这块铁板上出现了一道明显的裂缝。在其开发者博客的一篇文章中,谷歌详细介绍了其专用TPU加速器与流行的开源服务引擎vLLM的原生集成。通过在谷歌Kubernetes引擎(GKE)上开源部署方案,谷歌极大地降低了开发者使用其强大、专用芯片的门槛,以应对最关键的企业AI工作负载之一:用于检索增强生成(RAG)和语义搜索的高性能嵌入。这不仅仅是一次技术更新,更是在未来AI推理硬件之战中打响的战略性第一枪。
幕后推手
谷歌此举的时机并非偶然。几股强大的力量正在汇合,为GPU单一文化之外的替代方案创造了机会。首先也是最明显的是稀缺性经济学。对高端GPU的飙升需求导致了供应限制和高昂定价,迫使企业寻求更具成本效益的规模化模型运行方案。正如我们之前指出的,优化长上下文LLM服务是新的竞争护城河,而底层硬件成本是这个等式中的一个主要组成部分。
其次,企业AI价值的重心正从训练转向推理。虽然训练大型基础模型是一项艰巨的任务,但日常的商业价值来自于高效、重复地运行这些模型。这使得针对推理优化的硬件变得至关重要,而像谷歌TPU这样的专用芯片在特定任务上可以提供显著的性价比优势。最后,像vLLM这样的开源工具日趋成熟,正在创建一个抽象层,将应用程序与底层硬件解耦。正如TechCrunch所报道的,这些引擎使开发人员更容易在不同的硬件后端之间切换,减少了供应商锁定,使硬件选择成为基于性能和成本的务实决策,而不是对单一软件生态系统的长期承诺。
未来情景
随着AI推理硬件市场的演变,我们预见未来18-24个月内可能出现三种情景。
情景一:双头垄断。 在这种基本情况下,谷歌成功地在特定、高流量的工作负载(如其TPU擅长的RAG和语义搜索)上,占据了推理市场的重要份额。这与英伟达形成了竞争性的双头垄断,为企业提供了有意义的选择,并带来了降价压力。大多数大型组织将根据性能基准,混合运行GPU和TPU工作负载。
情景二:加速碎片化。 谷歌的成功鼓舞了其他主要云服务提供商。亚马逊云服务(AWS)和微软Azure加速了其自研芯片(分别为Inferentia/Trainium和Maia)与流行的开源服务引擎的集成。市场碎片化为一个多极格局,其中工作负载的可移植性和复杂的编排能力变得至关重要。这提供了最大的选择自由度,但也增加了企业MLOps团队的运营复杂性。
情景三:英伟达的固守。 面对可信的威胁,英伟达利用其庞大的规模和深厚的软件生态系统来捍卫其地位。它可能会通过激进的定价、增强其TensorRT-LLM推理软件的性能,以及建立合作伙伴关系来应对,使得GPU在更广泛的工作负载中“足够好”且更方便,从而减缓专用替代品的采用速度。
值得关注的动向
为了判断哪种情景正在成为现实,企业领导者应关注几个关键信号。最重要的是公开的采用指标或企业通过vLLM在TPU上运行生产推理的主要案例研究。其次,在未来两个季度密切关注英伟达的产品和定价公告;有针对性的回应将表明他们视此为严重威胁。最后,留意AWS和Azure发布的类似开源集成公告。他们的行动——或不行动——将预示市场是正在巩固为双头垄断,还是会进一步碎片化。
我们的观点
我们认为,AI推理硬件由单一供应商主导的时代即将结束。虽然英伟达仍将是一股强大的力量,但寻求替代方案的经济和技术压力已不容忽视。我们认为“双头垄断”情景是最有可能的近期结果,而“加速碎片化”则是长期来看的一个很大可能性。对企业而言,战略要务非常明确:不要将您的AI技术栈建立在单一硬件基础的假设之上。相反,应专注于构建抽象层,并投资于强大的基准测试能力,以评估不同硬件选项针对您特定工作负载的性能和成本。这需要对您的底层基础设施采取前瞻性的方法,这也是我们数据平台与AI就绪度方法论的核心原则。企业AI的未来是多供应商和性能驱动的,今天就为这一现实做好准备的组织,将在明天获得显著的竞争优势。
