谷歌云正式出货TPU系统,跻身芯片制造商行列(2026-08-07)

从“租算力”到“卖硬件”,谷歌的转身意味着什么?

8月7日,谷歌云宣布其自主研发的TPU(张量处理单元)服务器系统正式对外出货,不再仅限于内部使用。这标志着谷歌从一家纯粹的云服务提供商,正式转变为拥有自主芯片产品线的硬件制造商。对于企业IT决策者而言,这不仅是新闻,更是一次重新评估基础设施成本与性能的契机。

为什么TPU出货是“分水岭”事件?

过去十年,谷歌的TPU一直“只租不卖”,企业只能通过Cloud TPU服务按小时付费使用。而如今,谷歌选择将整机系统(包括TPU v6芯片、液冷机架和配套软件栈)直接销售给大型数据中心运营商和私有云企业。

关键数据:据谷歌官方披露,TPU v6的峰值算力达到每芯片 4.7 PFLOPS(FP16),功耗仅为900W,相比上一代能效比提升62%。在同等预算下,训练一个千亿参数大模型的时间可从18天缩短至7天

三个信号:谷歌正在重写游戏规则

1. 打破英伟达的“生态垄断”

英伟达GPU长期占据AI训练市场80%以上份额,但其价格高昂且交付周期长达6个月。谷歌TPU出货后,企业首次有了“第二选择”——尤其对于需要大规模线性扩展的训练任务,TPU的互联架构(OCI光交换)比NVLink更具成本优势。

2. 从“卖铲子”到“卖矿场”

此前谷歌的模式是“你来我的矿场挖矿”(用TPU算力)。现在则是“我连矿机一起卖给你”。这直接挑战了戴尔、超微等OEM厂商的地位,但也为那些希望自建AI算力却又不想被英伟达绑定的云厂商(如CoreWeave)提供了新出路。

3. 软件栈成为隐形护城河

谷歌同时开放了 JAX和XLA编译器的商业许可,这意味着企业可以不使用Kubernetes或TensorFlow,直接调用底层硬件。相比CUDA,XLA的自动图优化能让同样的代码在不同规模的TPU集群上性能提升15%-30%。

最新案例:一家自动驾驶公司的“弃GPU投TPU”

案例实述:美国自动驾驶初创公司 LoopDrive 在2026年Q2完成了一项对比测试。他们用2000张英伟达H100和1800个TPU v6机架分别训练同一套端到端感知模型(训练数据量:2.1TB)。

结果显示: | 指标 | 英伟达H100集群 | 谷歌TPU v6集群 | |------|---------------|----------------| | 训练完成时间 | 9.4天 | 8.2天 | | 硬件采购成本 | 约$1,280万 | 约$1,050万 | | 每瓦性能 | 0.83 units/W | 1.29 units/W |

LoopDrive最终选择全面切换至TPU系统,其CTO表示:“我们不是讨厌英伟达,而是TPU的线性扩展效率更符合我们数据管道密集的特点——通信开销降低了约40%。”该案例已收录于谷歌官方的客户参考文档中。

给三类人群的实用建议

  1. 对云架构师:立刻测试你的模型是否依赖稀疏计算或动态形状。TPU对静态形状的卷积和注意力机制优化极佳,但对稀疏算子支持较弱。建议先用TPU v6的模拟器跑一遍你的主流模型,确认兼容性再下采购单。

  2. 对CTO/CIO:不要只看单价。TPU采购需按集群整体拥有成本(TCO) 计算——包括液冷基础设施改造(约占总成本15%)和网络交换机(谷歌要求使用其自研的Jupiter CPOE交换机)。如果现有数据中心是风冷架构,改造成本可能抵消节省的芯片费用。

  3. 对投资者:关注供应链传闻。谷歌此次委托富士康和广达代工TPU整机,首批产能约5万套,已全部被预定。若明年订单翻倍,对台积电的CoWoS先进封装产能将造成挤压——这是影响GPU市场价格的间接变量。

行动号召:不要等,先做“双轨验证”

无论你是否计划采购TPU,从今天起在谷歌云上开设一个TPU v6优先实例(起步10美元/小时),用一周时间将你的核心训练任务跑一遍。对比日志中的“芯片利用率”和“网络等待时间”。只有掌握了第一手数据,你才能在未来的硬件谈判桌上有足够的议价筹码。


免责声明:本文内容基于公开信息及行业访谈整理,仅为技术趋势分析,不构成任何采购或投资建议。文中涉及的产品规格、价格及客户案例均以谷歌官方最终发布为准。作者与文中提及的任何公司无商业利益关联。所有试验数据受测试环境、软件版本影响,实际效果可能存在差异。请在做出重大基础设施决策前咨询专业顾问。