SemiAnalysis:谷歌TPU殺入英偉達腹地,Ironwood每美元性能最高領先B200 50%

華爾街見聞
09/08

谷歌自研芯片TPU正加速走出內部圍牆,向外部客戶開放。

半導體研究機構SemiAnalysis發布首份針對TPUv7 Ironwood的第三方推理測試結果,顯示在同等條件對比下,Ironwood在每美元性能指標上最高領先英偉達B200和B300達50%,標誌着谷歌在AI推理芯片市場的競爭格局中正式發起衝擊。

SemiAnalysis的測試數據顯示,在每用戶每秒100個token的交互速度下,Ironwood每百萬token推理成本約為0.181美元,低於B200的0.222美元和B300的0.276美元,分別便宜約19%和34%。

在更高併發場景下,若採用谷歌內部總擁有成本(TCO)計算,Ironwood相對B200的每美元性能優勢可擴大至76.7%,相對B300則達130.2%。與此同時,谷歌正全力推進名為TorchTPU的新一代原生PyTorch後端,預計於10月開源,以取代此前存在諸多侷限的TorchAX方案,進一步降低外部開發者使用TPU的門檻。

這一進展對英偉達的市場地位構成直接挑戰。Anthropic已承諾採購逾百萬顆TPU,成為谷歌TPU最大外部用戶,預計到2029年其TPU使用量將超過DeepMind自身。SemiAnalysis認為,隨着分離式預填充/解碼(PD Disaggregation)、投機解碼等關鍵優化陸續落地,TPUv7的競爭力將進一步提升,並有望在全性能曲線上與英偉達GB200/GB300 NVL72形成正面競爭。

每美元性能:Ironwood在多數場景領先Blackwell

SemiAnalysis的測試以Qwen3.5 397B FP8模型為基準,在聚合服務(Aggregated Serving)模式下對TPUv7 Ironwood與英偉達B200、B300進行了逐項對比。

在低併發、高交互性場景下,Ironwood的成本優勢最為突出。在每秒20個token/用戶的交互速度下,Ironwood每芯片總吞吐量達9,364 token/秒,高於B200的8,903和B300的8,925,吞吐量領先約5%。結合更低的每小時芯片成本,Ironwood每美元可產出的token數量比B200高出50.4%,比B300高出96.0%。

在端到端延遲維度,Ironwood同樣保持競爭力。在20秒中位響應時間下,Ironwood每百萬token成本約為0.098美元,低於B200的0.106美元和B300的0.132美元,分別便宜約8%和25%。

不過,測試結果並非全面領先。在約30秒中位響應時間附近的局部區間,B200在每美元性能上仍可超越Ironwood。此外,當英偉達GPU採用FP4精度時,由於Ironwood尚不支持原生FP4計算,英偉達在該精度下仍保持優勢——這一差距預計將在下一代TPUv8i中彌補,後者將具備原生FP4加速能力。

在"非同等對比"場景下,即GB300 NVL72採用分離式服務、TPUv7仍使用聚合服務時,GB300在中等端到端延遲區間具備約30%的每美元性能優勢。SemiAnalysis認為,一旦TPUv7的分離式服務優化完成,這一差距將消除。

TorchTPU:構建原生PyTorch生態,取代TorchAX

谷歌TPU外部化的核心瓶頸長期在於軟件棧。此前,外部開發者需通過TorchAX將PyTorch模型轉譯為JAX執行,這一路徑在低級優化、分頁注意力機制以及與vLLM工作模型的適配上存在諸多問題。

新一代TorchTPU方案通過PyTorch的PrivateUse1後端擴展點,將TPU直接暴露為原生PyTorch設備(device="tpu"),開發者可使用.to("tpu")調用,並保留熟悉的分佈式接口(包括DDP、FSDP2、DTensor等)。編譯路徑上,TorchDynamo和AOTAutograd生成FX計算圖,TorchTPU將其降低為StableHLO,再由XLA生成TPU可執行代碼,底層Pallas內核仍負責性能關鍵操作。

這一架構變化的實際意義在於:vLLM和SGLang可以複用更多上游模型代碼、調度器和API邏輯,而無需跨越PyTorch到JAX的框架邊界重新構建。SemiAnalysis指出,Inferact、RadixArk和Red Hat均在與谷歌合作,推動TorchTPU成為vLLM和SGLang的一級支持後端。

目前,TorchTPU仍處於私有測試階段,預計於10月PyTorch大會期間開源。谷歌計劃在Qwen3.5 397B完成初步適配後,進一步支持Kimi K3、GLM5.3以及谷歌自有開源模型Gemma4。SemiAnalysis預計,一旦少數模型完成優化,新增模型支持的邊際成本將大幅下降,TPU有望進入vLLM和SGLang的"Day 0"支持名單。

內核優化:數百工時換來的吞吐量提升

為支撐上述性能數據,谷歌工程團隊對TPU推理內核進行了大量針對性優化,涵蓋注意力機制、MoE路由、混合模型狀態管理等多個層面。

在注意力並行方面,針對Qwen3.5的GQA層(32個查詢頭、僅2個KV頭)的不均勻分佈問題,TPU後端新增了8路注意力數據並行(DP8)與8路專家並行(EP8)的組合支持,避免了不必要的All-to-All通信開銷。

在通信優化方面,谷歌將專家ID和路由權重合併為單次All-Gather操作,在DeepSeek-V3測試中每層節省約80微秒;跨58層累計可節省約4.64毫秒每次前向傳播。此外,ReduceScatter集合操作被遷移至SparseCore執行,並結合雙緩衝技術實現計算與通信的流水線重疊,在8k1k工作負載下,併發64至512的吞吐量提升幅度為4.1%至14.2%。

在MoE路由內核方面,通過將token的不規則重排移至SparseCore處理、對專家權重實施三重緩衝、以及針對小批量場景引入獨立排列路徑,8k1k服務吞吐量在併發64時提升7.3%,在併發128時提升5.1%。

在混合模型狀態管理方面,將循環狀態(Recurrent State)存儲精度從FP32降至BF16,在保持VMEM內FP32算術精度的同時,將HBM佔用減半,1k8k吞吐量在併發512時提升15%。通過優化KV緩存頁面佈局(序列維度置於128-lane軸),可用KV頁面數量從5,141增至10,283,在併發128的8k1k測試中吞吐量提升16.5%,中位TTFT下降95%。

Ironwood硬件架構:協同設計驅動成本優勢

SemiAnalysis認為,谷歌在推理成本上的優勢根源在於芯片、互聯網絡與編譯器的協同設計,而非單純的單芯片算力堆疊。

TPUv7 Ironwood打破了TPU v4和v5p時代的"MegaCore"設計慣例,改為在單顆芯片上集成兩個獨立計算裸片,通過高帶寬裸片間鏈路連接,JAX等框架將其暴露為兩個獨立邏輯設備。每顆芯片配備2個TensorCore和4個第三代SparseCore,HBM容量約為上一代Trillium的6倍,並首次引入原生FP8硬件支持。

矩陣乘法單元(MXU)方面,Ironwood採用256×256的脈動陣列,每周期可執行65,536次乘加運算,是此前128×128設計的4倍。但這也帶來了對模型形狀的嚴格要求:矩陣維度需填充至256的倍數,否則將造成MXU利用率損失。以Llama 3 8B為例,其注意力頭維度為128,在Ironwood上兩個注意力矩陣乘法的MXU利用率上限僅為50%。

在芯片互聯方面,Ironwood延續了3D環形拓撲(3D Torus),基本構建單元為64顆芯片組成的4×4×4立方體,通過光學電路交換機(OCS)可擴展至9,216顆芯片的超級Pod,總算力達42.5 FP8 exaflops。ICI網絡繞過主機CPU,支持芯片間直接交換激活值和梯度,在整個Pod範圍內提供接近NVLink級別的帶寬。

前瞻:TPUv8i與軟件路線圖

谷歌新發布的第八代TPU首次將訓練與推理拆分為兩款獨立芯片:TPU 8t面向訓練,TPU 8i面向推理。

TPUv8i(代號Boardfly)以高基數交換機構成的扁平化層次網絡取代3D環形拓撲,在1,024至1,152顆芯片規模下,網絡直徑從約16跳降至約7跳,降幅超過50%,有助於降低MoE路由和多輪智能體工作負載中的尾延遲。TPUv8i還配備19.2 Tb/s的ICI帶寬(較上一代翻倍)和384 MB片上SRAM(較上一代增加3倍),專為在片上緩存推理和智能體模型的KV緩存而設計。此外,TPUv8i將支持原生FP4計算,SemiAnalysis認為其有望與英偉達Rubin NVL72形成正面競爭。

在軟件路線圖方面,谷歌當前優先推進的外部化工作包括:投機解碼(Speculative Decoding/MTP)優化、預填充-解碼分離式服務(PD Disaggregation)、KV緩存DRAM卸載,以及對多輪智能體工作負載(AgentX)的支持。谷歌已開源TPU-Sync(原TPU-raiden)KV緩存傳輸庫,並計劃支持業界標準的Mooncake Store卸載方案。

SemiAnalysis總結認為,與AMD相比,谷歌擁有數十年軟件工程積累和成熟的質量驅動文化,預計外部TPU軟件棧的成熟速度將顯著快於競爭對手。"羅馬不是一天建成的,但TPU外部化正在以極快的速度推進。"

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10