AI 超級電腦總覽

AI Hypercomputer 是整合式超級運算系統,經過最佳化調整,可支援人工智慧 (AI) 和機器學習 (ML) 工作負載。這是 Google Cloud的 AI 基礎架構統一產品組合,提供單一入口點,可供探索、設定及部署效能最佳化硬體、開放式軟體和彈性計費模式。

AI Hypercomputer 採用系統層級設計和最佳做法,可提升整個 AI 開發生命週期的效率,包括原型設計、開發、大規模訓練和即時服務。

系統架構

AI Hypercomputer 垂直整合這三項元件,盡可能提高有效輸送量,也就是實際機器學習生產力的指標:

  • 效能最佳化基礎架構:提供加速器 (NVIDIA GPU 和 Google Cloud TPU)、網路和儲存空間資源。
    • GPU:依系統處理生命週期事件和維護的方式分類:
      • 一般 GPU:基礎架構會以獨立運算單元的形式管理,並進行非同步維護。
      • 叢集 GPU:高效能叢集會以單一緊密耦合系統的形式管理,並同步維護。
    • TPU:使用專為執行大型矩陣運算設計的硬體,並具備晶片內高頻寬記憶體 (HBM),適用於較大型的模型和批次大小。TPU 可以連線至稱為「切片」的群組,在幾乎不用變更程式碼的情況下,擴大工作負載。如要瞭解 TPU 基礎架構,請參閱 Cloud TPU 說明文件
  • 開放式軟體:提供機器學習架構 (PyTorch、JAX 和 TensorFlow) 和自動化調度管理平台的最佳化版本。如要部署及管理加速器,您可以選擇下列選項:
    • Google Kubernetes Engine,可自動調度容器原生資源
    • 透過 Cluster Director 使用 Slurm
    • Cluster Toolkit 藍圖
  • 用量選項:根據工作負載需求提供彈性佈建選項:
    • 彈性啟動 VMSpot VM預訂:為不同工作負載提供彈性選項。
    • Dynamic Workload Scheduler: 為大規模訓練提供相互連結節點的完整區塊, 並以原子方式佈建。

優點

  • 高效能和有效處理量:最佳化排程和執行階段層,盡量提高有效處理量,讓加速器將更多時間用於生產力運算,減少系統負荷。
  • 整合式可靠性:存取專門的可靠性功能:
    • 叢集式 GPU:包括自動化硬體健康狀態監控和主動節點更換。
    • 一般 GPU:使用標準Google Cloud 節點自動修復功能,維持服務車隊的 Pod 層級正常運作時間。
  • 最佳化儲存空間:使用高處理量儲存服務,例如 Google Cloud Managed Lustre 和 Cloud Storage Rapid,消除 I/O 瓶頸。

用途

AI Hypercomputer 可滿足下列用途的需求:

用途 工作負載範例
大規模 AI 和機器學習工作負載
  • 生成式 AI 的分散式訓練
  • 生成式 AI 推論
  • 詐欺偵測
  • 推薦模型
推論和提供模型
  • 即時偵測詐欺行為
  • 即時結果的推薦引擎
原型設計與開發
  • 小規模實驗
  • 早期開發階段

後續步驟