AI Hypercomputer 是整合式超級運算系統,經過最佳化調整,可支援人工智慧 (AI) 和機器學習 (ML) 工作負載。這是 Google Cloud的 AI 基礎架構統一產品組合,提供單一入口點,可供探索、設定及部署效能最佳化硬體、開放式軟體和彈性計費模式。
AI Hypercomputer 採用系統層級設計和最佳做法,可提升整個 AI 開發生命週期的效率,包括原型設計、開發、大規模訓練和即時服務。
系統架構
AI Hypercomputer 垂直整合這三項元件,盡可能提高有效輸送量,也就是實際機器學習生產力的指標:
- 效能最佳化基礎架構:提供加速器 (NVIDIA GPU
和 Google Cloud TPU)、網路和儲存空間資源。
- GPU:依系統處理生命週期事件和維護的方式分類:
- 一般 GPU:基礎架構會以獨立運算單元的形式管理,並進行非同步維護。
- 叢集 GPU:高效能叢集會以單一緊密耦合系統的形式管理,並同步維護。
- TPU:使用專為執行大型矩陣運算設計的硬體,並具備晶片內高頻寬記憶體 (HBM),適用於較大型的模型和批次大小。TPU 可以連線至稱為「切片」的群組,在幾乎不用變更程式碼的情況下,擴大工作負載。如要瞭解 TPU 基礎架構,請參閱 Cloud TPU 說明文件。
- GPU:依系統處理生命週期事件和維護的方式分類:
- 開放式軟體:提供機器學習架構 (PyTorch、JAX 和 TensorFlow) 和自動化調度管理平台的最佳化版本。如要部署及管理加速器,您可以選擇下列選項:
- Google Kubernetes Engine,可自動調度容器原生資源
- 透過 Cluster Director 使用 Slurm
- Cluster Toolkit 藍圖
- 用量選項:根據工作負載需求提供彈性佈建選項:
- 彈性啟動 VM、Spot VM 和預訂:為不同工作負載提供彈性選項。
- Dynamic Workload Scheduler: 為大規模訓練提供相互連結節點的完整區塊, 並以原子方式佈建。
優點
- 高效能和有效處理量:最佳化排程和執行階段層,盡量提高有效處理量,讓加速器將更多時間用於生產力運算,減少系統負荷。
- 整合式可靠性:存取專門的可靠性功能:
- 叢集式 GPU:包括自動化硬體健康狀態監控和主動節點更換。
- 一般 GPU:使用標準Google Cloud 節點自動修復功能,維持服務車隊的 Pod 層級正常運作時間。
- 最佳化儲存空間:使用高處理量儲存服務,例如 Google Cloud Managed Lustre 和 Cloud Storage Rapid,消除 I/O 瓶頸。
用途
AI Hypercomputer 可滿足下列用途的需求:
| 用途 | 工作負載範例 |
|---|---|
| 大規模 AI 和機器學習工作負載 |
|
| 推論和提供模型 |
|
| 原型設計與開發 |
|