術語

下列條款適用於 AI Hypercomputer。

加速器
專用硬體裝置,例如 GPU 或 TPU,專門用於執行特定工作,例如機器學習工作負載,效率比一般用途的處理器更高。

封鎖
:一組互連的子區塊。在模塊中,任何 GPU 都能透過網路架構觸及,確保分散式訓練工作享有超低延遲的通訊。

叢集
透過高速結構互連的區塊集合。無阻斷的東向/西向網路架構可讓您在數千個 GPU 上大規模擴充訓練作業,不會遇到效能或頻寬瓶頸。

叢集 GPU
GPU 機器家族類別,包括 A4X、A4、A3 Ultra、A3 Mega 和 A3 High (8 個 GPU)。透過叢集式 GPU,團隊可使用專用網路結構和同步維護作業,以單一緊密耦合系統的形式,部署及擴充數千個互連加速器。這個系列適用於需要極高運算量、記憶體和高速網路同步的工作負載。常見用途包括預先訓練數兆參數的基礎模型、提供前沿模型,以及模擬藥物研發。

緊急維護
有時也稱為「緊急維護」。因重大硬體、軟體或安全性問題而臨時進行的維護作業。對於支援的加速器機型,緊急維護作業會提前通知,而不是立即中斷。這項通知可讓您有時間安全排空工作負載,並視需要觸發修復作業,以免系統終止 VM。

一般 GPU
GPU 機器家族類別,包括 G2、G4、A2、N1+T4 和 A3 Edge。團隊可完全自主地部署及調度 NVIDIA 加速器,不必費心處理協調式超級運算叢集的架構複雜性。這個系列非常適合優先考量高可用性、自助式佈建和獨立調整資源配置的工作負載。常見用途包括即時推論、RAG、原型設計,以及中小型模型訓練。

網路架構
網路架構可在叢集中的所有區塊和 Google Cloud 服務之間,提供高頻寬、低延遲的連線。Jupiter 是 Google 的資料中心網路架構,採用軟體定義網路和光路交換器,可演進網路並提升效能。

節點或主機
資料中心內的單一實體伺服器機器。每個主機都有相關聯的運算資源,例如加速器。這些運算資源的數量和設定取決於機器家族。Compute Engine 執行個體是在實體主機上佈建。

NVLink 網域 (也稱為子區塊) 是 A4X Max 和 A4X 機器的容量核心單元。NVLink 網域由 18 個 A4X Max 或 A4X 執行個體 (72 個 GPU) 組成,並透過多節點 NVLink 系統連線。

子區塊
一組主機和相關聯的連線硬體,位於單一實體機架上。在 A4X Max 和 A4X 機器的脈絡中,子模塊也稱為 NVLink 網域。

超級區塊
資料中心內互連機器的實體分組。將機器放置在超級區塊內,即可達到執行緊耦合訓練工作負載所需的極高網路處理量和毫秒以下延遲時間。

更多資訊

下列文件進一步說明與對應主題相關的術語: