Scegliere l'infrastruttura dell'acceleratore

Utilizza questo documento per identificare l'infrastruttura di accelerazione ottimale per i workload di intelligenza artificiale (AI) e machine learning (ML) in base alla fase del ciclo di vita, ad esempio prototipazione su piccola scala, inferenza in tempo reale e addestramento distribuito su larga scala. AI Hypercomputer organizza le offerte di acceleratori in due categorie: GPU generali e GPU in cluster.

Infrastruttura GPU

AI Hypercomputer offre due categorie distinte di GPU. Ogni categoria ha un modello di gestione distinto che determina il modo in cui il sistema gestisce gli eventi del ciclo di vita, gestisce la manutenzione e ottimizza il networking per il tuo workload:

Modello di gestione delle GPU generali

Il modello di gestione delle GPU generali è progettato per i workload che danno la priorità all'indipendenza delle risorse e all'alta affidabilità. Questo modello utilizza il piano di gestione standard Google Cloud , fornendo un'esperienza familiare ai team che utilizzano già Compute Engine o GKE.

  • Manutenzione: asincrona. Le singole istanze vengono aggiornate in modo indipendente. In un parco risorse di pubblicazione multi-nodo, un evento di manutenzione su un nodo non influisce sulla disponibilità degli altri, consentendo di reindirizzare il traffico ai nodi integri senza bloccare l'intero job.

  • Casi d'uso principali: consigliato per attività mainstream come inferenza in tempo reale, erogazione del modello, prototipazione su piccola scala e ambienti di sviluppo in cui non è richiesta la scala di supercomputing.

Serie di macchine GPU generali

Le seguenti serie di macchine sono GPU generali:

  • G2 (L4)
  • G4 (RTX PRO 6000)
  • A2 (A100)
  • NT1+T4
  • A3 Edge
  • A3 High (1, 2 o 4 GPU)

Per informazioni tecniche su ciascuna delle macchine GPU generali, vedi Tipi di macchine GPU.

Modello di gestione delle GPU in cluster

Il modello di gestione delle GPU in cluster è un ambiente di classe supercomputing progettato per l'addestramento distribuito su larga scala. Le risorse vengono gestite come un unico sistema strettamente accoppiato utilizzando uno stack di GPU in cluster.

  • Manutenzione: coordinata. Questo modello coordina gli eventi di manutenzione per supportare i workload strettamente accoppiati. Per l'addestramento distribuito, puoi utilizzare la manutenzione sincronizzata, in cui gli aggiornamenti vengono applicati contemporaneamente a tutti i nodi. Questo approccio impedisce il riavvio dei nodi che bloccano i job e massimizza il goodput. Questo modello offre anche notifiche di manutenzione di 90 giorni.

  • Casi d'uso principali: progettato per l'addestramento di modelli di base exascale con trilioni di parametri o per l'esecuzione di simulazioni complesse di computing ad alte prestazioni (HPC), come la scoperta di farmaci e il ripiegamento delle proteine.

Serie di macchine GPU in cluster

Le seguenti serie di macchine sono GPU in cluster:

  • A4X
  • A4 (Blackwell)
  • A3 Ultra
  • A3 Mega
  • A3 High (8 GPU)

Per informazioni tecniche su ciascuna delle macchine GPU in cluster, vedi Tipi di macchine GPU.

Matrice delle funzionalità

Confronta le caratteristiche tecniche e operative dei modelli di gestione delle GPU generali e delle GPU in cluster:

Caratteristica Modello di gestione delle GPU generali Modello di gestione delle GPU in cluster
Casi d'uso principali Inferenza, erogazione del modello, prototipazione e sviluppo Addestramento distribuito su larga scala e HPC
Manutenzione Asincrona: gli aggiornamenti dei nodi indipendenti consentono di reindirizzare il traffico senza bloccare i job Coordinata: supporta gli aggiornamenti coordinati (sincronizzati) a livello di cluster per mantenere sincronizzati i nodi e massimizzare il goodput
Hardware di destinazione G2 (L4), G4 (RTX PRO 6000), A2 (A100), NT1+T4, A3 Edge e A3 High (1, 2 o 4 GPU) A4X, A4 (Blackwell), A3 Ultra, A3 Mega e A3 High (8 GPU)
Networking Networking VPC standard tramite interfacce gVNIC (ad eccezione di A3 Edge, che utilizza GPUDirect-TCPX su più VPC) Strutture specializzate a bassa latenza (RDMA, RoCE, TCPX o NVIDIA NVLink)
Stack di gestione Piano standard Google Cloud (Compute Engine o GKE) Stack di gestione specializzato (ad esempio, Cluster Director)
Affidabilità Riparazione automatica dei nodi standard e uptime a livello di pod Suite specializzata per risorse e ripristino

Matrice decisionale

Utilizza questa matrice per identificare le famiglie di hardware che si allineano all'intento specifico del tuo workload:

Se il tuo workload prevede... Infrastruttura GPU consigliata Serie di macchine consigliata
Prototipazione e sviluppo GPU generali G2, G4, A2, NT1+T4, A3 Edge
Inferenza in tempo reale (< 100 miliardi di parametri) GPU generali G2, G4, A2, NT1+T4, A3 Edge
Inferenza su più GPU GPU in cluster A3, A4
Addestramento e inferenza su larga scala GPU in cluster A4, A3
Addestramento su larga scala (> 500 miliardi di parametri) e inferenza disaggregata GPU in cluster A4X Max, A4X, A4

Per un albero decisionale dettagliato che mappa le architetture dei modelli direttamente all'hardware, vedi Scegliere un acceleratore.

Dopo aver stabilito questi criteri principali, scegli una piattaforma di orchestrazione. Questa scelta dipende dalla preferenza del tuo team per la gestione automatizzata o il controllo granulare del sistema operativo e dei driver.

Passaggi successivi