Questo documento spiega come pianificare e progettare le istanze o i cluster GPU richiedendo a Compute Advisor, un'interfaccia basata sull'AI e su Gemini. Per saperne di più sui componenti da configurare prima o durante la creazione di un cluster, consulta Pianificare e creare l'infrastruttura AI.
Compute Advisor ti aiuta a valutare le opzioni hardware, stimare i costi di deployment e visualizzare le configurazioni consigliate per i tuoi cluster. Per personalizzare i suggerimenti, Compute Advisor valuta il tuo Google Cloud progetto controllando i limiti di quota, le prenotazioni esistenti, gli sconti per impegno di utilizzo (CUD), la regione e la zona predefinite, e qualsiasi vincolo di località delle risorse. Utilizzando Compute Advisor per la pianificazione, puoi raggiungere una configurazione ottimale per il tuo carico di lavoro prima di creare o modificare un cluster.
Limitazioni
Quando richiedi a Compute Advisor nella Google Cloud console, non puoi creare, modificare o eliminare direttamente le risorse.
Prima di iniziare
Quando utilizzi la Google Cloud console per accedere a Google Cloud servizi e API, non devi configurare l'autenticazione.
Ruoli obbligatori
Per ottenere le autorizzazioni necessarie per accedere a Gemini e richiederlo, chiedi all'amministratore di concederti il ruolo IAM Visualizzatore di Cluster Director (roles/hypercomputecluster.viewer) nel progetto.
Per saperne di più sulla concessione dei ruoli, consulta Gestisci l'accesso a progetti, cartelle e organizzazioni.
Questo ruolo predefinito include le autorizzazioni necessarie per accedere a Gemini e richiederlo. Per vedere quali sono esattamente le autorizzazioni richieste, espandi la sezione Autorizzazioni obbligatorie:
Autorizzazioni obbligatorie
Per accedere a Gemini e richiederlo sono necessarie le seguenti autorizzazioni:
-
Per visualizzare un elenco di cluster:
hypercomputecluster.clusters.list
Potresti anche ottenere queste autorizzazioni con ruoli personalizzati o altri ruoli predefiniti.
Accedere a Compute Advisor nella Google Cloud console
Per accedere a Compute Advisor nella Google Cloud console, completa i seguenti passaggi:
Nella Google Cloud console, vai alla pagina Compute Advisor.
Quando la pagina è pronta, puoi visualizzare quanto segue:
Gli elementi dell'interfaccia utente visualizzati nello screenshot precedente sono i seguenti:
Riquadro laterale della cronologia delle conversazioni: mostra le chat recenti. Puoi interagire con questo riquadro nel seguente modo:
Per avviare una nuova conversazione, fai clic su Nuova chat.
Per riprendere una conversazione recente, fai clic sulla conversazione nella sezione Chat recenti.
Per visualizzare un elenco di tutte le conversazioni, fai clic su Visualizza tutto. Nella pagina La mia cronologia puoi visualizzare i dettagli di una conversazione passata e riprenderla oppure eliminare le conversazioni se non ti servono più.
Schede dei prompt di azione rapida: un insieme di schede che contengono ciascuna un prompt di esempio. Se fai clic su una scheda, la Google Cloud console compila automaticamente la casella del prompt con il prompt di esempio.
Casella del prompt: questo campo ti consente di inserire e inviare i prompt. Per inviare un prompt, fai clic su Invia prompt.
Richiedere a Compute Advisor
Dopo aver inviato un prompt, Compute Advisor inizia a generare una risposta. Viene visualizzato un riquadro e Google Cloud la console mostra la risposta a il prompt nel riquadro, come mostrato nello screenshot seguente:
In base al prompt, il riquadro della risposta include i seguenti elementi:
Grounding contestuale: Compute Advisor valuta automaticamente il contesto del progetto per fornire suggerimenti altamente personalizzati, inclusi limiti di quota, prenotazioni esistenti, CUD, regione e zona predefinite e qualsiasi vincolo di località delle risorse.
Snippet di codice interattivi: Compute Advisor genera comandi gcloud, metodi API REST o risorse Terraform. Puoi copiare e incollare questi snippet di codice o eseguirli in Cloud Shell.
Canvas visivo: Compute Advisor organizza i suggerimenti in tabelle strutturate e confronti affiancati. Questa visualizzazione ti aiuta a valutare le funzionalità del prodotto e gli approcci architetturali. Fornisce anche un piano di implementazione per il tuo caso d'uso.
Le sezioni seguenti descrivono le best practice per la scrittura dei prompt e i prompt di esempio che puoi utilizzare prima di creare o modificare un cluster.
Best practice per i prompt
Per ottenere i suggerimenti più accurati e utili da Compute Advisor, ti consigliamo di strutturare i prompt nello stesso modo in cui faresti con un blocco di codice. Questo approccio guida l'AI generativa utilizzando dichiarazioni di parametri chiare, definizioni di ruoli, istruzioni specifiche e formati di output espliciti.
Quando richiedi a Compute Advisor, tieni conto delle seguenti best practice:
Concentrati sulla progettazione e sulla pianificazione: ti consigliamo di non richiedere a Compute Advisor di risolvere gli errori del cluster. Per risolvere questi errori, consulta invece Risolvere i problemi di creazione, aggiornamento ed eliminazione delle istanze di computing.
Specifica un utente tipo o un ruolo: dichiara un ruolo o un utente tipo di destinazione, ad esempio un amministratore IT, un ricercatore di AI o un ingegnere di piattaforma, che Compute Advisor deve adottare. Questo approccio guida il tono, la profondità e il livello di competenza dei suggerimenti risultanti.
Fornisci istruzioni esplicite e numerate: suddivide il tuo obiettivo in domande o attività concrete e passo-passo. Questo approccio struttura il processo di ragionamento di Compute Advisor e contribuisce a garantire che Compute Advisor soddisfi tutti i tuoi requisiti.
Definisci un formato di output specifico: indica esplicitamente il formato in cui vuoi che venga formattata la raccomandazione, ad esempio una spiegazione dettagliata, una tabella di confronto Markdown o un blocco di codice gcloud pronto all'uso.
Sfrutta il grounding contestuale automatico: non devi includere nel prompt la regione o la zona predefinita, le quote disponibili, i CUD o i vincoli di località delle risorse. Compute Advisor può accedere a queste informazioni nel tuo Google Cloud progetto.
Perfeziona in modo iterativo i tuoi progetti: puoi modificare o espandere la risposta generata da Compute Advisor inviando nuovi prompt. Ad esempio, puoi chiedere all'assistente di aggiungere suggerimenti di networking al piano di deployment o di modificare i requisiti di archiviazione senza avviare una nuova conversazione.
Prompt di esempio
Di seguito sono riportati alcuni esempi di prompt che puoi utilizzare per progettare e ottimizzare il cluster:
Topologia del cluster e strategia di posizionamento: per determinare il modello di deployment e la policy di posizionamento ottimali per un carico di lavoro AI ad alte prestazioni, utilizza un prompt come il seguente:
Act as an AI researcher. I need to design a GPU cluster topology in Cluster Director to train a foundation large language model that maximizes ML goodput and secures accelerator capacity. Please provide the following: 1. A comparison of clustered GPU machine series across available regions. 2. An explanation of how compact placement policies and workload policies reduce network latency and boost goodput. 3. The optimal configuration for future reservations in AI Hypercomputer to secure capacity for this workload. Format the comparison as a Markdown table, and provide the deployment steps as a ready-to-use gcloud code block.Modello di provisioning e ottimizzazione dei costi: per valutare i modelli di provisioning e ridurre i costi di elaborazione batch, utilizza un prompt come il seguente:
Act as an IT administrator. I need to select the most cost-effective consumption option to run large fault-tolerant AI batch jobs on clusters in Cluster Director without data loss. Please provide the following: 1. A cost and availability comparison of Flex-start VMs against Spot VMs for AI workloads. 2. An explanation of how atomic allocation in Flex-start VMs provisions all accelerator nodes at the exact same time. 3. A cluster configuration with checkpoint storage to save model state before Compute Engine reclaims a Spot VM. Format the comparison as a Markdown table, and provide the configuration steps to complete in the Google Cloud console.
Passaggi successivi
Per esaminare come ottenere capacità e quota in AI Hypercomputer, consulta la panoramica della capacità.
Per confrontare le opzioni dell'acceleratore e selezionare la serie di GPU giusta, consulta Scegliere tra GPU generiche e GPU in cluster.
Per selezionare gli strumenti e creare il cluster, consulta la panoramica delle opzioni di deployment.