Gemini Enterprise Agent Platform fornisce un servizio di addestramento gestito che ti aiuta a rendere operativo l'addestramento di modelli su larga scala. Puoi utilizzare Gemini Enterprise Agent Platform per eseguire applicazioni di addestramento basate su qualsiasi framework di machine learning (ML) su Google Cloud infrastruttura. Per i seguenti framework ML più diffusi, Gemini Enterprise Agent Platform offre anche il supporto integrato che semplifica la procedura di preparazione per l'addestramento e la pubblicazione dei modelli:
Questa pagina spiega i vantaggi dell'addestramento serverless su Gemini Enterprise Agent Platform, il workflow coinvolto e le varie opzioni di addestramento disponibili.
Gemini Enterprise Agent Platform rende operativo l'addestramento su larga scala
Rendere operativo l'addestramento dei modelli comporta diverse sfide. Queste sfide includono il tempo e il costo necessari per addestrare i modelli, la profondità delle competenze richieste per gestire l'infrastruttura di calcolo e la necessità di fornire una sicurezza di livello aziendale. Gemini Enterprise Agent Platform affronta queste sfide fornendo al contempo una serie di altri vantaggi.
Infrastruttura di calcolo completamente gestita
|
|
L'addestramento dei modelli su Gemini Enterprise Agent Platform è un servizio completamente gestito che richiede l'amministrazione dell'infrastruttura fisica. Puoi addestrare i modelli ML senza dover eseguire il provisioning o gestire i server. Paghi solo per le risorse di calcolo che utilizzi. Gemini Enterprise Agent Platform gestisce anche la registrazione, l'accodamento e il monitoraggio dei job. |
Alte prestazioni
|
|
I job di addestramento di Gemini Enterprise Agent Platform sono ottimizzati per l'addestramento dei modelli ML, il che può fornire prestazioni più veloci rispetto all'esecuzione diretta dell'applicazione di addestramento su un cluster Google Kubernetes Engine (GKE). Puoi anche identificare ed eseguire il debug dei colli di bottiglia delle prestazioni nel job di addestramento utilizzando Cloud Profiler. |
Addestramento distribuito
|
|
Reduction Server è un algoritmo di riduzione totale in Gemini Enterprise Agent Platform che può aumentare la velocità effettiva e ridurre la latenza dell'addestramento distribuito multi-nodo sulle GPU (Graphics Processing Unit) NVIDIA. Questa ottimizzazione contribuisce a ridurre il tempo e il costo di completamento dei job di addestramento di grandi dimensioni. |
Ottimizzazione degli iperparametri
|
|
I job di ottimizzazione degli iperparametri eseguono più prove dell'applicazione di addestramento utilizzando valori di iperparametri diversi. Specifichi un intervallo di valori da testare e Gemini Enterprise Agent Platform rileva i valori ottimali per il modello all'interno di questo intervallo. |
Sicurezza aziendale
|
|
Gemini Enterprise Agent Platform fornisce le seguenti funzionalità di sicurezza aziendale:
|
Integrazioni delle operazioni di ML (MLOps)
|
|
Gemini Enterprise Agent Platform fornisce una suite di strumenti MLOps integrati e funzionalità che puoi utilizzare per i seguenti scopi:
|
Workflow per l'addestramento serverless
Il seguente diagramma mostra una panoramica di alto livello del workflow di addestramento serverless su Gemini Enterprise Agent Platform. Le sezioni che seguono descrivono ogni passaggio in dettaglio.

Caricare e preparare i dati di addestramento
Per prestazioni e supporto ottimali, utilizza uno dei seguenti Google Cloud servizi come origine dati:
- Cloud Storage
- BigQuery
- File system ad alte prestazioni, come le condivisioni NFS su Google Cloud utilizzando servizi come Google Cloud NetApp Volumes o Filestore.
Per un confronto tra questi servizi, consulta la panoramica della preparazione dei dati.
Puoi anche specificare un set di dati gestito da Gemini Enterprise Agent Platform come origine dati quando utilizzi una pipeline di addestramento per addestrare il modello. L'addestramento di un modello personalizzato e di un modello AutoML utilizzando lo stesso set di dati ti consente di confrontare le prestazioni dei due modelli.
Preparare l'applicazione di addestramento
Per preparare l'applicazione di addestramento per l'utilizzo su Gemini Enterprise Agent Platform:
- Implementa le best practice del codice di addestramento per Gemini Enterprise Agent Platform.
- Determina un tipo di immagine container da utilizzare.
- Pacchettizza l'applicazione di addestramento in un formato supportato in base al tipo di immagine container selezionato.
Implementare le best practice del codice di addestramento
L'applicazione di addestramento deve implementare le best practice del codice di addestramento per Gemini Enterprise Agent Platform. Queste best practice si riferiscono alla capacità dell'applicazione di addestramento di eseguire le seguenti operazioni:
- Accedere ai Google Cloud servizi.
- Caricare i dati di input.
- Attivare la registrazione automatica per il monitoraggio degli esperimenti.
- Esportare gli artefatti del modello.
- Utilizzare le variabili di ambiente di Gemini Enterprise Agent Platform.
- Garantire la resilienza ai riavvii delle VM.
Selezionare un tipo di container
Gemini Enterprise Agent Platform esegue l'applicazione di addestramento in un' immagine container Docker. Un'immagine container Docker è un pacchetto software autonomo che include codice e tutte le dipendenze, che può essere eseguito in quasi tutti gli ambienti di computing. Puoi specificare l'URI di un' immagine container predefinita da utilizzare oppure creare e caricare un' immagine container personalizzata con l'applicazione di addestramento e le dipendenze preinstallate.
La seguente tabella mostra le differenze tra le immagini container predefinite e quelle personalizzate:
| Specifiche | Immagini container predefinite | Immagini container personalizzate |
|---|---|---|
| Framework ML | Ogni immagine container è specifica per un framework ML. | Utilizza qualsiasi framework ML o non utilizzarne nessuno. |
| Versione framework ML | Ogni immagine container è specifica per una versione del framework ML. | Utilizza qualsiasi versione del framework ML, incluse le versioni secondarie e le build notturne. |
| Dipendenze dell'applicazione | Le dipendenze comuni per il framework ML sono preinstallate. Puoi specificare dipendenze aggiuntive da installare nell'applicazione di addestramento. | Preinstalla le dipendenze necessarie per l'applicazione di addestramento. |
| Formato di pubblicazione dell'applicazione |
|
Preinstalla l'applicazione di addestramento nell'immagine container personalizzata. |
| Impegno per la configurazione | Basso | Alto |
| Consigliati per | Applicazioni di addestramento Python basate su un framework ML e una versione del framework per cui è disponibile un'immagine container predefinita. |
|
Pacchettizzare l'applicazione di addestramento
Dopo aver determinato il tipo di immagine container da utilizzare, pacchettizza l'applicazione di addestramento in uno dei seguenti formati in base al tipo di immagine container:
Singolo file Python da utilizzare in un container predefinito
Scrivi l'applicazione di addestramento come un singolo file Python e utilizza l' SDK Agent Platform per Python per creare una
CustomJoboCustomTrainingJobclasse. Il file Python viene pacchettizzato in una distribuzione di origine Python e installato in un'immagine container predefinita. La pubblicazione dell'applicazione di addestramento come singolo file Python è adatta alla prototipazione. Per le applicazioni di addestramento di produzione, è probabile che l'applicazione di addestramento sia disposta in più file.Distribuzione di origine Python da utilizzare in un container predefinito
Pacchettizza l'applicazione di addestramento in una o più distribuzioni di origine Python e caricale in un bucket Cloud Storage. Gemini Enterprise Agent Platform installa le distribuzioni di origine in un'immagine container predefinita quando crei un job di addestramento.
Immagine container personalizzata
Crea la tua immagine container Docker con l'applicazione di addestramento e le dipendenze preinstallate e caricala in Artifact Registry. Se l'applicazione di addestramento è scritta in Python, puoi eseguire questi passaggi utilizzando un comando Google Cloud CLI.
Configurare il job di addestramento
Un job di addestramento di Gemini Enterprise Agent Platform esegue le seguenti attività:
- Esegue il provisioning di una (addestramento con un nodo singolo) o più (addestramento distribuito) macchine virtuali (VM).
- Esegue l'applicazione di addestramento containerizzata sulle VM di cui è stato eseguito il provisioning.
- Elimina le VM al termine del job di addestramento.
Gemini Enterprise Agent Platform offers tre tipi di job di addestramento per l'esecuzione dell'applicazione di addestramento:
-
Un job personalizzato (
CustomJob) esegue l'applicazione di addestramento. Se utilizzi un'immagine container predefinita, gli artefatti del modello vengono generati nel bucket Cloud Storage specificato. Per le immagini container personalizzate, l'applicazione di addestramento può anche generare artefatti del modello in altre posizioni. Job di ottimizzazione degli iperparametri
Un job di ottimizzazione degli iperparametri (
HyperparameterTuningJob) esegue più prove dell'applicazione di addestramento utilizzando valori di iperparametri diversi finché non produce artefatti del modello con i valori di iperparametri con prestazioni ottimali. Specifichi l'intervallo di valori di iperparametri da testare e le metriche da ottimizzare.-
Una pipeline di addestramento (
CustomTrainingJob) esegue un job personalizzato o un job di ottimizzazione degli iperparametri ed esporta facoltativamente gli artefatti del modello in Gemini Enterprise Agent Platform per creare una risorsa modello. Puoi specificare un set di dati gestito da Gemini Enterprise Agent Platform come origine dati.
Quando crei un job di addestramento, specifica le risorse di calcolo da utilizzare per eseguire l'applicazione di addestramento e configura le impostazioni del container.
Configurazioni di calcolo
Specifica le risorse di calcolo da utilizzare per un job di addestramento. Gemini Enterprise Agent Platform supporta l'addestramento con un nodo singolo, dove il job di addestramento viene eseguito su una VM, e l'addestramento distribuito, dove il job di addestramento viene eseguito su più VM.
Le risorse di calcolo che puoi specificare per il job di addestramento sono le seguenti:
Tipo di macchina VM
I diversi tipi di macchine offrono CPU, dimensioni della memoria e larghezza di banda diverse.
GPU (Graphics Processing Unit)
Puoi aggiungere una o più GPU alle VM di tipo A2 o N1. Se l'applicazione di addestramento è progettata per utilizzare le GPU, l'aggiunta di GPU può migliorare notevolmente le prestazioni.
TPU (Tensor Processing Unit)
Le TPU sono progettate specificamente per accelerare i carichi di lavoro di machine learning. Quando utilizzi una VM TPU per l'addestramento, puoi specificare un solo pool di worker. Questo pool di worker può avere una sola replica.
Dischi di avvio
Puoi utilizzare SSD (impostazione predefinita) o HDD per il disco di avvio. Se l'applicazione di addestramento legge e scrive sul disco, l'utilizzo di SSD può migliorare le prestazioni. Puoi anche specificare le dimensioni del disco di avvio in base alla quantità di dati temporanei che l'applicazione di addestramento scrive sul disco. I dischi di avvio possono avere dimensioni comprese tra 100 GiB (impostazione predefinita) e 64.000 GiB. Tutte le VM in un pool di worker devono utilizzare lo stesso tipo e le stesse dimensioni del disco di avvio.
Configurazioni dei container
Le configurazioni dei container che devi apportare dipendono dal fatto che tu stia utilizzando un'immagine container predefinita o personalizzata.
Configurazioni dei container predefiniti:
- Specifica l'URI dell'immagine container predefinita che vuoi utilizzare.
- Se l'applicazione di addestramento è pacchettizzata come distribuzione di origine Python, specifica l'URI Cloud Storage in cui si trova il pacchetto.
- Specifica il modulo del punto di ingresso dell'applicazione di addestramento.
- (Facoltativo) Specifica un elenco di argomenti della riga di comando da passare al modulo del punto di ingresso dell'applicazione di addestramento.
Configurazioni dei container personalizzati:
- Specifica l'URI dell'immagine container personalizzata, che può essere un URI di Artifact Registry o Docker Hub.
- Facoltativo: esegui l'override delle istruzioni
ENTRYPOINToCMDnell' immagine container.
Creare un job di addestramento
Dopo aver preparato i dati e l'applicazione di addestramento, esegui l'applicazione di addestramento creando uno dei seguenti job di addestramento:
- Crea un job personalizzato.
- Crea un job di ottimizzazione degli iperparametri.
- Crea una pipeline di addestramento.
Per creare il job di addestramento, puoi utilizzare la Google Cloud console, Google Cloud CLI, l'SDK Agent Platform per Python o l'API Agent Platform.
(Facoltativo) Importare gli artefatti del modello in Gemini Enterprise Agent Platform
L'applicazione di addestramento genera probabilmente uno o più artefatti del modello in una posizione specificata, in genere un bucket Cloud Storage. Prima di poter ottenere inferenze in Gemini Enterprise Agent Platform dagli artefatti del modello, devi prima importarli in Gemini Enterprise Agent Platform Model Registry.
Come per le immagini container per l'addestramento, Gemini Enterprise Agent Platform ti consente di scegliere se utilizzare predefinite o personalizzate immagini container per le inferenze. Se è disponibile un'immagine container predefinita per le inferenze per il framework ML e la versione del framework, ti consigliamo di utilizzarla.
Passaggi successivi
- Ottieni inferenze dal modello.
- Valuta il modello.
- Prova il tutorial Hello serverless training per istruzioni passo passo sull'addestramento di un modello di classificazione delle immagini TensorFlow Keras su Gemini Enterprise Agent Platform.