Informazioni sull'ottimizzazione del reinforcement learning per i modelli Gemini

L'apprendimento per rinforzo è una tecnica potente per adattare i modelli linguistici di grandi dimensioni (LLM) in modo da massimizzare le ricompense del feedback fornite da una funzione di ricompensa definita dall'utente. Il modello esplora molte risposte possibili, osserva una ricompensa numerica per ciascuna e modifica gradualmente il suo comportamento in modo che le risposte con ricompensa elevata diventino più probabili e quelle con ricompensa bassa diventino meno probabili. Questo approccio eccelle in scenari che richiedono ragionamenti multi-step, processi decisionali complessi o la comprensione di sfumature sottili nei prompt.

Il fine-tuning con apprendimento per rinforzo per Gemini ti consente di eseguire il fine-tuning di Gemini utilizzando i tuoi prompt e le funzioni di ricompensa autodefinite. Puoi utilizzarlo per migliorare la capacità di ragionamento e la qualità dell'output dei modelli Gemini per i tuoi casi d'uso e i workflow agentici.

Come funziona

L'ottimizzazione del reinforcement learning opera in modo iterativo per perfezionare il comportamento dell'LLM. Durante ogni iterazione, il modello genera risposte a un insieme di prompt. Queste risposte vengono poi valutate da una funzione di ricompensa definita dall'utente, che quantifica la qualità dell'output generato in base ai criteri desiderati. Il servizio utilizza questo indicatore di ricompensa per aggiornare i parametri del modello tramite algoritmi di apprendimento per rinforzo, in modo da incoraggiare comportamenti che portano a ricompense più elevate. Questo processo iterativo di generazione, valutazione e aggiornamento consente al modello di apprendere e adattarsi ai tuoi casi d'uso specifici.

Il seguente diagramma mostra il flusso di lavoro generale di perfezionamento dell'apprendimento per rinforzo:

Il ciclo di feedback di ottimizzazione dell'apprendimento per rinforzo: il modello campiona gli output da un input non etichettato, una funzione di ricompensa (basata su funzioni, su LLM o personalizzata) assegna un punteggio a ogni output e il passaggio di ottimizzazione RL aggiorna i pesi del modello tramite la discesa del gradiente della norma. Il ciclo produce un checkpoint LLM ottimizzato.
Il ciclo di feedback di ottimizzazione dell'apprendimento per rinforzo per i modelli Gemini.

Funzionalità principali

  • Funzioni di ricompensa personalizzabili:definisci le tue funzioni di ricompensa per ottimizzare con precisione un'ampia gamma di casi d'uso personalizzati e allineare il comportamento del modello a obiettivi specifici. Per informazioni dettagliate sui tipi di premi supportati, consulta la pagina Funzioni di premi.

  • Adattatori per l'ottimizzazione efficiente:l'ottimizzazione del reinforcement learning utilizza adattatori, che consentono un adattamento efficace riutilizzando l'infrastruttura di pubblicazione esistente.

  • Più livelli di ragionamento:il servizio supporta l'ottimizzazione a due livelli di ragionamento, MINIMAL e HIGH (ragionamento dinamico), in modo che tu possa scegliere l'approccio più adatto agli obiettivi di apprendimento del tuo modello e ai pattern di generazione delle risposte desiderati. Per maggiori dettagli, consulta la pagina Iperparametri.

  • Ottimizzazione continua: perfeziona ulteriormente un modello ottimizzato in precedenza incorporando epoche o esempi di addestramento aggiuntivi. L'utilizzo di un modello o di un checkpoint ottimizzato esistente come base consente un processo più efficiente per l'ottimizzazione della sperimentazione. Per maggiori dettagli, consulta la pagina Ottimizzazione continua.

  • Dataset multimodali:supporta modalità di dati di testo, immagini, video e audio.

Quando utilizzare l'ottimizzazione del reinforcement learning

L'ottimizzazione del reinforcement learning è preferibile per l'ottimizzazione degli LLM in situazioni in cui le strategie ottimali non sono ovvie tramite l'apprendimento supervisionato. Ciò include le attività in cui l'obiettivo è ottimizzare metriche specifiche senza etichette di verità di base facilmente disponibili, in cui l'allineamento con le preferenze umane è fondamentale (ed esiste un metodo di giudizio) e per le attività che richiedono un ragionamento complesso e che traggono vantaggio da miglioramenti ed esplorazioni iterativi.

Di seguito sono riportati alcuni scenari in cui è preferibile l'ottimizzazione del reinforcement learning:

  • Seguire istruzioni complesse:quando il modello deve seguire istruzioni complesse in cui l'output"corretto" non è una singola risposta, ma richiede una serie di controlli. L'apprendimento per rinforzo può aiutare il modello a imparare a navigare in questi set di istruzioni complessi.

  • Generazione di contenuti creativi: per attività come la generazione di scrittura creativa, poesie o codice altamente specializzato, in cui le metriche oggettive sono difficili da definire. L'apprendimento per rinforzo, con una funzione di ricompensa ben progettata (che potrebbe coinvolgere il feedback umano o la valutazione di esperti), può guidare il modello verso risultati più desiderabili e innovativi.

  • Attività di ragionamento:per le attività che richiedono un ragionamento complesso, come la risoluzione di puzzle di parole o problemi matematici, il reinforcement learning può incentivare il modello a esplorare diverse sequenze di "pensiero" per imparare quali schemi di ragionamento sono più efficaci per risolvere i problemi.

Modelli e regioni supportati

I seguenti modelli Gemini supportano il fine tuning dell'apprendimento per rinforzo:

Gemini 3.5 Flash

Specifica Valore
Endpoint supportati per l'ottimizzazione del modello
  • us-central1us-central1-aiplatform.googleapis.com
  • europe-west4europe-west4-aiplatform.googleapis.com
Endpoint supportati per l'erogazione del modello ottimizzato
  • Endpoint multiregionale us (aiplatform.us.rep.googleapis.com) durante l'ottimizzazione in us-central1
  • Endpoint multiregionale eu (aiplatform.eu.rep.googleapis.com) durante l'ottimizzazione in europe-west4
Versione API Solo v1beta1

Modalità di ottimizzazione supportate

L'ottimizzazione del reinforcement learning supporta le seguenti modalità di dati nei set di dati di ottimizzazione:

  • Testo
  • Audio
  • Immagine
  • Video

Per i limiti dei set di dati per modalità (ad esempio il numero massimo di file per prompt, la dimensione massima dei file e la lunghezza totale massima), consulta la pagina Set di dati di ottimizzazione.

Ottimizzazione continua

Puoi utilizzare l'output di un job di ottimizzazione precedente come base per un nuovo job di ottimizzazione del reinforcement learning. Sono supportati i seguenti pattern di ottimizzazione continua:

  • Fine-tuning supervisionato → Ottimizzazione del reinforcement learning
  • Ottimizzazione del reinforcement learning → Ottimizzazione del reinforcement learning

Per i dettagli della configurazione, consulta la pagina Ottimizzazione continua.

Eroga il modello ottimizzato

Al termine di un job di ottimizzazione dell'apprendimento per rinforzo sul modello Gemini di base, viene eseguito il deployment di un modello ottimizzato basato sull'ultimo checkpoint in un endpoint del tuo progetto. I modelli ottimizzati utilizzano la stessa strategia dell'endpoint di pubblicazione del modello di base. Ad esempio, se esegui un job di ottimizzazione in us-central1, il modello ottimizzato viene sottoposto a deployment in un endpoint multi-regione us (mREP).

Per recuperare l'endpoint del modello ottimizzato di cui è stato eseguito il deployment ed eseguire l'inferenza, consulta la pagina Guida rapida.

Prezzi

Prezzi del tuning

L'ottimizzazione del reinforcement learning per Gemini genera token in due fasi: una fase di campionamento e una fase di addestramento. I token generati durante la fase di addestramento vengono addebitati in base alla sezione "Ottimizzazione del modello" della pagina Prezzi di Gemini Enterprise Agent Platform.

Prezzi dell'inferenza

Dopo l'ottimizzazione, continuano a essere applicati i costi di inferenza (richiesta di previsione) per il modello ottimizzato. Per l'inferenza del modello a partire da Gemini 3, il prezzo di previsione dell'endpoint del modello ottimizzato è 1,5 volte il prezzo del modello di base. Per saperne di più, consulta Versioni stabili del modello Gemini disponibili.

Se configuri Gen AI evaluation service per l'esecuzione automatica durante l'ottimizzazione, le valutazioni vengono addebitate come job di previsioni in batch. Per ulteriori informazioni, consulta la sezione "Ottimizzazione del modello" della pagina Prezzi di Gemini Enterprise Agent Platform.

Passaggi successivi