Set di dati per l'ottimizzazione del reinforcement learning

Un job di perfezionamento del reinforcement learning è basato su un set di dati di addestramento e su un set di dati di convalida facoltativo. Ogni set di dati è un file JSON archiviato in Cloud Storage, in cui ogni riga è un singolo esempio di ottimizzazione.

Questa pagina descrive lo schema del set di dati, come utilizzare il campo references per il calcolo della ricompensa e i limiti del set di dati per modalità applicati dal servizio.

Schema del set di dati

Ogni riga del file del set di dati JSONL segue questo schema:

{
  "systemInstruction": {
    "role": string,
    "parts": [
      {
        "text": string
      }
    ]
  },
  "contents": [
    {
      "role": string,
      "parts": [
        {
          // Union field data: text or fileData.
          "text": string,
          "fileData": {
            "mimeType": string,
            "fileUri": string
          }
        }
      ]
    }
  ],
  "references": {
    string: string,
    ...
  }
}

I campi contents e systemInstruction utilizzano lo stesso schema dell'API generateContent Gemini Enterprise Agent Platform. systemInstruction accetta solo testo. contents può includere testo o dati di file (immagine, audio o video), nel rispetto dei limiti del set di dati.

Il campo references

Il campo references è specifico per la messa a punto dell'apprendimento per rinforzo. Memorizza tutti i metadati necessari alla funzione di ricompensa per valutare la risposta del modello. Accetta un dizionario da stringa a stringa.

Ad esempio, una ricompensa di corrispondenza delle stringhe che confronta la risposta del modello con un dato di fatto noto potrebbe utilizzare una riga del set di dati come la seguente:

{
  "systemInstruction": {
    "role": "system",
    "parts": [{ "text": "You are a helpful math tutor." }]
  },
  "contents": [
    {
      "role": "user",
      "parts": [{ "text": "What is 17 * 23? Put your final answer in $\\text{your answer}$." }]
    }
  ],
  "references": {
    "ground_truth_answer": "391"
  }
}

La funzione di ricompensa potrebbe leggere references["ground_truth_answer"] e confrontarlo con il valore prodotto dal modello. Per informazioni dettagliate su come ogni tipo di premio consuma references, consulta la pagina Funzioni di premio.

Limiti dei set di dati

Ai set di dati di perfezionamento del reinforcement learning si applicano i seguenti limiti:

Specifica Valore
Numero massimo di esempi in un set di dati di addestramento 5000
Numero massimo di esempi in un set di dati di convalida 500
Dimensione massima del file del set di dati 1 GB
Numero massimo di token di input per esempio 32.768
Numero massimo di token di output per esempio (inclusi i token di pensiero) 32.768

Limiti multimodali

Quando il set di dati include dati di tipo immagine, audio o video, si applicano i seguenti limiti per modalità:

Audio

Specifica Valore
Numero massimo di file audio per prompt 15
Durata audio totale massima per esempio (in tutti i file) 10 minuti
Dimensione massima del file audio 100 MB

Video

Specifica Valore
Numero massimo di file video per prompt 10
Durata totale massima del video per esempio (in tutti i file) 5 minuti
Dimensioni massime del file video 20 MB

Immagine

Specifica Valore
Numero massimo di immagini per prompt 15
Dimensione massima del file immagine 20 MB

Passaggi successivi