Abstimmungs-Dataset für die Abstimmung für Reinforcement Learning

Ein Feinabstimmungsjob für Reinforcement Learning wird durch ein Trainingsdataset und ein optionales Validierungsdataset gesteuert. Jedes Dataset ist eine JSON-Datei, die in Cloud Storage gespeichert ist. Jede Zeile ist ein einzelnes Abstimmungsbeispiel.

Auf dieser Seite werden das Dataset-Schema, die Verwendung des Felds references für die Berechnung von Belohnungen und die vom Dienst erzwungenen Dataset-Limits pro Modalität beschrieben.

Dataset-Schema

Jede Zeile der JSONL-Dataset-Datei folgt diesem Schema:

{
  "systemInstruction": {
    "role": string,
    "parts": [
      {
        "text": string
      }
    ]
  },
  "contents": [
    {
      "role": string,
      "parts": [
        {
          // Union field data: text or fileData.
          "text": string,
          "fileData": {
            "mimeType": string,
            "fileUri": string
          }
        }
      ]
    }
  ],
  "references": {
    string: string,
    ...
  }
}

Die Felder contents und systemInstruction verwenden dasselbe Schema wie die Gemini Enterprise Agent Platform generateContent API. systemInstruction akzeptiert nur Text. contents kann Text- oder Dateidaten (Bild, Audio oder Video) enthalten, unterliegt jedoch den Dataset-Limits.

Das Feld references

Das Feld references ist spezifisch für die Feinabstimmung mit Reinforcement Learning. Es speichert alle Metadaten, die Ihre Belohnungsfunktion benötigt, um die Antwort des Modells zu bewerten. Es akzeptiert ein String-zu-String-Wörterbuch.

Eine Belohnung für den Stringabgleich, bei der die Antwort des Modells mit einer bekannten Ground Truth verglichen wird, könnte beispielsweise eine Dataset-Zeile wie die folgende verwenden:

{
  "systemInstruction": {
    "role": "system",
    "parts": [{ "text": "You are a helpful math tutor." }]
  },
  "contents": [
    {
      "role": "user",
      "parts": [{ "text": "What is 17 * 23? Put your final answer in $\\text{your answer}$." }]
    }
  ],
  "references": {
    "ground_truth_answer": "391"
  }
}

Ihre Belohnungsfunktion kann references["ground_truth_answer"] lesen und vergleicht es mit dem vom Modell erzeugten Wert. Weitere Informationen dazu, wie die einzelnen Belohnungstypen referencesverwenden, finden Sie auf der Seite Belohnungsfunktionen.

Limits für Datasets

Für Datasets zur Feinabstimmung mit Reinforcement Learning gelten die folgenden Limits:

Spezifikation Wert
Maximale Anzahl von Beispielen in einem Trainingsdataset 5.000
Maximale Anzahl von Beispielen in einem Validierungsdataset 500
Maximale Dateigröße des Datasets 1 GB
Maximale Anzahl von Eingabetokens pro Beispiel 32.768
Maximale Anzahl von Ausgabetokens pro Beispiel (einschließlich Tokens für das Denken) 32.768

Multimodale Limits

Die folgenden Limits pro Modalität gelten, wenn Ihr Dataset Bild-, Audio- oder Videodaten enthält:

Audio

Spezifikation Wert
Maximale Anzahl von Audiodateien pro Prompt 15
Maximale Gesamtlänge der Audiodateien pro Beispiel (über alle Dateien hinweg) 10 Minuten
Maximale Größe der Audiodatei 100 MB

Video

Spezifikation Wert
Maximale Anzahl von Videodateien pro Prompt 10
Maximale Gesamtlänge der Videodateien pro Beispiel (über alle Dateien hinweg) 5 Minuten
Maximale Größe der Videodatei 20 MB

Bild

Spezifikation Wert
Maximale Anzahl von Bildern pro Prompt 15
Maximale Größe der Bilddatei 20 MB

Nächste Schritte