Ein Feinabstimmungsjob für Reinforcement Learning wird durch ein Trainingsdataset und ein optionales Validierungsdataset gesteuert. Jedes Dataset ist eine JSON-Datei, die in Cloud Storage gespeichert ist. Jede Zeile ist ein einzelnes Abstimmungsbeispiel.
Auf dieser Seite werden das Dataset-Schema, die Verwendung des Felds references für die Berechnung von Belohnungen und die vom Dienst erzwungenen Dataset-Limits pro Modalität beschrieben.
Dataset-Schema
Jede Zeile der JSONL-Dataset-Datei folgt diesem Schema:
{
"systemInstruction": {
"role": string,
"parts": [
{
"text": string
}
]
},
"contents": [
{
"role": string,
"parts": [
{
// Union field data: text or fileData.
"text": string,
"fileData": {
"mimeType": string,
"fileUri": string
}
}
]
}
],
"references": {
string: string,
...
}
}
Die Felder contents und systemInstruction verwenden dasselbe Schema wie die
Gemini Enterprise Agent Platform
generateContent
API. systemInstruction akzeptiert nur Text. contents kann Text- oder
Dateidaten (Bild, Audio oder Video) enthalten, unterliegt jedoch den
Dataset-Limits.
Das Feld references
Das Feld references ist spezifisch für die Feinabstimmung mit Reinforcement Learning. Es speichert alle Metadaten, die Ihre Belohnungsfunktion benötigt, um die Antwort des Modells zu bewerten. Es akzeptiert ein String-zu-String-Wörterbuch.
Eine Belohnung für den Stringabgleich, bei der die Antwort des Modells mit einer bekannten Ground Truth verglichen wird, könnte beispielsweise eine Dataset-Zeile wie die folgende verwenden:
{
"systemInstruction": {
"role": "system",
"parts": [{ "text": "You are a helpful math tutor." }]
},
"contents": [
{
"role": "user",
"parts": [{ "text": "What is 17 * 23? Put your final answer in $\\text{your answer}$." }]
}
],
"references": {
"ground_truth_answer": "391"
}
}
Ihre Belohnungsfunktion kann references["ground_truth_answer"] lesen und vergleicht
es mit dem vom Modell erzeugten Wert. Weitere Informationen dazu, wie die einzelnen Belohnungstypen
referencesverwenden, finden Sie auf der
Seite Belohnungsfunktionen.
Limits für Datasets
Für Datasets zur Feinabstimmung mit Reinforcement Learning gelten die folgenden Limits:
| Spezifikation | Wert |
|---|---|
| Maximale Anzahl von Beispielen in einem Trainingsdataset | 5.000 |
| Maximale Anzahl von Beispielen in einem Validierungsdataset | 500 |
| Maximale Dateigröße des Datasets | 1 GB |
| Maximale Anzahl von Eingabetokens pro Beispiel | 32.768 |
| Maximale Anzahl von Ausgabetokens pro Beispiel (einschließlich Tokens für das Denken) | 32.768 |
Multimodale Limits
Die folgenden Limits pro Modalität gelten, wenn Ihr Dataset Bild-, Audio- oder Videodaten enthält:
Audio
| Spezifikation | Wert |
|---|---|
| Maximale Anzahl von Audiodateien pro Prompt | 15 |
| Maximale Gesamtlänge der Audiodateien pro Beispiel (über alle Dateien hinweg) | 10 Minuten |
| Maximale Größe der Audiodatei | 100 MB |
Video
| Spezifikation | Wert |
|---|---|
| Maximale Anzahl von Videodateien pro Prompt | 10 |
| Maximale Gesamtlänge der Videodateien pro Beispiel (über alle Dateien hinweg) | 5 Minuten |
| Maximale Größe der Videodatei | 20 MB |
Bild
| Spezifikation | Wert |
|---|---|
| Maximale Anzahl von Bildern pro Prompt | 15 |
| Maximale Größe der Bilddatei | 20 MB |
Nächste Schritte
- Hyperparameter konfigurieren für Ihren Abstimmungsjob.
- Belohnungsfunktionen definieren.
- Jobstatus und Messwerte beobachten.
- Folgen Sie der Kurzanleitung , um Ihren ersten Feinabstimmungsjob für Reinforcement Learning zu erstellen.