Die überwachte Feinabstimmung ist eine gute Option, wenn Sie eine klar definierte Aufgabe mit verfügbaren, mit Labels versehenen Daten haben. Sie ist besonders effektiv bei domainspezifischen Anwendungen, bei denen sich die Sprache oder der Inhalt erheblich von den Daten unterscheiden, mit denen das große Modell ursprünglich trainiert wurde. Sie können Text, Bild, Audio, Video und Dokument Datentypen abstimmen. Sie können auch Gemini-basierte Anwendungen und Agents erstellen, die mit Echtzeitinformationen und -diensten wie Datenbanken, Customer-Relationship-Management-Systemen und Dokument-Repositories interagieren können.
Bei der überwachten Feinabstimmung wird das Modellverhalten mit einem mit Labels versehenen Dataset angepasst. Bei diesem Prozess wird die Gewichtung des Modells angepasst, um den Unterschied zwischen den Vorhersagen und den tatsächlichen Labels zu minimieren. So kann beispielsweise die Modellleistung für die folgenden Arten von Aufgaben verbessert werden:
- Klassifizierung
- Zusammenfassung
- Extraktives Question Answering
- Chat
Eine Diskussion der wichtigsten Anwendungsfälle für die Abstimmung finden Sie im Blogpost Hundreds of organizations are fine-tuning Gemini models. Hier sind die beliebtesten Anwendungs fälle.
Weitere Informationen finden Sie unter When to use supervised fine-tuning for Gemini.
Unterstützte Modelle
Die folgenden Gemini-Modelle unterstützen die überwachte Feinabstimmung:
Klicken Sie, um die unterstützten Modelle zu maximieren.
Beschränkungen
Die überwachte Feinabstimmung ist kein abgedeckter Dienst und ist vom SLO eines Service Level Agreements ausgeschlossen.
In der folgenden Tabelle sind die Beschränkungen für Datasets für die überwachte Feinabstimmung aufgeführt:
Gemini 3.5 Flash
| Spezifikation | Wert |
|---|---|
| Maximale Anzahl von Eingabe- und Ausgabetokens pro Trainingsbeispiel | 131.072 |
| Maximale Anzahl von Eingabe- und Ausgabetokens für die Bereitstellung | Wie beim Basismodell von Gemini |
| Maximale Anzahl von Beispielen in einem Validierungs-Dataset | 5.000 Beispiele oder 30% der Anzahl der Trainingsbeispiele, wenn mehr als 1.000 Validierungsbeispiele vorhanden sind |
| Maximale Dateigröße des Trainings-Datasets | 1 GB für JSONL |
| Maximale Größe des Trainings-Datasets | 10 Millionen Beispiele nur mit Text oder 300.000 multimodale Beispiele |
| Adaptergröße | Unterstützte Werte sind 1, 2, 4, 8 und 16 |
| Unterstützter Endpunkt für die Modellabstimmung | us-central1 und europe-west4 |
| Unterstützter Endpunkt für die Bereitstellung des abgestimmten Modells |
Nur multiregionale Endpunkte us und eu
|
| CMEK-Unterstützung | Nicht unterstützt |
Gemini 3.1 Flash Lite
| Spezifikation | Wert |
|---|---|
| Maximale Anzahl von Eingabe- und Ausgabetokens pro Trainingsbeispiel | 131.072 |
| Maximale Anzahl von Eingabe- und Ausgabetokens für die Bereitstellung | Wie beim Basismodell von Gemini |
| Maximale Anzahl von Beispielen in einem Validierungs-Dataset | 5.000 Beispiele oder 30% der Anzahl der Trainingsbeispiele, wenn mehr als 1.000 Validierungsbeispiele vorhanden sind |
| Maximale Dateigröße des Trainings-Datasets | 1 GB für JSONL |
| Maximale Größe des Trainings-Datasets | 10 Millionen Beispiele nur mit Text oder 300.000 multimodale Beispiele |
| Adaptergröße | Unterstützte Werte sind 1, 2, 4, 8 und 16 |
| Unterstützter Endpunkt für die Modellabstimmung | us-central1 und europe-west4 |
| Unterstützter Endpunkt für die Bereitstellung des abgestimmten Modells |
Nur multiregionale Endpunkte us und eu
|
| CMEK-Unterstützung | Nicht unterstützt |
Gemini 2.5 Flash
Gemini 2.5 Flash Lite
| Spezifikation | Wert |
|---|---|
| Maximale Anzahl von Eingabe- und Ausgabetokens pro Trainingsbeispiel | 131.072 |
| Maximale Anzahl von Eingabe- und Ausgabetokens für die Bereitstellung | Wie beim Basismodell von Gemini |
| Maximale Anzahl von Beispielen in einem Validierungs-Dataset | 5.000 Beispiele oder 30% der Anzahl der Trainingsbeispiele, wenn mehr als 1.000 Validierungsbeispiele vorhanden sind |
| Maximale Dateigröße des Trainings-Datasets | 1 GB für JSONL |
| Maximale Größe des Trainings-Datasets | 10 Millionen Beispiele nur mit Text oder 300.000 multimodale Beispiele |
| Adaptergröße | Unterstützte Werte sind 1, 2, 4, 8 und 16 |
Gemini 2.5 Pro
| Spezifikation | Wert |
|---|---|
| Maximale Anzahl von Eingabe- und Ausgabetokens für das Training | 131.072 |
| Maximale Anzahl von Eingabe- und Ausgabetokens für die Bereitstellung | Wie beim Basismodell von Gemini |
| Maximale Größe des Validierungs-Datasets | 5.000 Beispiele oder 30% der Anzahl der Trainingsbeispiele, wenn mehr als 1.000 Validierungsbeispiele vorhanden sind |
| Maximale Dateigröße des Trainings-Datasets | 1 GB für JSONL |
| Maximale Größe des Trainings-Datasets | 10 Millionen Beispiele nur mit Text oder 300.000 multimodale Beispiele |
| Adaptergröße | Unterstützte Werte sind 1, 2, 4 und 8 |
Bekannte Probleme
- Wenn Sie kontrollierte Ausgaben anwenden, wenn Sie Inferenzanfragen an abgestimmte Gemini-Modelle senden, kann die Modellqualität aufgrund von Datenabweichungen während der Abstimmung und der Inferenzzeit sinken. Während der Abstimmung wird die kontrollierte Ausgabe nicht angewendet, sodass das abgestimmte Modell die kontrollierte Ausgabe zur Inferenzzeit nicht gut verarbeiten kann. Bei der überwachten Feinabstimmung wird das Modell effektiv angepasst, um strukturierte Ausgaben zu generieren. Daher müssen Sie keine kontrollierte Ausgabe anwenden, wenn Sie Inferenzanfragen an abgestimmte Modelle senden.
Anwendungsfälle für die überwachte Feinabstimmung
Foundation-Modelle funktionieren gut, wenn die erwartete Ausgabe oder Aufgabe in einem Prompt klar und präzise definiert werden kann und der Prompt konsistent die erwartete Ausgabe erzeugt. Wenn Sie möchten, dass ein Modell bestimmte Nischenthemen oder Besonderheiten lernt, die von den allgemeinen Mustern abweichen, sollten Sie das Modell entsprechend abstimmen. Sie können das Modell zum Beispiel mithilfe der Modellabstimmung Folgendes antrainieren:
- Bestimmte Strukturen oder Formate zum Generieren einer Ausgabe.
- Spezifisches Verhalten, z. B. wenn eine grobe oder ausführliche Ausgabe bereitgestellt werden soll.
- Bestimmte benutzerdefinierte Ausgaben für bestimmte Eingabetypen angeben.
Bei den folgenden Beispielen handelt es sich um Anwendungsfälle, die sich nur schwer mit Eingabeaufforderungen erfassen lassen:
Klassifizierung: Die erwartete Antwort ist ein bestimmtes Wort oder eine bestimmte Wortgruppe.
Durch Abstimmung des Modells kann verhindert werden, dass das Modell ausführliche Antworten generiert.
Zusammenfassung: Die Zusammenfassung folgt einem bestimmten Format. Es kann beispielsweise vorkommen, dass Sie personenidentifizierbare Informationen aus einer Chatzusammenfassung entfernen müssen.
Das Format der Ersetzung der Namen der Sprecher durch
#Person1und#Person2ist schwierig zu beschreiben. Das Foundation Model erzeugt möglicherweise keine solche Antwort.Antwort auf Extraktionsfrage: Die Frage bezieht sich auf einen Kontext und die Antwort ist ein Teilstring des Kontexts.
Die Antwort "Last Glacial Maximum" ist eine spezifische Wortgruppe aus dem Kontext.
Chat: Sie müssen die Modellantwort anpassen, damit sie einer Identität, einer Rolle oder einem Zeichen genügt.
Sie können ein Modell auch in folgenden Situationen optimieren:
- Prompts führen nicht konsistent zu den erwarteten Ergebnissen.
- Die Aufgabe ist zu kompliziert, um sie in einem Prompt zu definieren. Beispiel: Das Modell soll ein Verhalten klonen, das nur schwer in einem Prompt zu beschreiben ist.
- Sie haben komplexe Ahnungen über eine Aufgabe, die nur schwer in einem Prompt zu formalisieren ist.
- Sie möchten die Few-Shot-Beispiele entfernen, um die Kontextlänge zu reduzieren.
Region für Abstimmungsjob konfigurieren
Nutzerdaten wie das transformierte Dataset und das optimierte Modell werden in der Abstimmungsjobregion gespeichert. Während der Abstimmung kann die Berechnung für verfügbare Beschleuniger auf andere US- oder EU-Regionen übertragen werden. Die Übertragung ist für Nutzer transparent.
Wenn Sie das Vertex AI SDK verwenden, können Sie die Region bei der Initialisierung angeben. Beispiel:
import vertexai vertexai.init(project='myproject', location='us-central1')Wenn Sie einen überwachten Job zur Feinabstimmung durch Senden einer POST-Anfrage mit der
tuningJobs.createMethode erstellen, verwenden Sie die URL, um die Region anzugeben, in der der Abstimmungsjob ausgeführt wird. In der folgenden URL geben Sie beispielsweise eine Region an, indem Sie beide Instanzen vonTUNING_JOB_REGIONdurch die Region ersetzen, in der der Job ausgeführt wird.https://TUNING_JOB_REGION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/TUNING_JOB_REGION/tuningJobsWenn Sie die Google Cloud Console, können Sie den Namen der Region im Drop-down-Feld Region der Seite Modelldetails auswählen. Dies ist dieselbe Seite, auf der Sie das Basismodell und den Namen eines abgestimmten Modells auswählen.
Abgestimmte Modelle bewerten
Sie können abgestimmte Modelle auf folgende Weise bewerten:
Abstimmungs- und Validierungsmesswerte: Bewerten Sie das abgestimmte Modell nach Abschluss des Abstimmungsjobs mit Abstimmungs- und Validierungsmesswerten.
Integrierte Bewertung mit dem Gen AI Evaluation Service (Vorschau): Konfigurieren Sie Abstimmungsjobs so, dass während der Abstimmung automatisch Bewertungen mit dem Gen AI Evaluation Service ausgeführt werden. Die folgenden Schnittstellen, Modelle und Regionen werden für die Abstimmungsintegration mit dem Gen AI Evaluation Service unterstützt:
Unterstützte Schnittstellen: Google Gen AI SDK und REST API.
Unterstützte Modelle:
gemini-2.5-pro,gemini-2.5-flashundgemini-2.5-flash-lite.Unterstützte Regionen: Eine Liste der unterstützten Regionen finden Sie unter Unterstützte Regionen.
Quota
Das Kontingent wird für die Anzahl gleichzeitiger Abstimmungsjobs erzwungen. Jedes Projekt kommt mit einem Standardkontingent zum Ausführen mindestens eines Abstimmungsjobs. Dies ist ein globales Kontingent, das für alle verfügbaren Regionen und unterstützten Modelle gilt. Wenn Sie weitere Jobs gleichzeitig ausführen möchten, müssen Sie zusätzliche Kontingente anfordern für Global concurrent tuning jobs.
Wenn Sie den Gen AI Evaluation Service so konfigurieren, dass Bewertungen während der Abstimmung automatisch ausgeführt werden, finden Sie weitere Informationen unter Kontingente für den Gen AI Evaluation Service.
Preise
Die Preise für die überwachte Feinabstimmung von Gemini finden Sie hier: Preise für die Gemini Enterprise Agent Platform.
Die Anzahl der Trainings-Tokens wird berechnet, indem die Anzahl der Tokens in Ihrem Trainings-Dataset mit der Anzahl der Epochen multipliziert wird. Nach der Abstimmung fallen aber Inferenzkosten (Anfrage für Vorhersagen) für das feinabgestimmte Modell an. Die Inferenzpreise sind für alle stabilen Versionen von Gemini gleich. Weitere Informationen finden Sie unter Verfügbare stabile Gemini-Modellversionen.
Wenn Sie den Gen AI Evaluation Service so konfigurieren, dass er während der Abstimmung automatisch ausgeführt wird, werden Bewertungen als Batch-Vorhersagejobs in Rechnung gestellt. Weitere Informationen finden Sie unter Preise.
Nächste Schritte
- Erfahren Sie mehr über überwachte Feinabstimmung.
- Informationen zur Bereitstellung eines abgestimmten Gemini-Modells