Abstimmung für Reinforcement Learning für Gemini-Modelle

Bestärkendes Lernen ist eine leistungsstarke Methode, um Large Language Models (LLMs) so anzupassen, dass die Feedback-Belohnungen maximiert werden, die von einer benutzerdefinierten Belohnungsfunktion bereitgestellt werden. Das Modell untersucht viele mögliche Antworten, beobachtet für jede eine numerische Belohnung und ändert sein Verhalten schrittweise, sodass Antworten mit hoher Belohnung wahrscheinlicher und Antworten mit niedriger Belohnung unwahrscheinlicher werden. Dieser Ansatz eignet sich besonders für Szenarien, die mehrstufige Problemlösung, komplexe Entscheidungsfindung oder das Erkennen subtiler Nuancen in Prompts erfordern.

Mit dem Fine-Tuning von Gemini mit Reinforcement Learning können Sie Gemini mithilfe Ihrer eigenen Prompts und selbstdefinierten Belohnungsfunktionen optimieren. Damit können Sie die Denkfähigkeit und Ausgabequalität von Gemini-Modellen für Ihre eigenen Anwendungsfälle und Agent-Workflows verbessern.

Funktionsweise

Die Abstimmung für Reinforcement Learning erfolgt iterativ, um das Verhalten des LLM zu optimieren. In jeder Iteration generiert das Modell Antworten auf eine Reihe von Prompts. Diese Antworten werden dann anhand einer nutzerdefinierten Reward-Funktion bewertet, die die Qualität der generierten Ausgabe anhand Ihrer gewünschten Kriterien quantifiziert. Der Dienst verwendet dieses Belohnungssignal, um die Parameter des Modells mithilfe von Reinforcement-Learning-Algorithmen zu aktualisieren und Verhaltensweisen zu fördern, die zu höheren Belohnungen führen. Durch diesen iterativen Prozess aus Generierung, Bewertung und Aktualisierung kann das Modell lernen und sich an Ihre spezifischen Anwendungsfälle anpassen.

Das folgende Diagramm zeigt den gesamten Workflow für das Fine-Tuning von Reinforcement Learning:

Der Feedbackloop für die Feinabstimmung durch bestärkendes Lernen: Das Modell gibt Ausgaben aus einer Eingabe ohne Label aus, eine Belohnungsfunktion (funktionsbasiert, LLM-basiert oder benutzerdefiniert) bewertet jede Ausgabe und im Schritt zur Feinabstimmung durch bestärkendes Lernen werden die Modellgewichte durch Policy-Gradientenabstieg aktualisiert. Im Rahmen des Zyklus wird ein abgestimmter LLM-Prüfpunkt erstellt.
Der Feedback-Loop für die Feinabstimmung durch bestärkendes Lernen für Gemini-Modelle.

Wichtige Features

  • Anpassbare Belohnungsfunktionen:Sie können eigene Belohnungsfunktionen definieren, um das Modellverhalten präzise für eine Vielzahl von benutzerdefinierten Anwendungsfällen zu optimieren und an bestimmte Ziele anzupassen. Weitere Informationen zu den unterstützten Belohnungstypen finden Sie auf der Seite Belohnungsfunktionen.

  • Adapter für effiziente Abstimmung:Bei der Abstimmung für Reinforcement Learning werden Adapter verwendet, die eine effektive Anpassung ermöglichen und gleichzeitig die vorhandene Serving-Infrastruktur wiederverwenden.

  • Mehrere Denkebenen:Der Dienst unterstützt die Feinabstimmung auf zwei Denkebenen, MINIMAL und HIGH (dynamisches Denken). So können Sie den Ansatz auswählen, der am besten zu den Lernzielen Ihres Modells und den gewünschten Mustern für die Generierung von Antworten passt. Weitere Informationen finden Sie auf der Seite Hyperparameter.

  • Kontinuierliche Abstimmung:Ein zuvor abgestimmtes Modell kann durch zusätzliche Trainingsbeispiele oder ‑epochen weiter optimiert werden. Wenn Sie ein vorhandenes abgestimmtes Modell oder einen vorhandenen Prüfpunkt als Grundlage verwenden, können Sie die Abstimmung effizienter testen. Weitere Informationen finden Sie auf der Seite Kontinuierliches Tuning.

  • Multimodale Datasets:Unterstützt Text-, Bild-, Video- und Audiodaten.

Wann sollte die Abstimmung für Reinforcement Learning eingesetzt werden?

Die Abstimmung für Reinforcement Learning wird für die Abstimmung von LLMs in Situationen bevorzugt, in denen optimale Strategien durch überwachtes Lernen nicht offensichtlich sind. Dazu gehören Aufgaben, bei denen bestimmte Messwerte ohne leicht verfügbare Ground-Truth-Labels optimiert werden sollen, bei denen die Übereinstimmung mit menschlichen Präferenzen entscheidend ist (und eine Bewertungsmethode vorhanden ist) und bei denen es sich um Aufgaben mit hohem Bedarf an logischem Denken handelt, die von iterativer Verbesserung und Erkundung profitieren.

Im Folgenden finden Sie einige Szenarien, in denen die Feinabstimmung mit Reinforcement Learning bevorzugt wird:

  • Befolgen komplexer Anweisungen:Wenn das Modell komplizierte Anweisungen befolgen muss, bei denen die „richtige“ Ausgabe keine einzelne Antwort ist, sondern eine Reihe von Prüfungen erfordert. Durch Reinforcement Learning kann das Modell lernen, mit diesen komplexen Anweisungssätzen umzugehen.

  • Generierung kreativer Inhalte:Für Aufgaben wie das Verfassen von kreativen Texten, Gedichten oder hochspezialisiertem Code, bei denen objektive Messwerte schwer zu definieren sind. Bestärkendes Lernen mit einer gut konzipierten Belohnungsfunktion (die möglicherweise menschliches Feedback oder eine Expertenbewertung beinhaltet) kann das Modell zu wünschenswerteren und innovativeren Ergebnissen führen.

  • Aufgaben, die viel Schlussfolgerung erfordern:Bei Aufgaben, die viel Schlussfolgerung erfordern, z. B. beim Lösen von Worträtseln oder mathematischen Problemen, kann das Modell durch Reinforcement Learning dazu angeregt werden, verschiedene „Gedanken“-Sequenzen zu untersuchen, um zu lernen, welche Muster von Schlussfolgerungen am effektivsten sind, um Probleme zu lösen.

Unterstützte Modelle und Regionen

Die folgenden Gemini-Modelle unterstützen die Feinabstimmung mit Reinforcement Learning:

Gemini 3.5 Flash

Spezifikation Wert
Unterstützte Endpunkte für die Modellabstimmung
  • us-central1 – us-central1-aiplatform.googleapis.com
  • europe-west4 – europe-west4-aiplatform.googleapis.com
Unterstützte Endpunkte für die Bereitstellung von feinabgestimmten Modellen
  • us Multiregionaler Endpunkt (aiplatform.us.rep.googleapis.com) beim Optimieren in us-central1
  • eu Multiregionaler Endpunkt (aiplatform.eu.rep.googleapis.com) beim Optimieren in europe-west4
API-Version Nur die v1beta1

Unterstützte Abstimmungsmodalitäten

Für die Feinabstimmung mit Reinforcement Learning werden in Ihren Abstimmungs-Datasets die folgenden Datenmodalitäten unterstützt:

  • Text
  • Audio
  • Bild
  • Video

Informationen zu den Dataset-Limits pro Modalität (z. B. maximale Anzahl von Dateien pro Prompt, maximale Dateigröße und maximale Gesamtlänge) finden Sie auf der Seite Abstimmungs-Dataset.

Kontinuierliche Optimierung

Sie können die Ausgabe eines vorherigen Tuning-Jobs als Grundlage für einen neuen Reinforcement-Learning-Fine-Tuning-Job verwenden. Die folgenden Muster für das kontinuierliche Optimieren werden unterstützt:

  • Überwachte Feinabstimmung → Abstimmung für Reinforcement Learning
  • Reinforcement Learning-Abstimmung → Reinforcement Learning-Abstimmung

Weitere Informationen zur Konfiguration finden Sie auf der Seite Kontinuierliches Optimieren.

Abgestimmtes Modell bereitstellen

Nach einem erfolgreichen Fine-Tuning-Job für das Basis-Gemini-Modell mit Reinforcement Learning wird ein abgestimmtes Modell, das auf dem letzten Prüfpunkt basiert, auf einem Endpunkt in Ihrem Projekt bereitgestellt. Für abgestimmte Modelle wird dieselbe Strategie für die Bereitstellung von Endpunkten wie für das Basismodell verwendet. Wenn Sie beispielsweise einen Abstimmungsjob in us-central1 ausführen, wird das abgestimmte Modell an einem multiregionalen Endpunkt (mREP) us bereitgestellt.

Informationen zum Abrufen des bereitgestellten Endpunkts für das feinabgestimmte Modell und zum Ausführen der Inferenz finden Sie auf der Seite Kurzanleitung.

Preise

Preise für das Tuning

Bei der Abstimmung für Reinforcement Learning für Gemini werden Tokens in zwei Phasen generiert: einer Sampling-Phase und einer Trainingsphase. Tokens, die während der Trainingsphase generiert werden, werden gemäß dem Abschnitt „Modelloptimierung“ auf der Seite Preise für die Gemini Enterprise Agent Platform abgerechnet.

Preise für Inferenz

Nach der Abstimmung fallen aber Inferenzkosten (Vorhersageanfrage) für das feinabgestimmte Modell an. Für die Modellinferenz ab Gemini 3 beträgt der Vorhersagepreis für den Endpunkt des feinabgestimmten Modells das 1, 5‑Fache des Preises des Basismodells. Weitere Informationen finden Sie unter Verfügbare stabile Gemini-Modellversionen.

Wenn Sie den Gen AI Evaluation Service so konfigurieren, dass er während der Abstimmung automatisch ausgeführt wird, werden Bewertungen als Batch-Vorhersagejobs abgerechnet. Weitere Informationen finden Sie im Abschnitt „Modelloptimierung“ auf der Seite Gemini Enterprise Agent Platform-Preise.

Nächste Schritte