Batchinferenz mit Gemini

Mit der Batchinferenz von Gemini (früher als Batch-Vorhersage bezeichnet) erhalten Sie asynchrone, kostengünstige Inferenz mit hohem Durchsatz für Ihre Anforderungen an die Verarbeitung großer Datenmengen. In diesem Leitfaden erfahren Sie mehr über den Wert der Batch-Inferenz, ihre Funktionsweise, ihre Einschränkungen und Best Practices für optimale Ergebnisse.

Vorteile von Batch-Inferenz

In vielen realen Szenarien ist keine sofortige Antwort von einem Sprachmodell erforderlich. Stattdessen haben Sie möglicherweise einen großen Datensatz mit Prompts, den Sie effizient und kostengünstig verarbeiten müssen. Hier spielt die Batch-Inferenz ihre Stärke aus.

Die wichtigsten Vorteile:

  • Kosteneffizienz:Die Batchverarbeitung wird mit einem Rabatt von 50% im Vergleich zur Echtzeitinferenz angeboten. Sie eignet sich daher ideal für umfangreiche, nicht dringende Aufgaben. Implizites Caching ist standardmäßig für Gemini 2.5- und Gemini 3-Modelle aktiviert. Durch das implizite Caching erhalten Sie einen Rabatt von 90% auf im Cache gespeicherte Tokens im Vergleich zu Standard-Eingabetokens. Die Rabatte für Cache und Batch lassen sich jedoch nicht kombinieren. Der Rabatt für 90% Cache-Treffer hat Vorrang vor dem Batch-Rabatt.
  • Hohe Ratenbegrenzungen: Verarbeiten Sie Hunderttausende von Anfragen in einem einzigen Batch mit einer höheren Ratenbegrenzung als bei der Echtzeit-Gemini API.
  • Vereinfachter Workflow: Anstatt eine komplexe Pipeline mit einzelnen Echtzeitanfragen zu verwalten, können Sie einen einzelnen Batchjob senden und die Ergebnisse abrufen, sobald die Verarbeitung abgeschlossen ist. Der Dienst übernimmt die Formatvalidierung, parallelisiert Anfragen für die gleichzeitige Verarbeitung und versucht automatisch, eine hohe Abschlussrate mit einer Bearbeitungszeit von 24 Stunden zu erreichen.

Die Batchinferenz ist für umfassende Verarbeitungsaufgaben wie die folgenden optimiert:

  • Inhaltsgenerierung:Generieren Sie Produktbeschreibungen, Beiträge für soziale Medien oder andere kreative Texte in großen Mengen.
  • Datenannotation und ‑klassifizierung:Nutzerrezensionen klassifizieren, Dokumente kategorisieren oder Sentimentanalysen für große Textmengen durchführen.
  • Offline-Analyse:Sie können Artikel zusammenfassen, wichtige Informationen aus Berichten extrahieren oder Dokumente in großem Umfang übersetzen lassen.

Gemini-Modelle, die Batch-Inferenz unterstützen

Die folgenden Basis- und abgestimmten Gemini-Modelle unterstützen die Batchinferenz:

Klicken Sie, um unterstützte Modelle zu maximieren.

Unterstützung von Modellen für globale Endpunkte

Die Batch-Inferenz unterstützt die Verwendung des globalen Endpunkts für die Basismodelle von Gemini. Der globale Endpunkt für abgestimmte Gemini-Modelle wird nicht unterstützt.

Der globale Endpunkt trägt zur Verbesserung der allgemeinen Verfügbarkeit bei, da Ihre Anfragen von jeder Region aus bearbeitet werden, die vom verwendeten Modell unterstützt wird. Hinweis: Anforderungen an den Datenstandort werden nicht unterstützt. Wenn Sie Anforderungen an den Datenstandort haben, verwenden Sie die regionalen Endpunkte.

Kontingente und Limits

Die Batchinferenz ist zwar leistungsstark, aber es ist wichtig, sich der folgenden Einschränkungen bewusst zu sein.

  • Quota: Für Ihre Nutzung gibt es keine vordefinierten Kontingentlimits. Stattdessen bietet der Batch-Dienst Zugriff auf einen großen, gemeinsamen Ressourcenpool, der dynamisch auf Grundlage der Verfügbarkeit von Ressourcen und der Echtzeit-Nachfrage aller Kunden dieses Modells zugewiesen wird. Wenn mehr Kunden aktiv sind und unsere Kapazität ausgelastet ist, werden Ihre Batchanfragen möglicherweise in die Warteschlange gestellt.
  • Wartezeit: Wenn unser Dienst stark ausgelastet ist, wird Ihr Batchjob in die Warteschlange eingereiht, bis Kapazität verfügbar ist. Der Job bleibt bis zu 72 Stunden in der Warteschlange, bevor er abläuft.
  • Anfragelimits: Ein einzelner Batchjob kann bis zu 200.000 Anfragen enthalten. Wenn Sie Cloud Storage als Eingabe verwenden, gilt außerdem ein Dateigrößenlimit von 1 GB.
  • Verarbeitungszeit: Batchjobs werden asynchron verarbeitet und sind nicht für Echtzeitanwendungen konzipiert. Die meisten Jobs werden innerhalb von 24 Stunden nach Beginn der Ausführung abgeschlossen (Warteschlange nicht eingerechnet). Nach 24 Stunden werden unvollständige Aufträge abgebrochen und Sie werden nur für abgeschlossene Anfragen belastet.
  • Abgebrochene Jobs: Sie können Batchinferenzjobs jederzeit abbrechen. Wenn Sie einen Job abbrechen, wird die verbleibende Arbeit abgebrochen und die bereits erledigte Arbeit zurückgegeben. Ihnen wird nur die erledigte Arbeit in Rechnung gestellt.
  • Nicht unterstützte Funktionen: Die Batchinferenz unterstützt keinen bereitgestellten Durchsatz, kein explizites Caching und kein RAG. Implizites Caching für Batch-Inferenz wird in Gemini 2.0 Flash und Gemini 2.0 Flash-Lite nicht unterstützt.
  • Bildausgabe: Die Batchinferenz ist auf die Standardauflösung von 1.000 Pixeln begrenzt. 2K- und 4K-Ausgaben werden nicht unterstützt.

Best Practices

Damit Sie Batchinferenz mit Gemini optimal nutzen können, empfehlen wir die folgenden Best Practices:

  • Jobs kombinieren:Um den Durchsatz zu maximieren, sollten Sie kleinere Jobs innerhalb der Systemlimits zu einem großen Job kombinieren. Wenn Sie beispielsweise einen Batchjob mit 200.000 Anfragen senden, erzielen Sie einen besseren Durchsatz als bei 1.000 Jobs mit jeweils 200 Anfragen.
  • Jobstatus überwachen:Sie können den Jobfortschritt über die API, das SDK oder die Benutzeroberfläche überwachen. Weitere Informationen finden Sie unter Jobstatus beobachten. Wenn ein Job fehlschlägt, sehen Sie sich die Fehlermeldungen an, um das Problem zu diagnostizieren und zu beheben.
  • Kosten optimieren:Nutzen Sie die Kosteneinsparungen, die durch die Batchverarbeitung für alle Aufgaben erzielt werden, die keine sofortige Antwort erfordern.

Nächste Schritte