Kosten mit Token-Kontingenten kontrollieren

In diesem Dokument wird beschrieben, wie Sie tägliche Limits für die Anzahl der von generativen KI-Funktionen verwendeten Eingabe- und Ausgabetokens definieren und verwalten können.

Für die generativen KI-Funktionen von BigQuery werden Large Language Models (LLMs) verwendet, um erweiterte Analysen in Ihren SQL-Abfragen durchzuführen. Da die Nutzung von LLMs in der Regel auf Grundlage der Anzahl der verarbeiteten Tokens abgerechnet wird, bietet BigQuery Tokenkontingente, mit denen Sie die Kosten für die Verwendung dieser Funktionen verwalten und kontrollieren können.

Die Tokenkontingente gelten für BigQuery-SQL-Funktionen, die für generative KI-Inferenzaufgaben mit Gemini-LLMs entwickelt wurden, z. B. die Funktionen AI.CLASSIFY und AI.GENERATE_TEXT. Die Tokenkontingente gelten nicht für Funktionen zur Generierung von Einbettungen und zur semantischen Suche, z. B. AI.EMBED, für die andere Abrechnungsstrukturen gelten.

Kontingentdetails

BigQuery bietet die folgenden täglichen Kontingente basierend auf der LLM-Tokennutzung. Die Tokennutzung steht in direktem Zusammenhang mit der Vertex AI-Abrechnung für generative KI-Funktionen in BigQuery, die Gemini-Modelle verwenden. Diese Kontingente werden global in allen Regionen erfasst.

Diese Tokenkontingente regeln die Anzahl der Eingabe- und Ausgabetokens, die von den LLMs für generative KI-Funktionen verarbeitet werden:

  • Eingabetokens: Tokens, die zur Verarbeitung an das Modell gesendet werden. Dazu gehören Tokens im Prompt-Text und alle anderen Daten, die dem Modell als Eingabe zur Verfügung gestellt werden.
  • Ausgabetokens: Tokens, die vom Modell in seiner Antwort generiert werden. Dazu gehören Tokens im generierten Text (Kandidaten-Tokens) und Tokens, die während interner Begründungsschritte generiert werden (Thought-Tokens).

Kontingentname Messwert Bereich Standardwert
GenAiInputTokensPerDay Vom LLM verwendete Eingabetokens Pro Tag und Projekt 200.000.000.000
GenAiInputTokensPerUserPerDay Vom LLM verwendete Eingabetokens Pro Tag und Nutzer 150.000.000.000
GenAiOutputTokensPerDay Vom LLM verwendete Ausgabe- und Denk-Tokens Pro Tag und Projekt 20.000.000.000
GenAiOutputTokensPerUserPerDay Vom LLM verwendete Ausgabe- und Denk-Tokens Pro Tag und Nutzer 15.000.000.000

Diese Kontingente werden in Schritten von Millionen von Tokens erfasst. Sie können zwar genaue Limits festlegen, aber Werte, die kleiner als einige Millionen Tokens sind, werden aufgrund der Art der Tokenberichterstellung und ‑aggregation möglicherweise nicht ganz genau wiedergegeben.

Zwischengespeicherte Tokens werden nicht auf die Kontingente angerechnet.

Kontingente verwalten

Je nach Ressourcennutzung möchten Sie die Kontingentwerte für Tokens möglicherweise ansehen oder nach oben oder unten anpassen. Mit der Google Cloud Console können Sie folgende Aufgaben ausführen:

  1. Rufen Sie in der Google Cloud Console die Seite IAM & Verwaltung > Kontingente & Systemlimits auf.

    Zur Seite „Kontingente und Systemlimits“

  2. Filtern Sie die Kontingente, indem Sie Service: BigQuery API eingeben.

  3. Suchen Sie in der Liste der Kontingente nach einem bestimmten Kontingent (z. B. nach GenAiInputTokensPerDay).

  4. Klicken Sie auf Bearbeiten.

  5. Erhöhen oder verringern Sie das Kontingent im Bereich Kontingentänderungen, indem Sie einen neuen Wert eingeben.

  6. Klicken Sie auf Anfrage senden.

Verhalten bei der Kontingenterzwingung

BigQuery überwacht den Tokenverbrauch in mehreren Phasen der Abfrageausführung:

  • Prüfung vor der Ausführung:BigQuery prüft das verfügbare Tokenkontingent, bevor eine Abfrage mit generativen KI-Funktionen ausgeführt wird. Wenn das entsprechende Kontingent (z. B. tägliche Eingabetokens für das Projekt) bereits ausgeschöpft ist, wird die Anfrage mit einem QuotaExceeded-Fehler abgelehnt.
  • Während der Ausführung:Wenn eine Abfrage ausgeführt wird und Tokens verbraucht, sodass eines der konfigurierten Kontingente (Ein- oder Ausgabe, pro Projekt oder pro Nutzer) ausgeschöpft wird, werden neue LLM-Aufrufe innerhalb dieser Abfrage abgelehnt.
    • Bei allen verbleibenden Zeilen, die von LLM-Aufrufen abhängen, tritt ein Fehler aufgrund von Kontingentüberschreitung auf.
    • Das Ergebnis der Abfrage hängt vom Argument max_error_ratio ab, wenn es in Funktionen wie AI.IF verwendet wird. Wenn das Fehlerverhältnis innerhalb des zulässigen Limits bleibt, werden möglicherweise Teilergebnisse zurückgegeben. Andernfalls schlägt die gesamte Abfrage fehl.
    • Nachfolgende Abfragen, bei denen versucht wird, generative KI-Funktionen zu verwenden, schlagen mit einem QuotaExceeded-Fehler fehl, bis das Tageskontingent zurückgesetzt wird.

Was Sie bedenken sollten

  • Globale Kontingente:Die definierten Kontingente sind global. Die Tokennutzung wird für alle Regionen, in denen Ihr Projekt ausgeführt wird, zusammengefasst. So erhalten Sie einen einheitlichen Mechanismus zur Kostenkontrolle. So werden unerwartete Kosten durch die Nutzung in verschiedenen Regionen vermieden.
  • Bereitgestellter Durchsatz:Wenn Sie Modelle der Gemini Enterprise Agent Platform mit bereitgestelltem Durchsatz verwenden, erfolgt die Abrechnung nicht auf Grundlage der Tokennutzung. Sie sollten diese BigQuery-Tokenkontingente auf einen hohen Wert festlegen, um unnötige Blockierungen Ihrer Abfragen zu vermeiden.

Nächste Schritte