Controlar os custos com cotas de token

Este documento descreve como definir e gerenciar limites diários no número de tokens de entrada e saída consumidos por funções de IA generativa.

As funções de IA generativa do BigQuery usam modelos de linguagem grandes (LLMs) para realizar análises avançadas nas consultas SQL. Como o uso de LLMs normalmente é faturado com base no número de tokens processados, o BigQuery oferece cotas de token para ajudar a gerenciar e controlar os custos associados ao uso dessas funções.

As cotas de token se aplicam às funções SQL do BigQuery projetadas para tarefas de inferência de IA generativa que usam LLMs do Gemini, como as AI.CLASSIFY e AI.GENERATE_TEXT funções. As cotas de token não se aplicam à geração de embeddings e às funções de pesquisa semântica, como AI.EMBED, que têm estruturas de faturamento diferentes.

Detalhes da cota

O BigQuery oferece as seguintes cotas diárias com base no uso de tokens de LLM. O uso de tokens está diretamente relacionado ao faturamento da Vertex AI para funções de IA generativa do BigQuery que usam modelos do Gemini. Essas cotas são rastreadas globalmente em todas as regiões.

Essas cotas de token regem o número de tokens de entrada e saída processados pelos LLMs para funções de IA generativa:

  • Tokens de entrada: tokens enviados ao modelo para processamento. Isso inclui tokens no texto do comando e quaisquer outros dados fornecidos ao modelo como entrada.
  • Tokens de saída: tokens gerados pelo modelo na resposta. Isso inclui tokens no texto gerado (tokens candidatos) e tokens gerados durante as etapas de raciocínio interno (tokens de pensamento).

Nome da cota Métrica Scope Valor padrão
GenAiInputTokensPerDay Tokens de entrada usados pelo LLM Por dia por projeto 200.000.000.000
GenAiInputTokensPerUserPerDay Tokens de entrada usados pelo LLM Por dia por usuário 40.000.000.000
GenAiOutputTokensPerDay Tokens de saída e de pensamento usados pelo LLM Por dia por projeto 20.000.000.000
GenAiOutputTokensPerUserPerDay Tokens de saída e de pensamento usados pelo LLM Por dia por usuário 4.000.000.000

Essas cotas são rastreadas em incrementos de milhões de tokens. Embora seja possível definir limites precisos, valores menores que alguns milhões de tokens podem não ser refletidos com precisão perfeita devido à natureza da geração de relatórios e da agregação de tokens.

Os tokens armazenados em cache não são contabilizados nas cotas.

Gerenciar cotas

Dependendo do uso de recursos, talvez seja necessário visualizar ou ajustar os valores da cota de token para cima ou para baixo. É possível usar o Google Cloud console para realizar essas tarefas:

  1. No Google Cloud console, acesse a página IAM e administração > Cotas e limites do sistema.

    Acesse "Cotas e limites do sistema

  2. Filtre as cotas inserindo Service: BigQuery API.

  3. Pesquise uma cota específica na lista de cotas (por exemplo, pesquise GenAiInputTokensPerDay).

  4. Clique em Editar.

  5. Aumente ou diminua a cota no painel Alterações de cota inserindo um novo valor.

  6. Clique em Enviar solicitação.

Comportamento de aplicação de cota

O BigQuery monitora o consumo de tokens em várias etapas da execução da consulta:

  • Verificação pré-execução:o BigQuery verifica a cota de token disponível antes de executar uma consulta que contém funções de IA generativa. Se a cota relevante (por exemplo, tokens de entrada diários do projeto) já estiver esgotada, a consulta será rejeitada com um erro QuotaExceeded.
  • Durante a execução:se uma consulta estiver em execução e consumir tokens de forma que esgote qualquer uma das cotas configuradas (entrada ou saída, por projeto ou por usuário), novas chamadas de LLM nessa consulta serão rejeitadas.
    • Todas as linhas restantes que dependem de chamadas de LLM encontram um erro de esgotamento de cota.
    • O resultado da consulta depende do argumento max_error_ratio se usado em funções como AI.IF. Se a taxa de erros permanecer dentro do limite permitido, resultados parciais poderão ser retornados. Caso contrário, toda a consulta falhará.
    • As consultas subsequentes que tentarem usar funções de IA generativa vão falhar com um erro QuotaExceeded até que a cota diária seja redefinida.

Considerações importantes

  • Cotas globais:as cotas definidas são globais. O uso de tokens é agregado em todas as regiões em que o projeto opera, fornecendo um mecanismo unificado de controle de custos. Isso evita cobranças inesperadas de uso em diferentes regiões.
  • Taxa de transferência provisionada:se você estiver usando modelos da Gemini Enterprise Agent Platform com taxa de transferência provisionada, o faturamento não será baseado no uso de tokens. Defina essas cotas de token do BigQuery com um valor alto para evitar o bloqueio desnecessário das consultas.

A seguir