Nesta página, você encontra uma lista de cotas por região e modelo e aprende a acessar e editar suas cotas no console do Google Cloud .
Cotas de modelos ajustados
A inferência de modelo ajustado compartilha a mesma cota do modelo de base. Não há uma cota separada para inferência de modelos ajustados.
Limites de incorporação
As solicitações degemini-embedding-001 estão sujeitas a cotas regionais, enquanto as de gemini-embedding-2 estão sujeitas a cotas globais.
| Modelo base | Cota | Métrica |
|---|---|---|
| base_model: gemini-embedding | 100.000.000 | aiplatform.googleapis.com/embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding-2 | 200.000.000 | aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding-2 | 60.000 | aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model |
As solicitações de gemini-embedding-001 usando a API predict também estão sujeitas às seguintes cotas:
| Modelo base | Cota | Métrica |
|---|---|---|
| base_model: gemini-embedding | 100.000 | aiplatform.googleapis.com/online_prediction_requests_per_base_model |
| base_model: N/A | 30.000 | aiplatform.googleapis.com/online_prediction_requests |
Cotas do Agent Runtime
As cotas a seguir se aplicam ao Agent Runtime para um determinado projeto em cada região:| Descrição | Cota | Métrica |
|---|---|---|
| Criar, excluir ou atualizar recursos do Agent Runtime por minuto | 10 | aiplatform.googleapis.com/reasoning_engine_service_write_requests |
| Criar, excluir ou atualizar sessões do Agent Runtime por minuto | 100 | aiplatform.googleapis.com/session_write_requests |
| Receber, listar ou recuperar sessões do Agent Runtime por minuto | 10000 | aiplatform.googleapis.com/session_read_requests |
Query ou StreamQuery Agent Runtime por minuto
|
90 | aiplatform.googleapis.com/reasoning_engine_service_query_requests |
| Anexar evento às sessões por minuto do Agent Runtime | 300 | aiplatform.googleapis.com/session_event_append_requests |
| Número máximo de recursos do Agent Runtime | 100 | aiplatform.googleapis.com/reasoning_engine_service_entities |
| Criar, excluir ou atualizar recursos de memória do Agent Runtime por minuto | 100 | aiplatform.googleapis.com/memory_bank_write_requests |
| Receber, listar ou recuperar do Memory Bank do Agent Runtime por minuto | 300 | aiplatform.googleapis.com/memory_bank_read_requests |
| Solicitações de execução por minuto no ambiente de sandbox (execução de código) | 1000 | aiplatform.googleapis.com/sandbox_environment_execute_requests |
| Entidades do ambiente de sandbox (execução de código) por região | 1000 | aiplatform.googleapis.com/sandbox_environment_entities |
| Solicitações de gravação por minuto no ambiente de sandbox (execução de código) | 500 | aiplatform.googleapis.com/sandbox_environment_write_requests |
Solicitações POST do agente A2A, como sendMessage e cancelTask, por minuto
|
60 | aiplatform.googleapis.com/a2a_agent_post_requests |
Solicitações GET do agente A2A, como getTask e getCard, por minuto
|
600 | aiplatform.googleapis.com/a2a_agent_get_requests |
Conexões bidirecionais simultâneas em tempo real usando a API BidiStreamQuery por minuto
|
10 |
aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests
|
Cotas de entrada multimodal
As cotas a seguir se aplicam à entrada multimodal para solicitações degenerateContent
e streamGenerateContent para um determinado projeto em cada
região. Cada cota é aplicada por modelo de base e resolução. Os mesmos limites se aplicam a solicitações atendidas pelo endpoint global, usando a métrica ..._global correspondente.
| Descrição | Cota | Métrica |
|---|---|---|
| Solicitações de geração de conteúdo com entrada de imagem por minuto, por modelo de base e por resolução | 34.000.000 | aiplatform.googleapis.com/generate_content_image_input_per_base_model_id_and_resolution |
| Solicitações de geração de conteúdo com entrada de vídeo por minuto, por modelo de base e por resolução | 192.000.000 | aiplatform.googleapis.com/generate_content_video_input_per_base_model_id_and_resolution |
| Solicitações de geração de conteúdo com entrada de áudio por minuto, por modelo de base e por resolução | 11.000.000 | aiplatform.googleapis.com/generate_content_audio_input_per_base_model_id_and_resolution |
| Gerar solicitações de conteúdo com entrada de documento por minuto, por modelo de base e por resolução | 1.200.000 | aiplatform.googleapis.com/generate_content_document_input_per_base_model_id_and_resolution |
Para solicitar um limite maior para essas cotas, entre em contato com a equipe da sua conta do Google Cloud. Não é possível aumentar esses limites no console Google Cloud .
Inferência em lote
As cotas e os limites para jobs de inferência em lote são os mesmos em todas as regiões.Limites de jobs simultâneos de inferência em lote para modelos do Gemini
Não há limites de cota predefinidos para inferência em lote para modelos do Gemini. Em vez disso, o serviço de lotes oferece acesso a um grande pool compartilhado de recursos, alocados dinamicamente com base na disponibilidade e demanda em tempo real do modelo em todos os clientes. Quando mais clientes estão ativos e saturam a capacidade do modelo, suas solicitações em lote podem ser colocadas em fila por capacidade.Cotas de jobs de inferência em lote simultâneos para modelos que não são do Gemini
A tabela a seguir lista as cotas para o número de jobs de inferência em lote simultâneos, que não se aplicam aos modelos do Gemini:| Cota | Valor |
|---|---|
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs |
4 |
Ver e editar as cotas no console do Google Cloud
Para ver e editar as cotas no console do Google Cloud , faça o seguinte:- Acesse a página Cotas e limites do sistema.
- Para ajustar a cota, copie e cole a propriedade
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobsno Filtro. Pressione Enter. - Clique nos três pontos no final da linha e selecione Editar cota.
- Insira um novo valor de cota no painel e clique em Enviar solicitação.
Acesse "Cotas e limites do sistema"
Cotas da política de governança semântica
As cotas a seguir se aplicam à política de governança semântica para um determinado projeto em cada região:| Descrição | Cota | Métrica |
|---|---|---|
| Receber ou listar recursos de política de governança semântica por minuto | 600 | aiplatform.googleapis.com/semantic_governance/policy_read_requests |
| Criar, atualizar ou excluir recursos de política de governança semântica por minuto | 60 | aiplatform.googleapis.com/semantic_governance/policy_write_requests |
| Acessar recursos do mecanismo de política de governança semântica por minuto | 600 | aiplatform.googleapis.com/semantic_governance/engine_read_requests |
| Atualizar ou desprovisionar recursos do mecanismo de política de governança semântica por minuto | 60 | aiplatform.googleapis.com/semantic_governance/engine_write_requests |
| Número de recursos de política de governança semântica por projeto e local. | 1.000 | aiplatform.googleapis.com/semantic_governance/policy_count |
Ver e editar as cotas no console do Google Cloud
Para ver e editar as cotas no console do Google Cloud , faça o seguinte:- Acesse a página Cotas e limites do sistema.
- Para ajustar a cota, copie e cole a propriedade
aiplatform.googleapis.com/semantic_governance/policy_write_requestsno Filtro. Pressione Enter. - Clique nos três pontos no final da linha e selecione Editar cota.
- Insira um novo valor de cota no painel e clique em Enviar solicitação.
Acesse "Cotas e limites do sistema"
Mecanismo RAG na Gemini Enterprise Agent Platform
Para que cada serviço realize a geração aumentada por recuperação (RAG) usando o Mecanismo RAG, as cotas a seguir se aplicam, com a cota medida como solicitações por minuto (RPM).| Serviço | Cota | Métrica |
|---|---|---|
| APIs de gerenciamento de dados do mecanismo RAG | 60 RPM | VertexRagDataService requests per minute per region |
API RetrievalContexts |
600 RPM | VertexRagService retrieve requests per minute per region |
base_model: textembedding-gecko |
1.500 RPM | Online prediction requests per base model per minute per region per base_modelOutro filtro que você pode especificar é base_model: textembedding-gecko |
| Serviço | Limite | Métrica |
|---|---|---|
Solicitações simultâneas de ImportRagFiles |
3 RPM | VertexRagService concurrent import requests per region |
Número máximo de arquivos por solicitação ImportRagFiles |
10.000 | VertexRagService import rag files requests per region |
Serviço de avaliação de IA generativa
O serviço de avaliação de IA generativa usa o Gemini 2.5 Flash como um modelo de avaliação padrão para métricas baseadas em modelo. Uma única solicitação de avaliação para uma métrica baseada em modelo pode resultar em várias solicitações subjacentes ao serviço de avaliação de IA generativa. O consumo de cada modelo é calculado no nível da organização, o que significa que todas as solicitações direcionadas ao modelo de julgamento para inferência de modelo e avaliação baseada em modelo contribuem para o consumo do modelo. As cotas do serviço de avaliação de IA generativa e do modelo juiz subjacente são mostradas na tabela a seguir:| Cota de solicitação | Cota padrão |
|---|---|
| Solicitações do serviço de avaliação de IA generativa por minuto | 1.000 solicitações por projeto em cada região |
| Capacidade de processamento do Gemini | Depende do modelo e da opção de consumo |
| Execuções de avaliação simultâneas | 20 execuções de avaliação simultâneas por projeto e região |
Se você receber um erro relacionado a cotas ao usar o serviço de avaliação de IA generativa, talvez seja necessário registrar uma solicitação de aumento de cota. Consulte Ver e gerenciar cotas para mais informações.
| Limite | Valor |
|---|---|
| Tempo limite da solicitação de serviço de avaliação de IA generativa | 60 segundos |
Quando você usa o serviço de avaliação de IA generativa pela primeira vez em um novo projeto, pode haver um atraso na configuração inicial de até dois minutos. Se a primeira solicitação falhar, aguarde alguns minutos e tente de novo. As próximas solicitações de avaliação normalmente são concluídas em 60 segundos.
Os tokens máximos de entrada e saída para métricas baseadas em modelo dependem do modelo usado como juiz. Consulte Modelos do Google para ver uma lista de modelos.
Cotas de pipelines da Gemini Enterprise Agent Platform
Cada job de ajuste usa os pipelines da Gemini Enterprise Agent Platform. Para mais informações, consulte Cotas e limites do Agent Platform Pipelines.
A seguir
Padrão pré-pago
Saiba mais sobre o Standard PayGo, uma opção de consumo da Agent Platform que permite pagar apenas pelos recursos consumidos, sem exigir compromissos financeiros iniciais.
Cotas e limites do sistema da Agent Platform
Cotas e limites do sistema relacionados à Agent Platform, exceto cotas e limites do sistema específicos do produto.
Cotas do Google Cloud
Saiba como o Google Cloud restringe a quantidade de um recurso que seu projeto na nuvem do Google Cloud pode usar e como as cotas se aplicam a vários tipos de recursos, incluindo hardware, software e componentes de rede.