Os modelos de pensamento são treinados para gerar um "processo de pensamento" interno antes de produzir uma resposta. Como resultado, os modelos de pensamento são capazes de raciocínio mais forte, planejamento de várias etapas, resolução de problemas matemáticos e geração de código do que modelos sem recursos de pensamento.
O processo de raciocínio é ativado por padrão em todos os modelos do Gemini. Ao usar o Agent Studio na Gemini Enterprise Agent Platform, você pode conferir todo o processo de pensamento junto com a resposta gerada do modelo.
Modelos compatíveis
O recurso de pensamento é compatível com os seguintes modelos:
Clique para abrir os modelos compatíveis
- Gemini Omni Flash
- Gemini Omni 1.1 Flash
- Gemini 3.7 Flash
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
- Gemini 3.5 Flash
- Gemini 3.1 Pro
- Imagem do Gemini 3.1 Flash-Lite (Nano Banana 2 Lite)
- Gemini 3.1 Flash-Lite
- Criação de imagens do Gemini 3.1 Flash
- Gemini 3 Pro Image
- Gemini 3 Flash
- Gemini 2.5 Pro
- Gemini 2.5 Flash-Lite
- Gemini 2.5 Flash
Controlar o raciocínio do modelo
Você pode controlar a quantidade de raciocínio que o modelo faz antes de retornar uma resposta. O método para controlar o pensamento varia de acordo com a versão do modelo.
Modelos do Gemini 3 e mais recentes
Os modelos do Gemini 3 introduzem o parâmetro thinking_level, que simplifica a configuração do orçamento de pensamento em níveis discretos. Para respostas mais rápidas e com menor latência quando não é necessário um raciocínio complexo, é possível restringir o thinking_level do modelo.
A tabela a seguir resume quais valores de thinking_level são compatíveis com cada modelo e o thinking_level padrão de cada um:
| Modelo | thinking_level: valores aceitos: |
Padrão |
|---|---|---|
| Gemini 3.7 Flash | LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.6 Flash | MINIMAL, LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.5 Flash Lite | MINIMAL, LOW, MEDIUM, HIGH |
MINIMAL |
| Gemini 3.5 Flash | MINIMAL, LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.1 Pro | LOW, MEDIUM, HIGH |
HIGH |
| Imagem do Gemini 3.1 Flash-Lite (Nano Banana 2 Lite) | MINIMAL, HIGH |
MINIMAL |
| Gemini 3.1 Flash-Lite | MINIMAL, LOW, MEDIUM, HIGH |
MINIMAL |
| Imagem do Gemini 3.1 Flash | MINIMAL, HIGH |
MINIMAL |
| Gemini 3 Pro Image | HIGH |
HIGH |
| Gemini 3 Flash | MINIMAL, LOW, MEDIUM, HIGH |
HIGH |
MINIMAL: restringe o modelo a usar o mínimo possível de tokens para pensar e é mais adequado para tarefas de baixa complexidade que não se beneficiariam de um raciocínio extenso. Esse é o nível padrão do Gemini 3.1 Flash-Lite.MINIMALé o mais próximo possível de um orçamento zero para pensar, mas ainda requer assinaturas de pensamento. Se assinaturas de pensamento não forem fornecidas na sua solicitação, o modelo vai retornar um erro400. Para mais informações, consulte Assinaturas de pensamento.from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3-flash-preview", contents="How does AI work?", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.MINIMAL ) ), ) print(response.text)LOW: restringe o modelo a usar menos tokens para pensar e é adequado para tarefas mais simples em que não é necessário um raciocínio extenso. OLOWé ideal para tarefas de alta capacidade de processamento em que a velocidade é essencial:from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3.5-flash", contents="How does AI work?", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.LOW ) ), ) print(response.text)MEDIUM: oferece uma abordagem equilibrada adequada para tarefas de complexidade moderada que se beneficiam do raciocínio, mas não exigem planejamento profundo e de várias etapas. Ela oferece mais capacidade de raciocínio do queLOWe mantém uma latência menor do queHIGH:from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3-flash-preview", contents="How does AI work?", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.MEDIUM ) ), ) print(response.text)HIGH: permite que o modelo use mais tokens para pensar e é adequado para comandos complexos que exigem raciocínio profundo, como planejamento de várias etapas, geração de código verificada ou cenários avançados de chamada de função. Esse é o nível padrão para os modelos Gemini 3 Pro e Gemini 3 Flash. Use essa configuração ao substituir tarefas que antes dependiam de modelos de raciocínio especializados:from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3.5-flash", contents="Find the race condition in this multi-threaded C++ snippet: [code here]", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.HIGH ) ), ) print(response.text)
Não é possível desativar o Raciocínio para o Gemini 3 Pro e o Gemini 3.1 Pro.
Se você especificar thinking_level e thinking_budget na mesma solicitação
para um modelo do Gemini 3, o modelo vai retornar um erro.
Modelos Gemini 2.5 e anteriores
Para modelos anteriores ao Gemini 3, é possível controlar o raciocínio usando o parâmetro thinking_budget, que define um limite máximo para o número de tokens que o modelo pode usar no processo de raciocínio. Por padrão, se thinking_budget não estiver definido, o modelo vai controlar automaticamente o quanto ele pensa,até um máximo de 8.192 tokens. Para usar o orçamento dinâmico pela API, defina thinking_budget como
-1.
Você pode definir manualmente thinking_budget para impor um limite máximo flexível no número de tokens em situações em que talvez seja necessário mais ou menos tokens do que o orçamento de pensamento padrão. Você pode definir um limite de token mais baixo para tarefas menos complexas ou um limite mais alto para tarefas mais complexas. Esse é um limite flexível. Portanto, pode haver variabilidade no total de tokens de pensamento. Se a latência for mais importante, use um orçamento menor ou defina o orçamento como 0 para evitar que o conteúdo de pensamento seja retornado com a resposta.
A tabela a seguir mostra os valores mínimos e máximos que você pode definir para o
thinking_budget em cada modelo compatível, além do orçamento de pensamento padrão
para cada modelo:
| Modelo | Valor mínimo de token | Quantidade máxima de tokens | Padrão |
|---|---|---|---|
| Gemini 2.5 Flash | 1 | 24.576 | Automático (até 8.192 tokens) |
| Gemini 2.5 Pro | 128 | 32.768 | Automático (até 8.192 tokens) |
| Gemini 2.5 Flash Lite | 512 | 24.576 | Automático (até 8.192 tokens) |
Se você definir thinking_budget como 0 ao usar o Gemini 2.5 Flash e o
Gemini 2.5 Flash-Lite, nenhum conteúdo de pensamento será retornado com a
resposta. No entanto, o texto de estilo de raciocínio ainda pode estar presente na saída do modelo. Não é possível desativar o recurso de pensamento do Gemini 2.5 Pro.
Se você usar o parâmetro thinking_level com um modelo anterior ao Gemini 3, o
modelo vai retornar um erro.
Console
- Abra Agent Studio > Criar comando.
- No painel Modelo, clique em Mudar modelo e selecione um dos modelos compatíveis no menu.
- Selecione Manual no seletor suspenso Orçamento de pensamento e use o controle deslizante para ajustar o limite.
Python
Instalar
pip install --upgrade google-genai
Para saber mais, consulte a documentação de referência do SDK.
Defina variáveis de ambiente para usar o SDK de IA generativa do Google com a Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Node.js
Instalar
npm install @google/genai
Para saber mais, consulte a documentação de referência do SDK.
Defina variáveis de ambiente para usar o SDK de IA generativa do Google com a Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Go
Saiba como instalar ou atualizar o Go.
Para saber mais, consulte a documentação de referência do SDK.
Defina variáveis de ambiente para usar o SDK de IA generativa do Google com a Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Java
Saiba como instalar ou atualizar o Java.
Para saber mais, consulte a documentação de referência do SDK.
Defina variáveis de ambiente para usar o SDK de IA generativa do Google com a Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Ver resumos de raciocínio
Os resumos de raciocínio fornecem visibilidade das etapas de raciocínio intermediárias que o modelo realizou ao gerar uma resposta. É possível ver resumos de ideias no Gemini 2.5 e em modelos mais recentes.
No Agent Studio, os resumos de raciocínio ficam ativados por padrão e podem ser acessados ao abrir o painel Raciocínios.
Ao usar a API, é possível ativar os resumos de ideias definindo
include_thoughts=True no seu ThinkingConfig:
Console
Os resumos de ideias são ativados por padrão no Agent Studio. É possível conferir o processo de pensamento resumido do modelo expandindo o painel Pensamentos.
Python
Instalar
pip install --upgrade google-genai
Para saber mais, consulte a documentação de referência do SDK.
Defina variáveis de ambiente para usar o SDK de IA generativa do Google com a Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Node.js
Instalar
npm install @google/genai
Para saber mais, consulte a documentação de referência do SDK.
Defina variáveis de ambiente para usar o SDK de IA generativa do Google com a Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Go
Saiba como instalar ou atualizar o Go.
Para saber mais, consulte a documentação de referência do SDK.
Defina variáveis de ambiente para usar o SDK de IA generativa do Google com a Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Java
Saiba como instalar ou atualizar o Java.
Para saber mais, consulte a documentação de referência do SDK.
Defina variáveis de ambiente para usar o SDK de IA generativa do Google com a Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Uma resposta pode conter uma assinatura de pensamento sem um texto de resumo do pensamento nos seguintes cenários:
- Solicitações de baixa complexidade: o modelo exigiu etapas mínimas de raciocínio para formular a resposta.
- Resumos desativados: os resumos de ideias não foram solicitados ou foram desativados explicitamente.
- Modalidades de raciocínio não textuais: algumas modalidades (como processamento de imagens) podem não emitir resumos de texto.
Seu aplicativo precisa sempre processar normalmente respostas em que o conteúdo do resumo do pensamento está ausente ou vazio, preservando as assinaturas de pensamento associadas.
Assinaturas de raciocínio
As assinaturas de pensamento são representações criptografadas do processo de pensamento interno do modelo que preservam o estado de raciocínio do Gemini durante conversas multiturno, especialmente ao usar chamada de função.
Para garantir que o modelo mantenha o contexto completo em várias trocas de uma conversa, retorne as assinaturas de pensamento das respostas anteriores nas solicitações subsequentes, independente do nível de raciocínio usado. Se você estiver usando o SDK de IA Generativa do Google (Python, Node.js, Go ou Java) e os recursos padrão de histórico de conversas ou anexando a resposta completa do modelo ao histórico, as assinaturas de pensamento serão processadas automaticamente.
Para regras detalhadas, exemplos e padrões de fluxo de trabalho multiturno, consulte Assinaturas de pensamento.
Técnicas de criação de comandos
Um design de comandos eficaz ajuda a direcionar o raciocínio do modelo, reservar o orçamento de tokens e alcançar a qualidade ideal de saída com modelos de pensamento.
Para estratégias abrangentes, padrões de várias tentativas, comandos de verificação e dicas de depuração, consulte o guia de comandos de raciocínio.
Preços
Você recebe cobranças pelos tokens gerados durante o processo de pensamento de um modelo. Para alguns modelos, como o Gemini 3 Pro e o Gemini 2.5 Pro, o raciocínio é ativado por padrão, e você recebe uma cobrança por esses tokens.
Para mais informações, consulte os preços da Agent Platform. Para saber como gerenciar custos, consulte Controlar o raciocínio do modelo.
A seguir
Assinaturas de raciocínio
Aprenda a preservar o estado de raciocínio do Gemini durante conversas multiturno e de várias etapas usando assinaturas de pensamento.
Guia de comandos para pensar
Conheça técnicas e práticas recomendadas de engenharia de comando personalizadas para os modelos de raciocínio do Gemini.