Los modelos de razonamiento se entrenan para generar un "proceso de pensamiento" interno antes de producir una respuesta. Como resultado, los modelos de razonamiento son capaces de realizar un razonamiento más sólido, una planificación de varios pasos, la resolución de problemas matemáticos y la generación de código que los modelos sin capacidades de razonamiento.
El proceso de pensamiento está habilitado de forma predeterminada en todos los modelos de Gemini. Cuando usas Agent Studio en Gemini Enterprise Agent Platform, puedes ver el proceso de pensamiento completo junto con la respuesta generada del modelo.
Modelos compatibles
El pensamiento es compatible con los siguientes modelos:
Haz clic para expandir los modelos compatibles
- Gemini Omni Flash
- Gemini Omni 1.1 Flash
- Gemini 3.8 Flash
- Gemini 3.7 Flash
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
- Gemini 3.5 Flash
- Gemini 3.1 Pro
- Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite)
- Gemini 3.1 Flash-Lite
- Imagen de Gemini 3.1 Flash
- Gemini 3 Pro Image
- Gemini 3 Flash
- Gemini 2.5 Pro
- Gemini 2.5 Flash-Lite
- Gemini 2.5 Flash
Controla el razonamiento del modelo
Puedes controlar la cantidad de razonamiento que realiza el modelo antes de devolver una respuesta. El método para controlar el pensamiento difiere según la versión del modelo.
Modelos de Gemini 3 y versiones posteriores
Los modelos de Gemini 3 introducen el parámetro thinking_level, que simplifica la configuración del presupuesto de razonamiento en niveles discretos. Para obtener respuestas más rápidas y con menor latencia cuando no se requiere un razonamiento complejo, puedes restringir el thinking_level del modelo.
En la siguiente tabla, se resumen los valores de thinking_level que admite cada modelo y el valor predeterminado de thinking_level para cada modelo:
| Modelo | Valores admitidos de thinking_level: |
Predeterminado |
|---|---|---|
| Gemini 3.8 Flash | LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.7 Flash | LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.6 Flash | MINIMAL, LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.5 Flash-Lite | MINIMAL, LOW, MEDIUM, HIGH |
MINIMAL |
| Gemini 3.5 Flash | MINIMAL, LOW, MEDIUM, HIGH |
MEDIUM |
| Gemini 3.1 Pro | LOW, MEDIUM, HIGH |
HIGH |
| Imagen de Gemini 3.1 Flash-Lite (Nano Banana 2 Lite) | MINIMAL, HIGH |
MINIMAL |
| Gemini 3.1 Flash-Lite | MINIMAL, LOW, MEDIUM, HIGH |
MINIMAL |
| Gemini 3.1 Flash Image | MINIMAL, HIGH |
MINIMAL |
| Gemini 3 Pro Image | HIGH |
HIGH |
| Gemini 3 Flash | MINIMAL, LOW, MEDIUM, HIGH |
HIGH |
MINIMAL: Restringe el modelo para que use la menor cantidad posible de tokens para pensar y se usa mejor para tareas de baja complejidad que no se beneficiarían de un razonamiento extenso. Este es el nivel predeterminado para Gemini 3.1 Flash-Lite.MINIMALse acerca lo más posible a un presupuesto cero para el pensamiento, pero aún requiere firmas de pensamiento. Si no se proporcionan firmas de pensamiento en la solicitud, el modelo devuelve un error400. Para obtener más información, consulta Firmas de pensamiento.from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3-flash-preview", contents="How does AI work?", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.MINIMAL ) ), ) print(response.text)LOW: Restringe el modelo para que use menos tokens para pensar y es adecuado para tareas más simples en las que no se requiere un razonamiento extenso.LOWes ideal para tareas de alta capacidad de procesamiento en las que la velocidad es esencial:from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3.5-flash", contents="How does AI work?", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.LOW ) ), ) print(response.text)MEDIUM: Ofrece un enfoque equilibrado adecuado para tareas de complejidad moderada que se benefician del razonamiento, pero no requieren una planificación profunda de varios pasos. Proporciona más capacidad de razonamiento queLOWy, al mismo tiempo, mantiene una latencia más baja queHIGH:from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3-flash-preview", contents="How does AI work?", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.MEDIUM ) ), ) print(response.text)HIGH: Permite que el modelo use más tokens para pensar y es adecuado para instrucciones complejas que requieren un razonamiento profundo, como la planificación de varios pasos, la generación de código verificado o situaciones avanzadas de llamadas a funciones. Este es el nivel predeterminado para los modelos Gemini 3 Pro y Gemini 3 Flash. Usa esta configuración cuando reemplaces tareas para las que tal vez hayas usado modelos de razonamiento especializados:from google import genai from google.genai import types client = genai.Client() response = client.models.generate_content( model="gemini-3.5-flash", contents="Find the race condition in this multi-threaded C++ snippet: [code here]", config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig( thinking_level=types.ThinkingLevel.HIGH ) ), ) print(response.text)
La función de Pensar no se puede desactivar en Gemini 3 Pro ni en Gemini 3.1 Pro.
Si especificas thinking_level y thinking_budget en la misma solicitud para un modelo de Gemini 3, el modelo mostrará un error.
Modelos de Gemini 2.5 y versiones anteriores
En el caso de los modelos anteriores a Gemini 3, puedes controlar el razonamiento con el parámetro thinking_budget, que establece un límite superior para la cantidad de tokens que el modelo puede usar en su proceso de razonamiento. De forma predeterminada, si no se establece thinking_budget, el modelo controla automáticamente la cantidad de tokens que cree que se deben incluir, hasta un máximo de 8,192. Para usar el presupuesto dinámico a través de la API, establece thinking_budget en -1.
Puedes establecer thinking_budget de forma manual para imponer un límite superior flexible en la cantidad de tokens en situaciones en las que podrías necesitar más o menos tokens que el presupuesto de pensamiento predeterminado. Puedes establecer un límite de tokens más bajo para las tareas menos complejas o un límite más alto para las más complejas. Ten en cuenta que este es un límite flexible y, por lo tanto, puede haber variabilidad en la cantidad total de tokens de pensamiento. Si la latencia es más importante, usa un presupuesto más bajo o configúralo en 0 para evitar que se devuelva contenido de pensamiento con la respuesta.
En la siguiente tabla, se muestran los importes mínimos y máximos que puedes establecer para thinking_budget en cada modelo compatible, así como el presupuesto de pensamiento predeterminado para cada modelo:
| Modelo | Importe mínimo de tokens | Cantidad máxima de tokens | Predeterminado |
|---|---|---|---|
| Gemini 2.5 Flash | 1 | 24,576 | Automático (hasta 8,192 tokens) |
| Gemini 2.5 Pro | 128 | 32,768 | Automático (hasta 8,192 tokens) |
| Gemini 2.5 Flash-Lite | 512 | 24,576 | Automático (hasta 8,192 tokens) |
Si configuras thinking_budget como 0 cuando usas Gemini 2.5 Flash y Gemini 2.5 Flash-Lite, no se devuelve contenido de pensamiento con la respuesta. Sin embargo, es posible que el texto de estilo de razonamiento siga presente en el resultado del modelo. No se puede desactivar la función de pensamiento en Gemini 2.5 Pro.
Si usas el parámetro thinking_level con un modelo anterior a Gemini 3, el modelo devolverá un error.
Console
- Abre Agent Studio > Crear instrucción.
- En el panel Modelo, haz clic en Cambiar modelo y selecciona uno de los modelos compatibles en el menú.
- Selecciona Manual en el selector desplegable Presupuesto de pensamiento y, luego, usa el control deslizante para ajustar el límite del presupuesto de pensamiento.
Python
Instalar
pip install --upgrade google-genai
Para obtener más información, consulta la documentación de referencia del SDK.
Establece variables de entorno para usar el SDK de IA generativa de Google con Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Node.js
Instalar
npm install @google/genai
Para obtener más información, consulta la documentación de referencia del SDK.
Establece variables de entorno para usar el SDK de IA generativa de Google con Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Go
Obtén información para instalar o actualizar Go.
Para obtener más información, consulta la documentación de referencia del SDK.
Establece variables de entorno para usar el SDK de IA generativa de Google con Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Java
Obtén información para instalar o actualizar Java.
Para obtener más información, consulta la documentación de referencia del SDK.
Establece variables de entorno para usar el SDK de IA generativa de Google con Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Cómo ver los resúmenes de razonamiento
Los resúmenes de razonamiento proporcionan visibilidad de los pasos de razonamiento intermedio que realizó el modelo mientras generaba una respuesta. Puedes ver resúmenes de pensamientos en Gemini 2.5 y modelos más recientes.
En Agent Studio, los resúmenes de pensamientos están habilitados de forma predeterminada y se pueden ver expandiendo el panel Pensamientos.
Cuando uses la API, puedes habilitar los resúmenes de pensamiento estableciendo include_thoughts=True en tu ThinkingConfig:
Console
Los resúmenes de pensamientos están habilitados de forma predeterminada en Agent Studio. Puedes ver el proceso de razonamiento resumido del modelo si expandes el panel Pensamientos.
Python
Instalar
pip install --upgrade google-genai
Para obtener más información, consulta la documentación de referencia del SDK.
Establece variables de entorno para usar el SDK de IA generativa de Google con Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Node.js
Instalar
npm install @google/genai
Para obtener más información, consulta la documentación de referencia del SDK.
Establece variables de entorno para usar el SDK de IA generativa de Google con Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Go
Obtén información para instalar o actualizar Go.
Para obtener más información, consulta la documentación de referencia del SDK.
Establece variables de entorno para usar el SDK de IA generativa de Google con Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Java
Obtén información para instalar o actualizar Java.
Para obtener más información, consulta la documentación de referencia del SDK.
Establece variables de entorno para usar el SDK de IA generativa de Google con Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
Una respuesta puede contener una firma de pensamiento sin texto de resumen del pensamiento en los siguientes casos:
- Solicitudes de baja complejidad: El modelo requirió una cantidad mínima de pasos de razonamiento para formular la respuesta.
- Resúmenes inhabilitados: No se solicitaron resúmenes de pensamientos o se desactivaron de forma explícita.
- Modalidades de razonamiento no textual: Es posible que ciertas modalidades (como el procesamiento de imágenes) no emitan resúmenes de texto.
Tu aplicación siempre debe controlar con facilidad las respuestas en las que el contenido del resumen de pensamiento está ausente o vacío, y conservar las firmas de pensamiento asociadas.
Firmas de razonamiento
Las firmas de pensamiento son representaciones encriptadas del proceso de pensamiento interno del modelo que preservan el estado de razonamiento de Gemini durante las conversaciones de varios turnos, en especial cuando se usa la llamada a funciones.
Para garantizar que el modelo mantenga el contexto completo en varios turnos de una conversación, debes devolver las firmas de pensamiento de las respuestas anteriores en tus solicitudes posteriores, independientemente del nivel de pensamiento que se use. Si usas el SDK de IA generativa de Google (Python, Node.js, Go o Java) y las funciones estándar del historial de chat, o bien agregas la respuesta completa del modelo al historial, las firmas de pensamiento se controlan automáticamente.
Para conocer las reglas detalladas, los ejemplos y los patrones de flujo de trabajo de varios turnos, consulta Firmas de pensamiento.
Técnicas de creación de instrucciones
El diseño de instrucciones eficaz te ayuda a dirigir el razonamiento del modelo, reservar presupuesto de tokens y lograr una calidad de salida óptima con los modelos de pensamiento.
Para obtener estrategias integrales, patrones de varios intentos, mensajes de verificación y sugerencias de depuración, consulta la guía de Thinking Prompting.
Precios
Se te cobra por los tokens que se generan durante el proceso de razonamiento de un modelo. En el caso de algunos modelos, como Gemini 3 Pro y Gemini 2.5 Pro, el pensamiento está habilitado de forma predeterminada y se te facturan estos tokens.
Para obtener más información, consulta los precios de Agent Platform. Para obtener información sobre cómo administrar los costos, consulta Cómo controlar el pensamiento del modelo.
¿Qué sigue?
Firmas de razonamiento
Aprende a preservar el estado de razonamiento de Gemini durante conversaciones de varios turnos y pasos con firmas de pensamiento.
Guía de instrucciones para generar ideas
Explora las técnicas y prácticas recomendadas de ingeniería de instrucciones diseñadas para los modelos de pensamiento de Gemini.