Gemini Embedding 2

Gemini Embedding 2 es el modelo de generación de embeddings de Google que es ideal para tareas complejas de recuperación y análisis.

Gemini Embedding 2 acepta entradas multimodales para generar vectores de 3,072 dimensiones. Acepta imágenes, texto, documentos, audio y video como entradas, y asigna semánticamente los vectores generados a un espacio semántico unificado. Esto te permite realizar tareas, como buscar una imagen en función de una descripción de texto.

Gemini Embedding 2 presenta varias funciones para optimizar la calidad y la flexibilidad de las embeddings:

  • Instrucciones de tareas personalizadas: Si especificas instrucciones de tareas (por ejemplo, task:code retrieval o task:search result), optimizas las embeddings para las relaciones deseadas y recuperas resultados más precisos para el objetivo específico.

  • Tamaño de resultado ajustable: De forma predeterminada, el modelo genera un vector flotante de 3,072 dimensiones. Sin embargo, puedes recuperar una salida de dimensiones más pequeñas si especificas el parámetro output_dimensionality.

  • OCR de documentos: Lee el OCR de las entradas de documentos.

  • Extracción de pistas de audio: Extrae pistas de audio de las entradas de video y entrelázalas con fotogramas de video.

Para obtener más información sobre cómo usar Gemini Embedding 2, consulta Obtener embeddings multimodales.

Probar en Agent Studio Implementar la app de ejemplo Ver los precios

Nota: Para "Implementar la app de ejemplo", se requiere un proyecto de Google Cloud con facturación y la API de Agent Platform habilitada.
ID de modelo gemini-embedding-2
Modalidades
Text Input only
Image Input only
Audio Input only
Video Input only
Embeddings Output only
Límites de tokens Cantidad máxima de tokens de entrada 8,192
Cantidad máxima de tokens de salida N/A
Dimensiones de la salida Hasta 3,072 (con compatibilidad con MRL)
Longitud máxima de la secuencia 8,192 tokens
Opciones de consumo
Especificaciones técnicas Texto
  • Cantidad máxima de tokens de entrada: 8,192
  • Cantidad máxima de archivos por instrucción: 1
  • Cantidad máxima de páginas por archivo (para PDF): 6
  • Tamaño máximo del archivo por archivo: N/A
  • OCR para archivos PDF escaneados: No se usa de forma predeterminada
  • Tipos de MIME admitidos:
    text/plain, application/pdf
Imagen
  • Cantidad máxima de imágenes por instrucción: 6
  • Tamaño máximo del archivo por archivo para datos intercalados o cargas directas a través de la consola: Sin límite
  • Tamaño máximo del archivo por archivo de Google Cloud Storage: Sin límite
  • Cantidad máxima de imágenes de salida por instrucción: N/A
  • Tipos de MIME admitidos:
    image/png, image/jpeg, image/webp, image/bmp, image/heic, image/heif, image/avif
Video
  • Duración máxima del video (con audio): 80 segundos
  • Duración máxima del video (sin audio): 120 segundos
  • Cantidad máxima de videos por instrucción: 1
  • Tipos de MIME admitidos:
    video/mpeg, video/mp4
Audio
  • Duración máxima de audio por instrucción: 180 segundos
  • Cantidad máxima de archivos de audio por instrucción: 1
  • Tipos de MIME admitidos:
    audio/mp3, audio/wav
Regiones admitidas

Disponibilidad del modelo

  • Global: global
  • Multirregión de Estados Unidos: us
  • Multirregión de Europa: eu
Fecha límite de conocimiento Noviembre de 2025
Versiones
  • gemini-embedding-2
    • Etapa de lanzamiento: GA
    • Fecha de lanzamiento: 22 de abril de 2026
  • gemini-embedding-2-preview
    • Etapa de lanzamiento: Versión preliminar pública
    • Fecha de lanzamiento: 10 de marzo de 2026