Embedding Gemini 2

Gemini Embedding 2 è il modello di generazione di incorporamenti di Google ideale per attività complesse di recupero e analisi.

Gemini Embedding 2 accetta input multimodali per generare vettori a 3072 dimensioni. Accetta input di immagini, testo, documenti, audio e video e mappa semanticamente i vettori generati in uno spazio semantico unificato. In questo modo puoi eseguire attività come la ricerca di un'immagine in base a una descrizione testuale.

Gemini Embedding 2 introduce diverse funzionalità per ottimizzare la qualità e la flessibilità degli incorporamenti:

  • Istruzioni per le attività personalizzate: specificando le istruzioni per le attività (ad esempio, task:code retrieval o task:search result), puoi ottimizzare gli incorporamenti per le relazioni previste e recuperare risultati più precisi per l'obiettivo specifico.

  • Dimensioni dei risultati regolabili: per impostazione predefinita, il modello genera un vettore float a 3072 dimensioni. Tuttavia, puoi recuperare un output con dimensioni inferiori specificando il parametro output_dimensionality.

  • OCR dei documenti: leggi l'OCR dagli input dei documenti.

  • Estrazione delle tracce audio: estrai le tracce audio dagli input video e intervallale con i fotogrammi video.

Per ulteriori informazioni su come utilizzare Gemini Embedding 2, vedi Ottenere incorporamenti multimodali.

Prova in Agent Studio Esegui il deployment dell'app di esempio Visualizza i prezzi

Nota: "Esegui il deployment dell'app di esempio" richiede un progetto Google Cloud con la fatturazione e l'API Agent Platform abilitate.
ID modello gemini-embedding-2
Modalità
Text Input only
Image Input only
Audio Input only
Video Input only
Embeddings Output only
Limiti di token Token di input massimi 8192
Token di output massimi N/D
Dimensioni di output Fino a 3072 (con supporto MRL)
Lunghezza massima della sequenza 8192 token
Opzioni di consumo
Specifiche tecniche Testo
  • Token di input massimi: 8192
  • Numero massimo di file per prompt: 1
  • Numero massimo di pagine per file (per PDF): 6
  • Dimensione massima dei file per file: N/D
  • OCR per PDF digitalizzati: non utilizzato per impostazione predefinita
  • Tipi MIME supportati:
    text/plain, application/pdf
Immagine
  • Numero massimo di immagini per prompt: 6
  • Dimensione massima dei file per file per dati in linea o caricamenti diretti tramite la console: Nessun limite
  • Dimensione massima dei file per file da Google Cloud Storage: nessun limite
  • Numero massimo di immagini di output per prompt: N/D
  • Tipi MIME supportati:
    image/png, image/jpeg, image/webp, image/bmp, image/heic, image/heif, image/avif
Video
  • Durata massima del video (con audio): 80 secondi
  • Durata massima del video (senza audio): 120 secondi
  • Numero massimo di video per prompt: 1
  • Tipi MIME supportati:
    video/mpeg, video/mp4
Audio
  • Durata massima dell'audio per prompt: 180 secondi
  • Numero massimo di file audio per prompt: 1
  • Tipi MIME supportati:
    audio/mp3, audio/wav
Aree geografiche supportate

Disponibilità del modello

  • Globale: global
  • Multi-regione Stati Uniti: us
  • Multi-regione Europa: eu
Data di knowledge cutoff Novembre 2025
Versioni
  • gemini-embedding-2
    • Fase di avvio: GA
    • Data di rilascio: 22 aprile 2026
  • gemini-embedding-2-preview
    • Fase di avvio: anteprima pubblica
    • Data di rilascio: 10 marzo 2026