Gemini 2.5 Flash con l'API Gemini Live

Gemini 2.5 Flash con le funzionalità audio native dell'API Gemini Live è la nostra funzionalità audio nativa all'avanguardia per l'API Gemini Live. Oltre alle funzionalità standard dell'API Gemini Live, questo modello include:

  • Qualità audio migliorata: un'esperienza di ascolto con una qualità audio notevolmente migliorata che ti fa sentire come se stessi parlando con una persona.
  • Qualità e adattabilità vocale migliorate: l'audio nativo dell'API Gemini Live offre interazioni vocali più ricche e naturali con 30 voci HD in 24 lingue.
  • Introduzione all'audio proattivo: (anteprima) quando l'audio proattivo è attivato, il modello risponde solo quando è pertinente. Il modello genera trascrizioni di testo e risposte audio in modo proattivo solo per le query indirizzate al dispositivo e non risponde alle query non indirizzate al dispositivo.
  • Introduzione alla finestra di dialogo affettiva: i modelli che utilizzano l'audio nativo dell'API Gemini Live possono comprendere e rispondere in modo appropriato alle espressioni emotive degli utenti per conversazioni più sfumate.
  • Interruzione migliorata: interrompi Gemini in modo più naturale e affidabile, anche in ambienti rumorosi.
  • Chiamata di funzione efficace: abbiamo migliorato la frequenza di attivazione, consentendo a Gemini di eseguire correttamente le funzioni che definisci per supportare i tuoi casi d'uso.
  • Trascrizione accurata: l'accuratezza della trascrizione audio-testo è stata notevolmente migliorata. Per risultati ancora migliori, puoi fornire suggerimenti sulla lingua per indirizzare il modello verso la lingua corretta. Per saperne di più, consulta Attivare la trascrizione audio per la sessione.
  • Supporto multilingue senza interruzioni: parla con Gemini in più lingue e passerà facilmente da una all'altra senza alcuna preconfigurazione. La lingua non è più una barriera.

Per saperne di più sull'API Gemini Live, consulta:

Prova in Agent Studio Visualizza i prezzi

ID modello gemini-live-2.5-flash-native-audio
Modalità
Text Input and output
Image Input only
Audio Input and output
Video Input only
Limiti di token Finestra contestuale 128.000
Numero massimo di token di output 64.000
Numero massimo di sessioni simultanee 1000
Funzionalità
Strumenti
Opzioni di consumo
Specifiche tecniche Image
  • Numero massimo di immagini per prompt: 3000
  • Dimensioni massime del file per i dati in linea o i caricamenti diretti tramite la console: 7 MB
  • Dimensioni massime del file per file da Google Cloud Storage: 30 MB
  • Tipi MIME supportati:
    image/png, image/jpeg, image/webp, image/heic, image/heif
Video
  • Risoluzione standard: 768 x 768
  • Tipi MIME supportati:
    video/x-flv, video/quicktime, video/mpeg, video/mpegs, video/mpg, video/mp4, video/webm, video/wmv, video/3gpp
Audio
  • Durata massima della conversazione: 10 minuti per impostazione predefinita, ma può essere estesa.
  • Formato di input audio richiesto: audio PCM a 16 bit non elaborato a 16 kHz, little-endian
  • Formato di output audio richiesto: audio PCM a 16 bit non elaborato a 24 kHz, little-endian
  • Tipi MIME supportati:
    audio/x-aac, audio/flac, audio/mp3, audio/m4a, audio/mpeg, audio/mpga, audio/mp4, audio/ogg, audio/pcm, audio/wav, audio/webm
Valori predefiniti dei parametri
  • Inizio della sensibilità vocale: bassa
  • Fine della sensibilità vocale: alta
  • Silenzio iniziale: 0
  • Dimensioni massime del contesto: 128.000
Aree geografiche supportate

Disponibilità del modello

  • Stati Uniti: us-central1, us-east1, us-east4, us-east5, us-south1, us-west1, us-west4
  • Europa: europe-central2, europe-north1, europe-southwest1, europe-west1, europe-west4, europe-west8
Versioni
  • gemini-live-2.5-flash-native-audio
    • Fase di lancio: GA
    • Data di rilascio: 12 dicembre 2025
    • Data di ritiro: 13 dicembre 2026
Controlli di sicurezza Previsione online
  • Residenza dei dati
  • CMEK
  • VPC-SC
  • AXT
Per saperne di più, consulta Controlli di sicurezza.