Gemini 2.5 Flash mit der Gemini Live API

Gemini 2.5 Flash mit Gemini Live API-Audiofunktionen bietet unsere hochmoderne native Audiofunktion für die Gemini Live API. Zusätzlich zu den Standardfunktionen der Gemini Live API umfasst dieses Modell Folgendes:

  • Verbesserte Audioqualität: Die Audioqualität wurde erheblich verbessert und es fühlt sich an, als würden Sie mit einer Person sprechen.
  • Verbesserte Sprachqualität und Anpassungsfähigkeit: Die nativen Audiofunktionen der Gemini Live API bieten umfassendere und natürlichere Sprachinteraktionen mit 30 HD-Stimmen in 24 Sprachen.
  • Einführung in Proaktive Audiofunktionen: (Vorabversion) Wenn die proaktiven Audiofunktionen aktiviert sind, antwortet das Modell nur, wenn es relevant ist. Das Modell generiert proaktiv Texttranskripte und Audioantworten nur für Anfragen, die an das Gerät gerichtet sind, und antwortet nicht auf Anfragen, die nicht an das Gerät gerichtet sind.
  • Affektiver Dialog:Modelle, die die nativen Audiofunktionen der Gemini Live API verwenden, können die emotionalen Äußerungen von Nutzern verstehen und angemessen darauf reagieren, um nuanciertere Unterhaltungen zu ermöglichen.
  • Verbessertes Unterbrechen: Sie können Gemini jetzt natürlicher und zuverlässiger unterbrechen, auch in lauten Umgebungen.
  • Robuste Funktionsaufrufe: Wir haben die Auslösungsrate verbessert, sodass Gemini die von Ihnen definierten Funktionen erfolgreich ausführen kann, um Ihre Anwendungsfälle zu unterstützen.
  • Genaue Transkription:Die Genauigkeit der Audio-zu-Text Transkription wurde erheblich verbessert. Um noch bessere Ergebnisse zu erzielen, können Sie Sprachhinweise geben, um das Modell auf die richtige Sprache auszurichten. Weitere Informationen finden Sie unter Audio-Transkription für die Sitzung aktivieren.
  • Nahtlose mehrsprachige Unterstützung: Sie können mit Gemini in mehreren Sprachen sprechen und es wechselt mühelos zwischen ihnen, ohne dass eine Vorkonfiguration erforderlich ist. Sprache ist keine Barriere mehr.

Weitere Informationen zur Gemini Live API finden Sie hier:

In Agent Studio testen Preise ansehen

Modell-ID gemini-live-2.5-flash-native-audio
Betriebsarten
Text Input and output
Bild Input only
Audio Input and output
Video Input only
Token limits Kontextfenster 128K
Maximale Ausgabetokens 64K
Maximale Anzahl gleichzeitiger Sitzungen 1000
Leistungsspektrum
Tools
Nutzungsoptionen
Technische Spezifikationen Bild
  • Maximale Anzahl von Bildern pro Prompt: 3.000
  • Maximale Dateigröße pro Datei für Inline-Daten oder direkte Uploads über die Console: 7 MB
  • Maximale Dateigröße pro Datei aus Google Cloud Storage: 30 MB
  • Unterstützte MIME-Typen:
    image/png, image/jpeg, image/webp, image/heic, image/heif
Video
  • Standardauflösung: 768 × 768
  • Unterstützte MIME-Typen:
    video/x-flv, video/quicktime, video/mpeg, video/mpegs, video/mpg, video/mp4, video/webm, video/wmv, video/3gpp
Audio
  • Maximale Gesprächslänge: Standardmäßig 10 Minuten, kann verlängert werden.
  • Erforderliches Audioeingabeformat: Raw 16-Bit-PCM-Audio mit 16 kHz, Little Endian
  • Erforderliches Audioausgabeformat: Raw 16-Bit-PCM-Audio mit 24 kHz, Little Endian
  • Unterstützte MIME-Typen:
    audio/x-aac, audio/flac, audio/mp3, audio/m4a, audio/mpeg, audio/mpga, audio/mp4, audio/ogg, audio/pcm, audio/wav, audio/webm
Standardwerte für Parameter
  • Empfindlichkeit zum Erkennen des Redebeginns: Niedrig
  • Empfindlichkeit zum Erkennen des Redeendes: Hoch
  • Vorangehender Abstand: 0
  • Maximale Kontextgröße: 128K
Unterstützte Regionen

Modellverfügbarkeit

  • USA: us-central1, us-east1, us-east4, us-east5, us-south1, us-west1, us-west4
  • Europa: europe-central2, europe-north1, europe-southwest1, europe-west1, europe-west4, europe-west8
Versionen
  • gemini-live-2.5-flash-native-audio
    • Startphase: GA
    • Veröffentlichungsdatum: 12. Dezember 2025
    • Datum der Einstellung: 13. Dezember 2026
Sicherheitskontrollen Onlinevorhersage
  • Datenstandort
  • CMEK
  • VPC-SC
  • AXT
Weitere Informationen finden Sie unter Sicherheitskontrollen.