Übersicht über die Gemini Live API

Die Gemini Live API ermöglicht latenzarme Sprach- und Videointeraktionen mit Gemini in Echtzeit. Sie verarbeitet kontinuierliche Audio-, Video- oder Textstreams und liefert sofortige, menschenähnliche gesprochene Antworten. So entsteht für Ihre Nutzer eine natürliche Unterhaltung.

Gemini Live API im Agent Platform Studio testen

Beispielanwendungsfälle

Mit der Gemini Live API lassen sich Sprach- und Videoagenten in Echtzeit für eine Vielzahl von Branchen entwickeln, darunter:

  • E-Commerce und Einzelhandel:Einkaufsassistenten, die personalisierte Empfehlungen geben, und Supportagenten, die Kundenprobleme lösen.
  • Gaming:Interaktive Non-Player Characters (NPCs), In-Game-Hilfeassistenten und Echtzeitübersetzung von In-Game-Inhalten.
  • Schnittstellen der nächsten Generation:Sprach- und videofähige Anwendungen in Robotik, Smart Glasses und Fahrzeugen.
  • Gesundheitswesen:Gesundheitsbegleiter für die Unterstützung und Aufklärung von Patienten.
  • Finanzdienstleistungen:KI-Berater für die Vermögensverwaltung und Anlageberatung.
  • Bildung:KI-Mentoren und Lernbegleiter, die personalisierte Anleitungen und Feedback geben.

Wichtige Features

Die Gemini Live API bietet eine umfassende Reihe von Funktionen zum Erstellen robuster Sprach- und Videoagenten:

  • Hohe Audioqualität: Die Gemini Live API bietet natürliche, realistisch klingende Sprache in mehreren Sprachen.
  • Mehrsprachiger Support: Unterhaltungen in 24 unterstützten Sprachen.
  • Barge-in: Nutzer können das Modell jederzeit unterbrechen, um interaktive Unterhaltungen zu führen.
  • Empathischer Dialog: Der Antwortstil und der Tonfall werden an die Ausdrucksweise des Nutzers angepasst.
  • Toolnutzung: Tools wie Funktionsaufrufe und die Google Suche werden für dynamische Interaktionen eingebunden.
  • Audiotranskripte: Bietet Texttranskripte der Nutzereingabe und der Modellausgabe. Wenn Sie Transkription als Endziel und nicht als Nebenkanal einer Unterhaltung verwenden möchten, lesen Sie den Artikel Gemini 3.5 Transcribe.
  • Proaktive Audioeingabe: (Vorabversion) Sie können festlegen, wann und in welchen Kontexten das Modell antwortet.

Technische Spezifikationen

In der folgenden Tabelle sind die technischen Spezifikationen für die Gemini Live API aufgeführt:

Kategorie Details
Eingabemodalitäten Audio (rohes 16-Bit-PCM-Audio, 16 kHz, Little-Endian), Bilder/Video (JPEG, 1 FPS), Text
Ausgabemodalitäten Audio (rohes 16-Bit-PCM-Audio, 24 kHz, Little-Endian), Text
Protokoll Zustandsbehaftete WebSocket-Verbindung (WSS)

Unterstützte Modelle

Die folgenden Modelle unterstützen die Gemini Live API. Wählen Sie das passende Modell entsprechend Ihren Interaktionsanforderungen aus.

Modell-ID Verfügbarkeit Anwendungsfall Wichtige Features
gemini-live-2.5-flash-native-audio Allgemein verfügbar Empfohlen. Sprachagenten mit niedriger Latenz. Unterstützt nahtlose mehrsprachige Wechsel und emotionale Töne.
  • Native Audioeingabe
  • Audiotranskripte
  • Erkennung von Sprachaktivität
  • Empathischer Dialog
  • Proaktive Audioeingabe
  • Toolnutzung
gemini-3.5-transcribe-live-preview Vorabversion Nur Sprache-zu-Text. Echtzeit-Untertitelung, Diktat und Anruf transkription. Gibt Text und kein Audio zurück, führt also keine Unterhaltung.
  • Vorläufige und endgültige Transkripte
  • Automatische Spracherkennung mit Sprachwechsel
  • Zeitstempel auf Äußerungsebene
  • Benutzerdefinierte Vokabular-Bias

Jetzt starten

Wählen Sie die Anleitung aus, die zu Ihrer Entwicklungsumgebung passt:

Empfohlen für einfache Bedienung

Verbinden Sie sich mit der Gemini Live API über das Gen AI SDK, um eine multimodale Echtzeitanwendung mit einem Python-Backend zu erstellen.

Rohprotokollsteuerung

Verbinden Sie sich mit der Gemini Live API über WebSockets, um eine multimodale Echtzeitanwendung mit einem JavaScript-Frontend und einem Python-Backend zu erstellen.

Agent Development Kit

Erstellen Sie einen Agenten und verwenden Sie das Agent Development Kit (ADK) Streaming, um Sprach- und Videokommunikation zu ermöglichen.

Einbindung in Partnerlösungen

Wenn Sie eine Einbindung in einige unserer Partnerlösungen wünschen, haben diese Plattformen die Gemini Live API bereits über das WebRTC-Protokoll eingebunden, um die Entwicklung von Audio- und Videoanwendungen in Echtzeit zu optimieren.

LiveKit- und ADK-Referenzarchitektur

Für fortschrittliche Sprachassistenten in Produktionsqualität, die eine ausgefeilte Sitzungsorchestrierung, Weiterleitung und Multi-Agent-Delegierung erfordern, können Sie eine latenzarme, bidirektionale Einbindung mit LiveKit (WebRTC) und der Gemini Live API über das Agent Development Kit (ADK) erstellen.

Mit dieser Architektur können Sie einen Orchestrator-Agenten bereitstellen, der die erste Kundeninteraktion verarbeitet und Anfragen dynamisch an spezialisierte Sub-Agenten weiterleitet (z. B. Kontext an einen Flugbuchungs- oder Hotelbuchungsagenten mit der transferAgent-Orchestrierung delegieren).

Wenn Sie dieses Referenzdesign erkunden und bereitstellen möchten, sehen Sie sich die offizielle Referenzcodebasis-Implementierung auf GitHub an.