Descripción general de la API de Gemini Live

La API de Gemini Live permite interacciones de voz y video en tiempo real y de baja latencia con Gemini. Procesa transmisiones continuas de audio, video o texto para ofrecer respuestas habladas inmediatas y similares a las de un humano. Esto crea una experiencia de conversación natural para los usuarios.

Prueba la API de Gemini Live en Agent Platform Studio

Ejemplos de casos de uso

La API de Gemini Live se puede usar para crear agentes de voz y video en tiempo real para una variedad de industrias, incluidas las siguientes:

  • Comercio electrónico y venta minorista: Asistentes de compras que ofrecen recomendaciones personalizadas y agentes de asistencia que resuelven los problemas de los clientes
  • Juegos: Personajes controlados por la máquina (NPC) interactivos, asistentes de ayuda en el juego y traducción en tiempo real del contenido del juego
  • Interfaces de próxima generación: Experiencias habilitadas para voz y video en robótica, anteojos inteligentes y vehículos
  • Cuidado de la salud: Compañeros de salud para la educación y la asistencia al paciente
  • Servicios financieros: Asesores de IA para la administración de patrimonio y la orientación sobre inversiones
  • Educación: Mentores de IA y compañeros de aprendizaje que proporcionan instrucción y comentarios personalizados

Características clave

La API de Gemini Live ofrece un conjunto integral de funciones para crear agentes de voz y video sólidos:

Especificaciones técnicas

En la siguiente tabla, se describen las especificaciones técnicas de la API de Gemini Live:

Categoría Detalles
Modalidades de entrada Audio (audio PCM sin procesar de 16 bits, 16 kHz, little-endian), imágenes o video (JPEG 1 FPS) y texto
Modalidades de salida Audio (audio PCM sin procesar de 16 bits, 24 kHz, little-endian) y texto
Protocolo Conexión WebSocket con estado (WSS)

Modelos compatibles

Los siguientes modelos admiten la API de Gemini Live. Selecciona el modelo adecuado según tus requisitos de interacción.

ID de modelo Disponibilidad Caso de uso Características clave
gemini-live-2.5-flash-native-audio Disponible de manera general Recomendado. Agentes de voz de baja latencia. Admite el cambio multilingüe sin interrupciones y el tono emocional.
  • Audio nativo
  • Transcripción de audio
  • Detección de actividad de voz
  • Diálogo basado en emociones detectadas
  • Audio proactivo
  • Uso de herramientas

Comenzar

Selecciona la guía que coincida con tu entorno de desarrollo:

Recomendado para facilitar el uso

Conéctate a la API de Gemini Live con el SDK de IA generativa para crear una aplicación multimodal en tiempo real con un backend de Python.

Control de protocolo sin procesar

Conéctate a la API de Gemini Live con WebSockets para crear una aplicación multimodal en tiempo real con un frontend de JavaScript y un backend de Python.

Kit de desarrollo de agentes

Crea un agente y usa la transmisión del Kit de desarrollo de agentes (ADK) para habilitar la comunicación de voz y video.

Integraciones a socios

Si deseas realizar una integración con algunos de nuestros socios, estas plataformas ya integraron la API de Gemini Live a través del protocolo WebRTC para optimizar el desarrollo de aplicaciones de audio y video en tiempo real.

Arquitectura de referencia de LiveKit y ADK

Para los asistentes de voz avanzados de nivel de producción que requieren una orquestación de sesión sofisticada, enrutamiento y delegación multiagente, puedes crear una integración bidireccional de baja latencia con LiveKit (WebRTC) con la API de Gemini Live a través del Kit de desarrollo de agentes (ADK).

Esta arquitectura te permite implementar un agente de Orchestrator que controla la interacción inicial del cliente y enruta de forma dinámica las solicitudes a agentes secundarios especializados (por ejemplo, delega el contexto a un agente de reserva de vuelos o de reserva de hoteles con la orquestación transferAgent).

Para explorar e implementar este diseño de referencia, consulta la implementación oficial de la base de código de referencia en GitHub.