La API de Gemini Live permite interacciones de voz y video en tiempo real con Gemini con baja latencia. Procesa transmisiones continuas de audio, video o texto para ofrecer respuestas habladas inmediatas y similares a las de un humano. Esto crea una experiencia de conversación natural para tus usuarios. Los avatares en vivo agregan la opción de interactuar con un ícono similar a un humano que se sincroniza con las respuestas de voz, lo que proporciona una experiencia mejorada y más personal con los usuarios.
Prueba la API de Gemini Live en Agent Studio
Ejemplos de casos de uso
La API de Gemini Live se puede usar para crear agentes de voz y video en tiempo real para una variedad de industrias, incluidas las siguientes:
Embajadores corporativos de marca: Representantes interactivos de la marca implementados en propiedades web corporativas o aplicaciones para dispositivos móviles, generados a partir de imágenes de empleados autorizados o talentos pagados con lanzamientos corporativos ejecutados.
Comercio electrónico y venta minorista: Asistentes de compras que ofrecen recomendaciones personalizadas y agentes de asistencia que resuelven los problemas de los clientes.
Videojuegos: Personajes controlados por la máquina (NPC) interactivos, asistentes de ayuda en el juego y traducción en tiempo real del contenido del juego
Interfaces de nueva generación: Experiencias habilitadas para voz y video en robótica, anteojos inteligentes y vehículos
Cuidado de la salud: Guías de navegación que ayudan con la logística de las instalaciones y la atención.
Servicios financieros: Agentes conversacionales que priorizan las solicitudes bancarias cotidianas.
Educación: Mentores y compañeros de aprendizaje basados en IA que brindan instrucción y comentarios personalizados
Características clave
La API de Gemini Live ofrece un conjunto integral de funciones para compilar agentes de voz y video sólidos:
Alta calidad de audio: La API de Gemini Live proporciona voz natural y realista en varios idiomas.
Compatibilidad multilingüe: Conversa en 24 idiomas admitidos.
Interrupción: Los usuarios pueden interrumpir el modelo en cualquier momento para tener interacciones responsivas.
Diálogo afectivo: Adapta el estilo y el tono de la respuesta para que coincidan con la expresión de entrada del usuario.
Uso de herramientas: Integra herramientas como llamadas a funciones y la Búsqueda de Google para interacciones dinámicas.
Transcripciones de audio: Proporciona transcripciones de texto de la entrada del usuario y el resultado del modelo. Si deseas obtener información sobre la transcripción como objetivo final en lugar de como canal secundario de una conversación, consulta Gemini 3.5 Transcribe.
Audio proactivo: Te permite controlar cuándo responde el modelo y en qué contextos.
Especificaciones técnicas
En la siguiente tabla, se describen las especificaciones técnicas de la API de Gemini Live:
| Categoría | Detalles |
|---|---|
| Modalidades de entrada | Audio (audio PCM sin procesar de 16 bits, 16 kHz, little-endian), imágenes o video (JPEG, 1 FPS), texto |
| Modalidades de salida | Audio (audio PCM sin procesar de 16 bits, 24 kHz, little-endian), texto |
| Video (avatares en vivo) | Video (mp4) |
| Protocolo | Conexión WebSocket con estado (WSS) |
Modelos compatibles
Los siguientes modelos admiten la API de Gemini Live. Selecciona el modelo adecuado según tus requisitos de interacción.
| ID de modelo | Disponibilidad | Caso de uso | Características clave |
|---|---|---|---|
gemini-3.8-live |
Disponible de manera general | Recomendada. Agentes de voz de baja latencia Admite el cambio de idioma sin interrupciones. |
|
gemini-live-2.5-flash-native-audio |
Disponible de manera general | Recomendada. Agentes de voz de baja latencia Admite el cambio de idioma y el tono emocional sin interrupciones. |
|
gemini-3.5-transcribe-live-preview |
Vista previa | Solo voz a texto. Subtitulado, dictado y transcripción de llamadas en tiempo real Devuelve texto, no audio, por lo que no mantiene una conversación. |
|
Comenzar
Selecciona la guía que coincida con tu entorno de desarrollo:
Instructivo del SDK de IA generativa
Conéctate a la API de Gemini Live con el SDK de IA generativa para compilar una aplicación multimodal en tiempo real con un backend de Python.
Tutorial de WebSocket
Conéctate a la API de Gemini Live con WebSockets para crear una aplicación multimodal en tiempo real con un frontend de JavaScript y un backend de Python.
Instructivo de ADK
Crea un agente y usa la transmisión del Kit de desarrollo de agentes (ADK) para habilitar la comunicación por voz y video.
Integraciones a socios
Si deseas realizar una integración con algunos de nuestros socios, estas plataformas ya integraron la API de Gemini Live a través del protocolo WebRTC para optimizar el desarrollo de aplicaciones de audio y video en tiempo real.
Arquitectura de referencia de LiveKit y ADK
Para los asistentes de voz avanzados y listos para producción que requieren una organización, un enrutamiento y una delegación multiagente sofisticados de las sesiones, puedes crear una integración bidireccional de baja latencia con LiveKit (WebRTC) y la API de Gemini Live a través del Kit de desarrollo de agentes (ADK).
Esta arquitectura te permite implementar un agente de Orchestrator que maneja la interacción inicial con el cliente y enruta dinámicamente las solicitudes a subagentes especializados (por ejemplo, delega el contexto a un agente de reserva de vuelos o de hoteles con la orquestación de transferAgent).
Para explorar e implementar este diseño de referencia, consulta la implementación oficial de la base de código de referencia en GitHub.
