Descripción general de la API de Gemini Live

La API de Gemini Live permite interacciones de voz y video en tiempo real con Gemini con baja latencia. Procesa transmisiones continuas de audio, video o texto para ofrecer respuestas habladas inmediatas y similares a las de un humano. Esto crea una experiencia de conversación natural para tus usuarios. Los avatares en vivo agregan la opción de interactuar con un ícono similar a un humano que se sincroniza con las respuestas de voz, lo que proporciona una experiencia mejorada y más personal con los usuarios.

Prueba la API de Gemini Live en Agent Studio

Ejemplos de casos de uso

La API de Gemini Live se puede usar para crear agentes de voz y video en tiempo real para una variedad de industrias, incluidas las siguientes:

  • Embajadores corporativos de marca: Representantes interactivos de la marca implementados en propiedades web corporativas o aplicaciones para dispositivos móviles, generados a partir de imágenes de empleados autorizados o talentos pagados con lanzamientos corporativos ejecutados.

  • Comercio electrónico y venta minorista: Asistentes de compras que ofrecen recomendaciones personalizadas y agentes de asistencia que resuelven los problemas de los clientes.

  • Videojuegos: Personajes controlados por la máquina (NPC) interactivos, asistentes de ayuda en el juego y traducción en tiempo real del contenido del juego

  • Interfaces de nueva generación: Experiencias habilitadas para voz y video en robótica, anteojos inteligentes y vehículos

  • Cuidado de la salud: Guías de navegación que ayudan con la logística de las instalaciones y la atención.

  • Servicios financieros: Agentes conversacionales que priorizan las solicitudes bancarias cotidianas.

  • Educación: Mentores y compañeros de aprendizaje basados en IA que brindan instrucción y comentarios personalizados

Características clave

La API de Gemini Live ofrece un conjunto integral de funciones para compilar agentes de voz y video sólidos:

  • Alta calidad de audio: La API de Gemini Live proporciona voz natural y realista en varios idiomas.

  • Compatibilidad multilingüe: Conversa en 24 idiomas admitidos.

  • Interrupción: Los usuarios pueden interrumpir el modelo en cualquier momento para tener interacciones responsivas.

  • Diálogo afectivo: Adapta el estilo y el tono de la respuesta para que coincidan con la expresión de entrada del usuario.

  • Uso de herramientas: Integra herramientas como llamadas a funciones y la Búsqueda de Google para interacciones dinámicas.

  • Transcripciones de audio: Proporciona transcripciones de texto de la entrada del usuario y el resultado del modelo. Si deseas obtener información sobre la transcripción como objetivo final en lugar de como canal secundario de una conversación, consulta Gemini 3.5 Transcribe.

  • Audio proactivo: Te permite controlar cuándo responde el modelo y en qué contextos.

Especificaciones técnicas

En la siguiente tabla, se describen las especificaciones técnicas de la API de Gemini Live:

Categoría Detalles
Modalidades de entrada Audio (audio PCM sin procesar de 16 bits, 16 kHz, little-endian), imágenes o video (JPEG, 1 FPS), texto
Modalidades de salida Audio (audio PCM sin procesar de 16 bits, 24 kHz, little-endian), texto
Video (avatares en vivo) Video (mp4)
Protocolo Conexión WebSocket con estado (WSS)

Modelos compatibles

Los siguientes modelos admiten la API de Gemini Live. Selecciona el modelo adecuado según tus requisitos de interacción.

ID de modelo Disponibilidad Caso de uso Características clave
gemini-3.8-live Disponible de manera general Recomendada. Agentes de voz de baja latencia Admite el cambio de idioma sin interrupciones.
  • Audio nativo
  • Transcripciones de audio
  • Detección de actividad de voz
  • Diálogo basado en emociones detectadas
  • Audio proactivo
  • Uso de herramientas
  • Avatar en tiempo real
gemini-live-2.5-flash-native-audio Disponible de manera general Recomendada. Agentes de voz de baja latencia Admite el cambio de idioma y el tono emocional sin interrupciones.
  • Audio nativo
  • Transcripciones de audio
  • Detección de actividad de voz
  • Diálogo basado en emociones detectadas
  • Audio proactivo
  • Uso de herramientas
gemini-3.5-transcribe-live-preview Vista previa Solo voz a texto. Subtitulado, dictado y transcripción de llamadas en tiempo real Devuelve texto, no audio, por lo que no mantiene una conversación.
  • Transcripciones provisionales y finales
  • Detección automática de idioma con alternancia entre idiomas
  • Marcas de tiempo a nivel de la expresión
  • Sugerencias de vocabulario personalizadas

Comenzar

Selecciona la guía que coincida con tu entorno de desarrollo:

Recomendado por su facilidad de uso

Conéctate a la API de Gemini Live con el SDK de IA generativa para compilar una aplicación multimodal en tiempo real con un backend de Python.

Control de protocolo sin procesar

Conéctate a la API de Gemini Live con WebSockets para crear una aplicación multimodal en tiempo real con un frontend de JavaScript y un backend de Python.

Kit de desarrollo de agentes

Crea un agente y usa la transmisión del Kit de desarrollo de agentes (ADK) para habilitar la comunicación por voz y video.

Integraciones a socios

Si deseas realizar una integración con algunos de nuestros socios, estas plataformas ya integraron la API de Gemini Live a través del protocolo WebRTC para optimizar el desarrollo de aplicaciones de audio y video en tiempo real.

Arquitectura de referencia de LiveKit y ADK

Para los asistentes de voz avanzados y listos para producción que requieren una organización, un enrutamiento y una delegación multiagente sofisticados de las sesiones, puedes crear una integración bidireccional de baja latencia con LiveKit (WebRTC) y la API de Gemini Live a través del Kit de desarrollo de agentes (ADK).

Esta arquitectura te permite implementar un agente de Orchestrator que maneja la interacción inicial con el cliente y enruta dinámicamente las solicitudes a subagentes especializados (por ejemplo, delega el contexto a un agente de reserva de vuelos o de hoteles con la orquestación de transferAgent).

Para explorar e implementar este diseño de referencia, consulta la implementación oficial de la base de código de referencia en GitHub.