La traducción de audio a audio (A2A) en vivo permite que los agentes se comuniquen sin problemas con los clientes en su propio idioma. Para habilitar la traducción A2A en vivo para la configuración de tu servicio de atención al cliente, sigue estos pasos en la consola de Agent Assist.
Paso 1: Crea un generador
- Navega a Live translation y haz clic en Create.
- Ingresa un Generator name y los idiomas de destino para el agente y el cliente.
- Navega a Conversation channel y elige voz.
- Habilita Conference mode.
- Haz clic en Guardar.
Paso 2: Crea un perfil de conversación y vincula un número de teléfono
- Sigue estas instrucciones para crear un perfil de conversación con un número de Google Telephony Platform (GTP) adjunto. Esto creará un perfil de conversación con un agente virtual.
- Ve a Choose to use Dialogflow y desactiva el agente virtual.
- Ve a Voice configurations > SIP configuration y inhabilita Allow agente virtual interaction.
Paso 3: Configura el perfil de conversación
Sigue estos pasos para configurar el perfil de conversación creado en el paso 2.
- Navega a Conversation profiles> Suggestion types.
- Selecciona Live translation y, luego, ingresa el nombre del generador que creaste en el paso 1.
- Habilita Advanced suggestion settings para usar datos de conversación sin editar para la sugerencia.
- Habilita Telephony settings para usar la API de transmisión bidireccional.
- Ingresa 16000 para Sample Rate Hertz.
- Haz clic en Guardar.
Paso 4: Inicializa el modo de conferencia
El servicio de modo de conferencia opera con el siguiente flujo de trabajo para controlar las transmisiones de audio mixtas en una llamada de varias partes:
- Agrega tu número de teléfono de GTP dedicado como un tercer participante para integrar la traducción de audio en vivo en una llamada activa. Usa la funcionalidad de conferencia estándar de tres vías disponible en las plataformas comunes de telefonía y centros de contacto.
- El GTP recibe de inmediato una sola transmisión de audio mixta cuando se conecta y la procesa a través de una solicitud
bidiStreamingAnalyzeContent. - El modelo de Gemini sintetiza la traducción de audio en función del audio de entrada y habilita la transcripción para ambos audios originales.Traduce el audio atribuido y reproduce el audio traducido en la conferencia de tres vías para todos los participantes.