Guide de l'utilisateur pour la traduction en direct A2A

La traduction audio-vers-audio (A2A) en direct permet aux agents de communiquer facilement avec les clients dans leur propre langue. Pour activer la traduction A2A en direct pour votre configuration du service client, suivez ces étapes dans la console Agent Assist.

Étape 1 : Créer un générateur

  1. Accédez à Traduction instantanée, puis cliquez sur Créer.
  2. Saisissez un nom de générateur et les langues cibles pour l'agent et le client.
  3. Accédez à Conversation channel (Canal de conversation) et sélectionnez la voix.
  4. Activez le mode Conférence.
  5. Cliquez sur Enregistrer.
  1. Suivez ces instructions pour créer un profil de conversation auquel est associé un numéro Google Telephony Platform (GTP). Un profil de conversation avec un agent virtuel est alors créé.
  2. Accédez à Choisir d'utiliser Dialogflow et désactivez l'agent virtuel.
  3. Accédez à Configurations vocales > Configuration SIP, puis désactivez l'option Autoriser l'interaction avec l'agent virtuel.

Étape 3 : Configurez le profil de conversation

Suivez ces étapes pour configurer le profil de conversation créé à l'étape 2.

  1. Accédez à Profils de conversation> Types de suggestions.
  2. Sélectionnez Traduction instantanée et saisissez le nom du générateur que vous avez créé à l'étape 1.
  3. Activez les paramètres de suggestions avancés pour utiliser les données de conversation non masquées pour les suggestions.
  4. Activez les paramètres de téléphonie pour utiliser l'API de streaming bidirectionnel.
  5. Saisissez 16000 dans Sample Rate Hertz (Taux d'échantillonnage en hertz).
  6. Cliquez sur Enregistrer.

Étape 4 : Initialiser le mode conférence

Le service de mode conférence fonctionne avec le workflow suivant pour gérer les flux audio mixtes dans un appel à plusieurs participants :

  1. Ajoutez votre numéro de téléphone GTP dédié en tant que troisième participant pour intégrer la traduction audio en direct à un appel en cours. Utilisez la fonctionnalité de conférence à trois standard disponible sur les plates-formes de téléphonie et de centre de contact courantes.
  2. Le GTP reçoit immédiatement un flux audio unique et mixte lors de la connexion, puis le traite via une requête bidiStreamingAnalyzeContent.
  3. Le modèle Gemini synthétise la traduction audio en fonction de l'audio d'entrée et permet la transcription des deux audios d'origine.Il traduit l'audio attribué et le lit dans la conférence à trois pour tous les participants.