Guida utente alla traduzione in tempo reale da A a A

La traduzione audio-audio (A2A) in tempo reale consente agli agenti di comunicare senza problemi con i clienti nella loro lingua. Per attivare la traduzione A2A in tempo reale per la configurazione del servizio clienti, segui questi passaggi nella console Agent Assist.

Passaggio 1: crea un generatore

  1. Vai a Traduzione Istantanea e fai clic su Crea.
  2. Inserisci un nome del generatore e le lingue di destinazione per l'agente e il cliente.
  3. Vai a Canale di conversazione e scegli la voce.
  4. Attiva la modalità Conferenza.
  5. Fai clic su Salva.
  1. Segui queste istruzioni per creare un profilo conversazione a cui è associato un numero della piattaforma di telefonia Google (GTP). Verrà creato un profilo di conversazione con un agente virtuale.
  2. Vai a Scegli di utilizzare Dialogflow e disattiva Agente virtuale.
  3. Vai a Configurazioni vocali > Configurazione SIP e disattiva Consenti l'interazione con l'agente virtuale.

Passaggio 3: configura il profilo di conversazione

Segui questi passaggi per configurare il profilo conversazione creato nel passaggio 2.

  1. Vai a Profili di conversazione> Tipi di suggerimenti.
  2. Seleziona Traduzione live e inserisci il nome del generatore che hai creato nel passaggio 1.
  3. Attiva le impostazioni avanzate dei suggerimenti per utilizzare i dati delle conversazioni non modificati per i suggerimenti.
  4. Attiva le impostazioni di telefonia per utilizzare l'API di streaming bidirezionale.
  5. Inserisci 16000 per Frequenza di campionamento (Hz).
  6. Fai clic su Salva.

Passaggio 4: inizializza la modalità conferenza

Il servizio di modalità conferenza funziona con il seguente flusso di lavoro per gestire gli stream audio misti in una chiamata con più partecipanti:

  1. Aggiungi il tuo numero di telefono GTP dedicato come terzo partecipante per integrare la traduzione audio in tempo reale in una chiamata attiva. Utilizza la funzionalità di conferenza a tre standard disponibile sulle piattaforme di telefonia e contact center più comuni.
  2. Al momento della connessione, il GTP riceve immediatamente un singolo flusso audio misto e lo elabora tramite una richiesta bidiStreamingAnalyzeContent.
  3. Il modello Gemini sintetizza la traduzione audio in base all'audio di input e consente la trascrizione di entrambi gli audio originali.Traduce l'audio attribuito e lo riproduce nella conferenza a tre per tutti i partecipanti.