La traduzione audio-audio (A2A) in tempo reale consente agli agenti di comunicare senza problemi con i clienti nella loro lingua. Per attivare la traduzione A2A in tempo reale per la configurazione del servizio clienti, segui questi passaggi nella console Agent Assist.
Passaggio 1: crea un generatore
- Vai a Traduzione Istantanea e fai clic su Crea.
- Inserisci un nome del generatore e le lingue di destinazione per l'agente e il cliente.
- Vai a Canale di conversazione e scegli la voce.
- Attiva la modalità Conferenza.
- Fai clic su Salva.
Passaggio 2: crea un profilo di conversazione e collega un numero di telefono
- Segui queste istruzioni per creare un profilo conversazione a cui è associato un numero della piattaforma di telefonia Google (GTP). Verrà creato un profilo di conversazione con un agente virtuale.
- Vai a Scegli di utilizzare Dialogflow e disattiva Agente virtuale.
- Vai a Configurazioni vocali > Configurazione SIP e disattiva Consenti l'interazione con l'agente virtuale.
Passaggio 3: configura il profilo di conversazione
Segui questi passaggi per configurare il profilo conversazione creato nel passaggio 2.
- Vai a Profili di conversazione> Tipi di suggerimenti.
- Seleziona Traduzione live e inserisci il nome del generatore che hai creato nel passaggio 1.
- Attiva le impostazioni avanzate dei suggerimenti per utilizzare i dati delle conversazioni non modificati per i suggerimenti.
- Attiva le impostazioni di telefonia per utilizzare l'API di streaming bidirezionale.
- Inserisci 16000 per Frequenza di campionamento (Hz).
- Fai clic su Salva.
Passaggio 4: inizializza la modalità conferenza
Il servizio di modalità conferenza funziona con il seguente flusso di lavoro per gestire gli stream audio misti in una chiamata con più partecipanti:
- Aggiungi il tuo numero di telefono GTP dedicato come terzo partecipante per integrare la traduzione audio in tempo reale in una chiamata attiva. Utilizza la funzionalità di conferenza a tre standard disponibile sulle piattaforme di telefonia e contact center più comuni.
- Al momento della connessione, il GTP riceve immediatamente un singolo flusso audio misto e lo elabora tramite una richiesta
bidiStreamingAnalyzeContent. - Il modello Gemini sintetizza la traduzione audio in base all'audio di input e consente la trascrizione di entrambi gli audio originali.Traduce l'audio attribuito e lo riproduce nella conferenza a tre per tutti i partecipanti.