Mit der Live-Audio-zu-Audio-Übersetzung (A2A) können Agenten nahtlos mit Kunden in ihrer eigenen Sprache kommunizieren. So aktivieren Sie die Live-A2A-Übersetzung für Ihre Kundenserviceeinrichtung: Folgen Sie dieser Anleitung in der Agent Assist-Konsole.
Schritt 1: Generator erstellen
- Rufen Sie Live-Übersetzung auf und klicken Sie auf Erstellen.
- Geben Sie einen Generatornamen und die Zielsprachen für den Agenten und den Kunden ein.
- Rufen Sie Unterhaltungskanal auf und wählen Sie „Sprache“ aus.
- Aktivieren Sie den Konferenzmodus.
- Klicken Sie auf Speichern.
Schritt 2: Unterhaltungsprofil erstellen und Telefonnummer verknüpfen
- Folgen Sie dieser Anleitung, um ein Unterhaltungsprofil mit einer Google Telephony Platform-Nummer (GTP) zu erstellen. Dadurch wird ein Unterhaltungsprofil mit einem virtuellen Kundenservicemitarbeiter erstellt.
- Rufen Sie Dialogflow verwenden auf und deaktivieren Sie den virtuellen Kundenservicemitarbeiter.
- Rufen Sie Sprachkonfigurationen > SIP-Konfiguration auf und deaktivieren Sie Interaktion mit virtuellem Kundenservicemitarbeiter zulassen.
Schritt 3: Unterhaltungsprofil konfigurieren
Folgen Sie dieser Anleitung, um das in Schritt 2 erstellte Unterhaltungsprofil zu konfigurieren.
- Rufen Sie Unterhaltungsprofile> Vorschlagstypen auf.
- Wählen Sie Live-Übersetzung aus und geben Sie den in Schritt 1 erstellten Generatornamen ein.
- Aktivieren Sie Erweiterte Vorschlagseinstellungen , um nicht bearbeitete Unterhaltungsdaten für Vorschläge zu verwenden.
- Aktivieren Sie Telefoneinstellungen , um die bidirektionale Streaming-API zu verwenden.
- Geben Sie unter Abtastrate in Hertz den Wert 16000 ein.
- Klicken Sie auf Speichern.
Schritt 4: Konferenzmodus initialisieren
Der Dienst für den Konferenzmodus verwendet den folgenden Workflow, um gemischte Audiostreams in einem Anruf mit mehreren Teilnehmern zu verarbeiten:
- Fügen Sie Ihre dedizierte GTP-Telefonnummer als dritten Teilnehmer hinzu, um die Live-Audioübersetzung in einen aktiven Anruf zu integrieren. Verwenden Sie die Standardfunktion für Dreierkonferenzen, die auf gängigen Telefonie- und Contact Center-Plattformen verfügbar ist.
- Die GTP empfängt nach der Verbindung sofort einen einzelnen gemischten Audiostream und verarbeitet ihn über eine
bidiStreamingAnalyzeContent-Anfrage. - Das Gemini-Modell synthetisiert die Audioübersetzung basierend auf der Audioeingabe und ermöglicht die Transkription für beide Original-Audiodateien.Es übersetzt die zugeordnete Audioausgabe und gibt die übersetzte Audioausgabe für alle Teilnehmer in der Dreierkonferenz wieder.