Anleitung zur Live-A2A-Übersetzung

Mit der Live-Audio-zu-Audio-Übersetzung (A2A) können Agenten nahtlos mit Kunden in ihrer eigenen Sprache kommunizieren. So aktivieren Sie die Live-A2A-Übersetzung für Ihre Kundenserviceeinrichtung: Folgen Sie dieser Anleitung in der Agent Assist-Konsole.

Schritt 1: Generator erstellen

  1. Rufen Sie Live-Übersetzung auf und klicken Sie auf Erstellen.
  2. Geben Sie einen Generatornamen und die Zielsprachen für den Agenten und den Kunden ein.
  3. Rufen Sie Unterhaltungskanal auf und wählen Sie „Sprache“ aus.
  4. Aktivieren Sie den Konferenzmodus.
  5. Klicken Sie auf Speichern.
  1. Folgen Sie dieser Anleitung, um ein Unterhaltungsprofil mit einer Google Telephony Platform-Nummer (GTP) zu erstellen. Dadurch wird ein Unterhaltungsprofil mit einem virtuellen Kundenservicemitarbeiter erstellt.
  2. Rufen Sie Dialogflow verwenden auf und deaktivieren Sie den virtuellen Kundenservicemitarbeiter.
  3. Rufen Sie Sprachkonfigurationen > SIP-Konfiguration auf und deaktivieren Sie Interaktion mit virtuellem Kundenservicemitarbeiter zulassen.

Schritt 3: Unterhaltungsprofil konfigurieren

Folgen Sie dieser Anleitung, um das in Schritt 2 erstellte Unterhaltungsprofil zu konfigurieren.

  1. Rufen Sie Unterhaltungsprofile> Vorschlagstypen auf.
  2. Wählen Sie Live-Übersetzung aus und geben Sie den in Schritt 1 erstellten Generatornamen ein.
  3. Aktivieren Sie Erweiterte Vorschlagseinstellungen , um nicht bearbeitete Unterhaltungsdaten für Vorschläge zu verwenden.
  4. Aktivieren Sie Telefoneinstellungen , um die bidirektionale Streaming-API zu verwenden.
  5. Geben Sie unter Abtastrate in Hertz den Wert 16000 ein.
  6. Klicken Sie auf Speichern.

Schritt 4: Konferenzmodus initialisieren

Der Dienst für den Konferenzmodus verwendet den folgenden Workflow, um gemischte Audiostreams in einem Anruf mit mehreren Teilnehmern zu verarbeiten:

  1. Fügen Sie Ihre dedizierte GTP-Telefonnummer als dritten Teilnehmer hinzu, um die Live-Audioübersetzung in einen aktiven Anruf zu integrieren. Verwenden Sie die Standardfunktion für Dreierkonferenzen, die auf gängigen Telefonie- und Contact Center-Plattformen verfügbar ist.
  2. Die GTP empfängt nach der Verbindung sofort einen einzelnen gemischten Audiostream und verarbeitet ihn über eine bidiStreamingAnalyzeContent-Anfrage.
  3. Das Gemini-Modell synthetisiert die Audioübersetzung basierend auf der Audioeingabe und ermöglicht die Transkription für beide Original-Audiodateien.Es übersetzt die zugeordnete Audioausgabe und gibt die übersetzte Audioausgabe für alle Teilnehmer in der Dreierkonferenz wieder.