Panduan pengguna terjemahan A2A langsung

Google Cloud

Terjemahan audio-ke-audio (A2A) langsung memungkinkan agen berkomunikasi dengan lancar bersama pelanggan dalam bahasa mereka sendiri. Untuk mengaktifkan terjemahan A2A langsung untuk penyiapan layanan pelanggan Anda, ikuti langkah-langkah berikut di konsol Agent Assist.

Langkah 1: Buat generator

  1. Buka Terjemahan langsung dan klik Buat.
  2. Masukkan Nama generator dan bahasa target untuk agen dan pelanggan.
  3. Buka Channel percakapan dan pilih suara.
  4. Aktifkan Mode konferensi.
  5. Klik Simpan.
  1. Ikuti petunjuk berikut untuk membuat profil percakapan dengan nomor Google Telephony Platform (GTP) yang dilampirkan. Tindakan ini akan membuat profil percakapan dengan agen virtual.
  2. Buka Pilih untuk menggunakan Dialogflow dan nonaktifkan Agen virtual.
  3. Buka Konfigurasi suara > Konfigurasi SIP dan nonaktifkan Izinkan interaksi agen virtual.

Langkah 3: Konfigurasi profil percakapan

Ikuti langkah-langkah berikut untuk mengonfigurasi profil percakapan yang dibuat pada langkah 2.

  1. Buka Profil percakapan> Jenis saran.
  2. Pilih Terjemahan langsung dan masukkan nama generator yang Anda buat pada langkah 1.
  3. Aktifkan Setelan saran lanjutan untuk menggunakan data percakapan yang tidak disamarkan untuk saran.
  4. Aktifkan Setelan telepon untuk menggunakan bidirectional streaming API.
  5. Masukkan 16000 untuk Hertz Frekuensi Sampel.
  6. Klik Simpan.

Langkah 4: Inisialisasi mode konferensi

Layanan mode konferensi beroperasi dengan alur kerja berikut untuk menangani aliran audio campuran dalam panggilan multi-pihak:

  1. Tambahkan nomor telepon GTP khusus Anda sebagai peserta ketiga untuk mengintegrasikan terjemahan audio langsung ke dalam panggilan aktif. Gunakan fungsi konferensi tiga pihak standar yang tersedia di platform telepon dan pusat kontak umum.
  2. GTP akan langsung menerima satu streaming audio campuran setelah terhubung dan memprosesnya melalui permintaan bidiStreamingAnalyzeContent.
  3. Model Gemini mensintesis terjemahan audio berdasarkan audio input dan mengaktifkan transkripsi untuk kedua audio asli.Model ini menerjemahkan audio yang dikaitkan dan memutar kembali audio yang diterjemahkan ke dalam konferensi tiga pihak untuk semua peserta.