Guia do usuário da tradução instantânea de A2A

A tradução de áudio para áudio (A2A) permite que os agentes se comuniquem com os clientes no idioma deles. Para ativar a tradução A2A ao vivo na configuração de atendimento ao cliente, siga estas etapas no console do Agent Assist.

Etapa 1: criar um gerador

  1. Acesse Tradução ao vivo e clique em Criar.
  2. Insira um nome do gerador e os idiomas de destino para o agente e o cliente.
  3. Acesse Canal de conversa e escolha a voz.
  4. Ative o Modo de conferência.
  5. Clique em Salvar.
  1. Siga estas instruções para criar um perfil de conversa com um número da Google Telephony Platform (GTP) anexado. Isso vai criar um perfil de conversa com um agente virtual.
  2. Acesse Escolher usar o Dialogflow e desative o Agente virtual.
  3. Acesse Configurações de voz > Configuração de SIP e desative a opção Permitir interação do agente virtual.

Etapa 3: configurar o perfil de conversa

Siga estas etapas para configurar o perfil de conversa criado na etapa 2.

  1. Acesse Perfis de conversa> Tipos de sugestão.
  2. Selecione Tradução ao vivo e insira o nome do gerador criado na etapa 1.
  3. Ative as Configurações avançadas de sugestão para usar dados de conversa não editados para sugestão.
  4. Ative as Configurações de telefonia para usar a API de streaming bidirecional.
  5. Insira 16000 em Taxa de amostragem em Hertz.
  6. Clique em Salvar.

Etapa 4: inicializar o modo de conferência

O serviço de modo de conferência opera com o seguinte fluxo de trabalho para processar streams de áudio mistos em uma chamada com várias pessoas:

  1. Adicione seu número de telefone GTP dedicado como um terceiro participante para integrar a tradução de áudio ao vivo a uma chamada ativa. Use a funcionalidade de conferência padrão de três vias disponível em plataformas comuns de telefonia e call center.
  2. A GTP recebe imediatamente um stream de áudio único e misto após a conexão e o processa por meio de uma solicitação bidiStreamingAnalyzeContent.
  3. O modelo do Gemini sintetiza a tradução de áudio com base no áudio de entrada e permite a transcrição dos dois áudios originais.Ele traduz o áudio atribuído e reproduz o áudio traduzido na conferência de três vias para todos os participantes.