A tradução de áudio para áudio (A2A) permite que os agentes se comuniquem com os clientes no idioma deles. Para ativar a tradução A2A ao vivo na configuração de atendimento ao cliente, siga estas etapas no console do Agent Assist.
Etapa 1: criar um gerador
- Acesse Tradução ao vivo e clique em Criar.
- Insira um nome do gerador e os idiomas de destino para o agente e o cliente.
- Acesse Canal de conversa e escolha a voz.
- Ative o Modo de conferência.
- Clique em Salvar.
Etapa 2: criar um perfil de conversa e vincular um número de telefone
- Siga estas instruções para criar um perfil de conversa com um número da Google Telephony Platform (GTP) anexado. Isso vai criar um perfil de conversa com um agente virtual.
- Acesse Escolher usar o Dialogflow e desative o Agente virtual.
- Acesse Configurações de voz > Configuração de SIP e desative a opção Permitir interação do agente virtual.
Etapa 3: configurar o perfil de conversa
Siga estas etapas para configurar o perfil de conversa criado na etapa 2.
- Acesse Perfis de conversa> Tipos de sugestão.
- Selecione Tradução ao vivo e insira o nome do gerador criado na etapa 1.
- Ative as Configurações avançadas de sugestão para usar dados de conversa não editados para sugestão.
- Ative as Configurações de telefonia para usar a API de streaming bidirecional.
- Insira 16000 em Taxa de amostragem em Hertz.
- Clique em Salvar.
Etapa 4: inicializar o modo de conferência
O serviço de modo de conferência opera com o seguinte fluxo de trabalho para processar streams de áudio mistos em uma chamada com várias pessoas:
- Adicione seu número de telefone GTP dedicado como um terceiro participante para integrar a tradução de áudio ao vivo a uma chamada ativa. Use a funcionalidade de conferência padrão de três vias disponível em plataformas comuns de telefonia e call center.
- A GTP recebe imediatamente um stream de áudio único e misto após a conexão e o processa por meio de uma solicitação
bidiStreamingAnalyzeContent. - O modelo do Gemini sintetiza a tradução de áudio com base no áudio de entrada e permite a transcrição dos dois áudios originais.Ele traduz o áudio atribuído e reproduz o áudio traduzido na conferência de três vias para todos os participantes.