Configurações avançadas de fala

Este guia fornece configurações adicionais e avançadas para recursos de fala. Para ativar e desativar essas configurações avançadas, acesse Configurações do agente > Fala e URA > Speech-to-Text > Configurações de fala avançadas.

Essas configurações estão disponíveis nas configurações do agente (aplica-se a todo o agente): configurações de fluxo (aplica-se a todo o fluxo e modifica as configurações do agente), configurações da página (aplica-se à página e modifica as configurações de fluxo e agente) e configurações de atendimento do pedido (aplica-se ao fulfillment e modifica as configurações de página, fluxo e agente). Um subconjunto dessas configurações está disponível em cada nível, dependendo da relevância da configuração para o nível. *Antes de configurar essas configurações em qualquer nível inferior, primeiro marque a caixa Ativar configurações de fala avançadas no nível do agente (Configurações do agente > Fala e URA > Speech-to-Text > Configurações de fala avançadas)*.

As configurações atualizadas no nível do agente não são propagadas para o fluxo, a página e o fulfillment quando a opção Personalizar é selecionada nesses níveis mais baixos. Se a opção Personalizar abranger várias configurações e você quiser atualizar apenas algumas delas, talvez também seja necessário atualizar outras configurações se quiser que elas sejam iguais às configurações no nível do agente.

Disponibilidade de configurações por nível

A tabela a seguir indica quais configurações de fala avançadas estão disponíveis em cada nível:

Nome da configuração Agente Fluxo Página Fulfillment
Seleção de modelo (conversão Speech-to-Text)
Sensibilidade ao fim da fala
Sensibilidade avançada ao fim da fala com base no tempo limite
Ativar o endpoint inteligente
Sem tempo limite de fala
Interrupção
Permitir o cancelamento da reprodução de resposta parcial
Bucket de exportação de áudio
DTMF

Seleção de modelo (conversão Speech-to-Text)

Pode ser definido nos níveis de agente, fluxo e página.

Define o modelo de fala usado para reconhecimento de voz. Essa configuração é específica do idioma. Portanto, você pode selecionar modelos diferentes para idiomas diferentes. Você também pode marcar a opção Substituir o modelo de fala no nível da solicitação, que fará com que o modelo selecionado seja usado mesmo que uma chamada de API de execução especifique um modelo diferente.

Para o gateway telefônico do Dialogflow CX, consulte as limitações. Para mais informações, consulte Modelos de fala.

Sensibilidade ao fim da fala

Pode ser definido nos níveis de agente, fluxo e página.

Controla a sensibilidade do reconhecimento do final da fala na entrada de áudio do usuário final. O valor varia de 0 (baixa sensibilidade, menos probabilidade de terminar a fala) a 100 (alta sensibilidade, maior probabilidade de terminar a fala).

Sensibilidade avançada ao fim da fala com base no tempo limite

Pode ser definido no nível do agente e desativado nos níveis de fluxo e página.

Se essa configuração estiver ativada, o valor da configuração Sensibilidade ao fim da fala será usado como um indicador para estabelecer um tempo limite de silêncio de áudio relativo para determinar o fim da fala. Se essa configuração estiver desativada (o padrão), o valor da configuração Sensibilidade ao fim da fala será usado para determinar o fim da fala pelo modelo de ML fornecido pela Google Cloud conversão de voz em texto.

Embora a configuração Sensibilidade ao fim da fala ofereça suporte apenas ao phone_call modelo de fala para a en-US tag de idioma por padrão, a configuração Ativar a sensibilidade avançada ao fim da fala com base no tempo limite permite configurar a sensibilidade ao fim da fala para todos os idiomas e modelos de fala com suporte do Dialogflow.

Ativar o endpoint inteligente

Pode ser definido apenas no nível do agente.

Se essa configuração estiver ativada, o Dialogflow CX vai analisar a entrada parcial do usuário para determinar o fim da fala. Por exemplo, se o usuário disser "Eu gostaria de" e pausar, o Dialogflow CX vai esperar que o usuário continue a frase.

Isso é especialmente útil para a coleta de parâmetros numéricos, em que o usuário pode dizer "1234" e pausar antes de dizer "5678". Para aplicar essa configuração a um parâmetro específico, é necessário configurar o endpoint inteligente em o formulário do parâmetro.

Essa configuração está disponível apenas para a tag de idioma en-US e está desativada por padrão.

Sem tempo limite de fala

Pode ser definido nos níveis de agente, fluxo e página.

O tempo em segundos que o Dialogflow CX deixará de aguardar pela entrada de áudio do usuário final. O padrão é de 5 segundos, e o valor máximo é de 60 segundos. Para esse tempo limite, o Dialogflow CX invoca um evento sem entrada.

Interrupção

Pode ser definido nos níveis de agente, fluxo e fulfillment.

Quando ativado, um usuário final pode interromper o áudio da resposta do Dialogflow CX. Quando interrompido, o Dialogflow CX interromperá o envio de áudio e processará a próxima entrada do usuário final.

Se houver várias mensagens na fila de mensagens, e uma mensagem foi enfileirada por um fulfillment associado a uma página, um fluxo ou um agente com carregamento ativado, todas as mensagens seguintes na fila também terão a ativação ativada. Nesse caso, a integração deixará de reproduzir áudio para todas as mensagens na fila com a ativação ativada.

Permitir o cancelamento da reprodução de resposta parcial

Pode ser definido apenas no nível do fulfillment.

Você pode ativar essa configuração quando a caixa Ativar configurações de fala avançadas estiver marcada em Configurações do agente > Fala e URA e a resposta parcial estiver ativada no nível do fulfillment. Essa configuração permite o cancelamento de uma reprodução de resposta parcial.

Se uma mensagem na fila de mensagens for criada por um fulfillment que permita o cancelamento, a reprodução da mensagem será cancelada se outra mensagem for adicionada à fila. Isso é útil quando você quer que uma mensagem inicial comece a reprodução, mas que essa reprodução seja cancelada se um webhook de trabalho produzir outra mensagem antes que a reprodução da mensagem inicial seja concluída.

Bucket de exportação de áudio

Pode ser definido nos níveis de agente e fluxo.

Se fornecidos, todos os dados de áudio associados a uma solicitação serão salvos no bucket do Cloud Storage:

Áudio salvo Solicitações aplicáveis
Entrada de áudio do usuário final DetectIntent, StreamingDetectIntent, AnalyzeContent, StreamingAnalyzeContent
Áudio de conversão da Text-to-Speech (TTS) sintetizado para uma resposta AnalyzeContent, StreamingAnalyzeContent

Conceda o papel Criador de objetos do Storage às seguintes contas de serviço no seu projeto:

  • Para a conta de serviço no formato one-click@df-cx-ALPHANUMERIC_VALUE-ALPHANUMERIC_VALUE.iam.gserviceaccount.com se você usar uma integração de telefonia integrada por parceiro.

  • Para a conta de serviço no formato service-PROJECT_NUMBER@gcp-sa-dialogflow.iam.gserviceaccount.com se você usar a integração do gateway telefônico do Dialogflow CX. Para encontrar essa conta de serviço no IAM, marque a opção Incluir concessões de papel fornecidas pelo Google.

DTMF

Consulte a documentação de DTMF (sinalização multifrequencial de tom duplo) para mais informações sobre esse recurso.