Este guia fornece configurações adicionais e avançadas para recursos de fala. Para ativar e desativar essas configurações avançadas, acesse Configurações do agente > Fala e URA > Speech-to-Text > Configurações de fala avançadas.
Essas configurações estão disponíveis nas configurações do agente (aplica-se a todo o agente): configurações de fluxo (aplica-se a todo o fluxo e modifica as configurações do agente), configurações da página (aplica-se à página e modifica as configurações de fluxo e agente) e configurações de atendimento do pedido (aplica-se ao fulfillment e modifica as configurações de página, fluxo e agente). Um subconjunto dessas configurações está disponível em cada nível, dependendo da relevância da configuração para o nível. *Antes de configurar essas configurações em qualquer nível inferior, primeiro marque a caixa Ativar configurações de fala avançadas no nível do agente (Configurações do agente > Fala e URA > Speech-to-Text > Configurações de fala avançadas)*.
As configurações atualizadas no nível do agente não são propagadas para o fluxo, a página e o fulfillment quando a opção Personalizar é selecionada nesses níveis mais baixos. Se a opção Personalizar abranger várias configurações e você quiser atualizar apenas algumas delas, talvez também seja necessário atualizar outras configurações se quiser que elas sejam iguais às configurações no nível do agente.
Disponibilidade de configurações por nível
A tabela a seguir indica quais configurações de fala avançadas estão disponíveis em cada nível:
| Nome da configuração | Agente | Fluxo | Página | Fulfillment |
|---|---|---|---|---|
| Seleção de modelo (conversão Speech-to-Text) | ✔ | ✔ | ✔ | |
| Sensibilidade ao fim da fala | ✔ | ✔ | ✔ | |
| Sensibilidade avançada ao fim da fala com base no tempo limite | ✔ | ✔ | ✔ | |
| Ativar o endpoint inteligente | ✔ | |||
| Sem tempo limite de fala | ✔ | ✔ | ✔ | |
| Interrupção | ✔ | ✔ | ✔ | |
| Permitir o cancelamento da reprodução de resposta parcial | ✔ | |||
| Bucket de exportação de áudio | ✔ | ✔ | ||
| DTMF | ✔ | ✔ | ✔ |
Seleção de modelo (conversão Speech-to-Text)
Pode ser definido nos níveis de agente, fluxo e página.
Define o modelo de fala usado para reconhecimento de voz. Essa configuração é específica do idioma. Portanto, você pode selecionar modelos diferentes para idiomas diferentes. Você também pode marcar a opção Substituir o modelo de fala no nível da solicitação, que fará com que o modelo selecionado seja usado mesmo que uma chamada de API de execução especifique um modelo diferente.
Para o gateway telefônico do Dialogflow CX, consulte as limitações. Para mais informações, consulte Modelos de fala.
Sensibilidade ao fim da fala
Pode ser definido nos níveis de agente, fluxo e página.
Controla a sensibilidade do reconhecimento do final da fala na entrada de áudio do usuário final. O valor varia de 0 (baixa sensibilidade, menos probabilidade de terminar a fala) a 100 (alta sensibilidade, maior probabilidade de terminar a fala).
Sensibilidade avançada ao fim da fala com base no tempo limite
Pode ser definido no nível do agente e desativado nos níveis de fluxo e página.
Se essa configuração estiver ativada, o valor da configuração Sensibilidade ao fim da fala será usado como um indicador para estabelecer um tempo limite de silêncio de áudio relativo para determinar o fim da fala. Se essa configuração estiver desativada (o padrão), o valor da configuração Sensibilidade ao fim da fala será usado para determinar o fim da fala pelo modelo de ML fornecido pela Google Cloud conversão de voz em texto.
Embora a configuração Sensibilidade ao fim da fala ofereça suporte apenas ao phone_call
modelo de fala para a en-US tag
de idioma por padrão, a configuração Ativar a sensibilidade avançada ao fim da fala com base no tempo limite
permite configurar a sensibilidade ao fim da fala para todos os idiomas e
modelos de fala com suporte do Dialogflow.
Ativar o endpoint inteligente
Pode ser definido apenas no nível do agente.
Se essa configuração estiver ativada, o Dialogflow CX vai analisar a entrada parcial do usuário para determinar o fim da fala. Por exemplo, se o usuário disser "Eu gostaria de" e pausar, o Dialogflow CX vai esperar que o usuário continue a frase.
Isso é especialmente útil para a coleta de parâmetros numéricos, em que o usuário pode dizer "1234" e pausar antes de dizer "5678". Para aplicar essa configuração a um parâmetro específico, é necessário configurar o endpoint inteligente em o formulário do parâmetro.
Essa configuração está disponível apenas para a tag de idioma en-US e está desativada por padrão.
Sem tempo limite de fala
Pode ser definido nos níveis de agente, fluxo e página.
O tempo em segundos que o Dialogflow CX deixará de aguardar pela entrada de áudio do usuário final. O padrão é de 5 segundos, e o valor máximo é de 60 segundos. Para esse tempo limite, o Dialogflow CX invoca um evento sem entrada.
Interrupção
Pode ser definido nos níveis de agente, fluxo e fulfillment.
Quando ativado, um usuário final pode interromper o áudio da resposta do Dialogflow CX. Quando interrompido, o Dialogflow CX interromperá o envio de áudio e processará a próxima entrada do usuário final.
Se houver várias mensagens na fila de mensagens, e uma mensagem foi enfileirada por um fulfillment associado a uma página, um fluxo ou um agente com carregamento ativado, todas as mensagens seguintes na fila também terão a ativação ativada. Nesse caso, a integração deixará de reproduzir áudio para todas as mensagens na fila com a ativação ativada.
Permitir o cancelamento da reprodução de resposta parcial
Pode ser definido apenas no nível do fulfillment.
Você pode ativar essa configuração quando a caixa Ativar configurações de fala avançadas estiver marcada em Configurações do agente > Fala e URA e a resposta parcial estiver ativada no nível do fulfillment. Essa configuração permite o cancelamento de uma reprodução de resposta parcial.
Se uma mensagem na fila de mensagens for criada por um fulfillment que permita o cancelamento, a reprodução da mensagem será cancelada se outra mensagem for adicionada à fila. Isso é útil quando você quer que uma mensagem inicial comece a reprodução, mas que essa reprodução seja cancelada se um webhook de trabalho produzir outra mensagem antes que a reprodução da mensagem inicial seja concluída.
Bucket de exportação de áudio
Pode ser definido nos níveis de agente e fluxo.
Se fornecidos, todos os dados de áudio associados a uma solicitação serão salvos no bucket do Cloud Storage:
| Áudio salvo | Solicitações aplicáveis |
|---|---|
| Entrada de áudio do usuário final | DetectIntent, StreamingDetectIntent, AnalyzeContent, StreamingAnalyzeContent |
| Áudio de conversão da Text-to-Speech (TTS) sintetizado para uma resposta | AnalyzeContent, StreamingAnalyzeContent |
Conceda o papel Criador de objetos do Storage às seguintes contas de serviço no seu projeto:
Para a conta de serviço no formato
one-click@df-cx-ALPHANUMERIC_VALUE-ALPHANUMERIC_VALUE.iam.gserviceaccount.comse você usar uma integração de telefonia integrada por parceiro.Para a conta de serviço no formato
service-PROJECT_NUMBER@gcp-sa-dialogflow.iam.gserviceaccount.comse você usar a integração do gateway telefônico do Dialogflow CX. Para encontrar essa conta de serviço no IAM, marque a opção Incluir concessões de papel fornecidas pelo Google.
DTMF
Consulte a documentação de DTMF (sinalização multifrequencial de tom duplo) para mais informações sobre esse recurso.