Configuración avanzada de voz

En esta guía, se proporciona una configuración avanzada y adicional para las funciones de voz. Para activar y desactivar esta configuración avanzada, ve a Configuración del agente > Voz y IVR > Speech-to-Text > Configuración avanzada de voz.

Estas opciones de configuración están disponibles en la configuración del agente (se aplica a todo el agente), la configuración de flujo (se aplica a todo el flujo y anula la configuración del agente), la configuración de la página (se aplica a la página y anula la configuración del flujo y del agente) y la configuración de entrega (se aplica a la entrega, y anula la configuración de la página, el flujo y el agente). Un subconjunto de esta configuración está disponible en cada nivel, según la relevancia de la configuración del nivel. *Antes de configurar estos parámetros en cualquier nivel inferior, primero debes marcar la casilla Habilitar la configuración avanzada de voz a nivel del agente (Configuración del agente > Voz y IVR > Speech-to-Text > Configuración avanzada de voz)*.

La configuración actualizada a nivel del agente no se propaga a los niveles de flujo, página y entrega cuando se selecciona la opción Personalizar en estos niveles inferiores. Si la opción Personalizar abarca varios parámetros de configuración y deseas actualizar solo algunos de ellos, es posible que también debas actualizar otros parámetros de configuración si quieres que sean iguales a la configuración a nivel del agente.

Disponibilidad de la configuración por nivel

En la siguiente tabla, se indica qué configuración avanzada de voz está disponible en cada nivel:

Nombre del parámetro de configuración Agente Flujo Página Entrega
Selección de modelo (Speech-to-Text)
Sensibilidad cuando se deja de escuchar una voz
Sensibilidad avanzada cuando se deja de escuchar una voz basada en el tiempo de espera
Habilita la detección inteligente de extremos
Sin tiempo de espera de voz
Interrumpir
Permite la cancelación de la reproducción de respuestas parciales
Bucket de exportación de audio
DTMF

Selección de modelo (Speech-to-Text)

Se puede configurar a nivel del agente, del flujo y de la página.

Establece el modelo de voz que se usa para el reconocimiento de voz. Este parámetro de configuración es específico del idioma, por lo que puedes seleccionar diferentes modelos para diferentes idiomas. También puedes marcar Anular el modelo de voz a nivel de la solicitud, lo que hará que se use el modelo seleccionado, incluso si una llamada a la API de tiempo de ejecución especifica un modelo diferente modelo.

Para la Puerta de enlace telefónica de Dialogflow CX, consulta las limitaciones. Para obtener más información, consulta Modelos de voz.

Sensibilidad cuando se deja de escuchar una voz

Se puede configurar a nivel del agente, del flujo y de la página.

Controla la sensibilidad para reconocer el final de la voz en la entrada de audio del usuario final. El valor varía de 0 (baja sensibilidad, menos probabilidades de finalizar la voz) a 100 (alta sensibilidad, más probabilidades de finalizar la voz).

Sensibilidad avanzada cuando se deja de escuchar una voz basada en el tiempo de espera

Se puede configurar a nivel del agente y desactivar a nivel del flujo y de la página.

Si este parámetro de configuración está habilitado, el valor del parámetro de configuración Sensibilidad cuando se deja de escuchar una voz se usa como indicador para establecer un tiempo de espera de silencio de audio relativo para determinar el final de la voz. Si este parámetro de configuración está inhabilitado (opción predeterminada), el valor del parámetro de configuración Sensibilidad cuando se deja de escuchar una voz se usa para determinar el final de la voz mediante el modelo de AA proporcionado por Google Cloud Voz a texto.

Si bien el parámetro de configuración Sensibilidad cuando se deja de escuchar una voz solo admite el modelo de voz phone_call para la etiqueta de en-US idioma de forma predeterminada, el parámetro de configuración Habilitar la sensibilidad avanzada cuando se deja de escuchar una voz basada en el tiempo de espera permite configurar la sensibilidad cuando se deja de escuchar una voz para todos los idiomas y modelos de voz compatibles con Dialogflow.

Habilita la detección inteligente de extremos

Solo se puede configurar a nivel del agente.

Si este parámetro de configuración está habilitado, Dialogflow CX analizará la entrada parcial del usuario para determinar el final de la voz. Por ejemplo, si el usuario dice “Me gustaría” y hace una pausa, Dialogflow CX esperará a que el usuario continúe la oración.

Esto es particularmente útil para la recopilación de parámetros numéricos, en la que el usuario podría decir “1234” y hacer una pausa antes de decir “5678”. Para aplicar este parámetro de configuración a un parámetro específico, debes configurar la detección inteligente de extremos en el formulario del parámetro.

Este parámetro de configuración solo está disponible para la etiqueta de idioma en-US y está inhabilitado de forma predeterminada.

Sin tiempo de espera de voz

Se puede configurar a nivel del agente, del flujo y de la página.

El tiempo en segundos durante el cual Dialogflow CX dejará de esperar la entrada de audio del usuario final. El valor predeterminado es de 5 segundos y el valor máximo es de 60 segundos. Para este tiempo de espera, Dialogflow CX invoca un evento de no entrada.

Interrumpir

Se puede configurar a nivel del agente, del flujo y de la entrega.

Cuando está habilitado, un usuario final puede interrumpir el audio de respuesta de Dialogflow CX. Cuando se interrumpe, Dialogflow CX dejará de enviar audio y procesará la siguiente entrada del usuario final.

Si hay varios mensajes en la cola de mensajes, y un mensaje se puso en cola mediante una entrega asociada con una página, un flujo o un agente que tiene habilitada la interrupción, todos los mensajes siguientes de la cola también tendrán habilitada la interrupción. En este caso, la integración dejará de reproducir audio para todos los mensajes en cola con la opción habilitada.

Permite la cancelación de la reproducción de respuestas parciales

Solo se puede configurar a nivel de la entrega.

Puedes habilitar este parámetro de configuración cuando la casilla Habilitar la configuración avanzada de voz esté marcada en Configuración del agente > Voz y IVR y la respuesta parcial esté habilitada a nivel de la entrega. Este parámetro de configuración permite la cancelación de la reproducción de respuestas parciales.

Si una entrega crea un mensaje en la cola de mensajes que permite la cancelación, se cancela la reproducción del mensaje si se agrega otro mensaje a la cola. Esto es útil cuando quieres que un mensaje inicial comience a reproducirse, pero que se cancele si un webhook en funcionamiento produce otro mensaje antes de que se complete la reproducción del mensaje inicial.

Bucket de exportación de audio

Se puede configurar a nivel del agente y del flujo.

Si se proporciona, los datos de audio asociados con una solicitud se guardarán en el bucket de Cloud Storage:

Audio guardado Solicitudes aplicables
Entrada de audio del usuario final DetectIntent, StreamingDetectIntent, AnalyzeContent, StreamingAnalyzeContent
Audio de Text-to-Speech (TTS) sintetizado para una respuesta AnalyzeContent, StreamingAnalyzeContent

Otorga la función creador de objetos de almacenamiento a las siguientes cuentas de servicio del proyecto:

  • A la cuenta de servicio con el formato one-click@df-cx-ALPHANUMERIC_VALUE-ALPHANUMERIC_VALUE.iam.gserviceaccount.com si usas una integración de telefonía incorporada para socios.

  • A la cuenta de servicio con el formato service-PROJECT_NUMBER@gcp-sa-dialogflow.iam.gserviceaccount.com si usas la integración de la Puerta de enlace telefónica de Dialogflow CX. Para encontrar esta cuenta de servicio en IAM, marca la opción Incluir asignaciones de funciones proporcionadas por Google.

DTMF

Consulta la documentación de DTMF (señalización multifrecuencia de doble tono) para obtener más información sobre esta función.