Ce guide fournit des paramètres avancés supplémentaires pour les fonctionnalités de reconnaissance vocale. Vous pouvez activer et désactiver ces paramètres avancés en accédant à Paramètres de l'agent > Voix et réponse vocale interactive > Speech-to-Text > Paramètres vocaux avancés.
Ces paramètres sont disponibles dans les paramètres de l'agent (s'applique à l'ensemble de l'agent), les paramètres de flux (s'applique à l'ensemble du flux et remplace les paramètres de l'agent), les paramètres de page (s'applique à la page et remplace les paramètres de flux et d'agent) et les paramètres de fulfillment (s'applique au fulfillment et remplace les paramètres de page, flux et d'agent). Un sous-ensemble de ces paramètres est disponible à chaque niveau, en fonction de la pertinence du paramètre pour le niveau. *Avant de pouvoir configurer ces paramètres à un niveau inférieur, vous devez d'abord cocher la case Activer les paramètres vocaux avancés au niveau de l'agent (Paramètres de l'agent > Voix et réponse vocale interactive > Speech-to-Text > Paramètres vocaux avancés)*.
Les paramètres mis à jour au niveau de l'agent ne sont pas propagés aux niveaux du flux, de la page et du fulfillment lorsque l'option Personnaliser est sélectionnée à ces niveaux inférieurs. Si l'option Personnaliser englobe plusieurs paramètres et que vous ne souhaitez en modifier que certains, vous devrez peut-être également modifier d'autres paramètres si vous souhaitez qu'ils soient identiques à ceux définis au niveau de l'agent.
Disponibilité des paramètres par niveau
Le tableau suivant indique les paramètres vocaux avancés disponibles à chaque niveau :
| Nom du paramètre | Agent | Flux | Page | Fulfillment |
|---|---|---|---|---|
| Sélection du modèle (Speech-to-Text) | ✔ | ✔ | ✔ | |
| Sensibilité de la fin du contenu vocal | ✔ | ✔ | ✔ | |
| Sensibilité avancée de la fin du contenu vocal basée sur le délai avant expiration | ✔ | ✔ | ✔ | |
| Activer la détection intelligente des points de terminaison | ✔ | |||
| Délai avant expiration de la reconnaissance vocale | ✔ | ✔ | ✔ | |
| Barge-in | ✔ | ✔ | ✔ | |
| Autoriser l'annulation de la lecture de la réponse partielle | ✔ | |||
| Bucket d'exportation audio | ✔ | ✔ | ||
| DTMF | ✔ | ✔ | ✔ |
Sélection du modèle (Speech-to-Text)
Peut être défini au niveau de l'agent, du flux et de la page.
Définit le modèle vocal utilisé pour la reconnaissance vocale. Ce paramètre est spécifique à la langue. Vous pouvez donc sélectionner différents modèles pour différentes langues. Vous pouvez également cocher la case Remplacer le modèle vocal au niveau de la requête pour que le modèle sélectionné soit utilisé même si un appel d'API d'exécution spécifie un autre modèle.
Pour la passerelle de téléphonie Dialogflow CX, consultez les limites. Pour en savoir plus, consultez la page Modèles vocaux.
Sensibilité de la fin du contenu vocal
Peut être défini au niveau de l'agent, du flux et de la page.
Contrôle la sensibilité de la reconnaissance de fin de voix dans les entrées audio de l'utilisateur final. La valeur varie de 0 (faible sensibilité, probabilité plus faible de fin de voix) à 100 (haute sensibilité, probabilité plus élevée de fin de voix).
Sensibilité avancée de la fin du contenu vocal basée sur le délai avant expiration
Peut être défini au niveau de l'agent et désactivé aux niveaux du flux et de la page.
Si ce paramètre est activé, la valeur du paramètre Sensibilité de la fin du contenu vocal est utilisée comme indicateur pour établir un délai d'inactivité audio relatif afin de déterminer la fin du contenu vocal. Si ce paramètre est désactivé (par défaut), la valeur du paramètre Sensibilité de la fin du contenu vocal est utilisée pour déterminer la fin du contenu vocal par le modèle de ML fourni par Google Cloud Speech-to-Text.
Alors que le paramètre Sensibilité de la fin du contenu vocal n'est compatible par défaut qu'avec le phone_call
modèle vocal pour le en-US tag de langue, le paramètre Activer la sensibilité avancée de la fin du contenu vocal basée sur le délai avant expiration
permet de configurer la sensibilité de la fin du contenu vocal pour toutes les langues et tous les
modèles vocaux compatibles avec Dialogflow.
Activer la détection intelligente des points de terminaison
Ne peut être défini qu'au niveau de l'agent.
Si ce paramètre est activé, Dialogflow CX analyse l'entrée utilisateur partielle pour déterminer la fin du contenu vocal. Par exemple, si l'utilisateur dit "Je voudrais" et fait une pause, Dialogflow CX attend qu'il continue la phrase.
Cela est particulièrement utile pour la collecte de paramètres numériques, où l'utilisateur peut dire "1234" et faire une pause avant de dire "5678". Pour appliquer ce paramètre à un paramètre spécifique, vous devez configurer la détection intelligente des points de terminaison dans le formulaire du paramètre.
Ce paramètre n'est disponible que pour le tag de langue en-US et est désactivé par défaut.
Délai avant expiration de la reconnaissance vocale
Peut être défini au niveau de l'agent, du flux et de la page.
Durée en secondes pendant laquelle Dialogflow CX arrête d'attendre l'entrée audio de l'utilisateur final. La valeur par défaut est de 5 secondes, et la valeur maximale est de 60 secondes. Pour ce délai, Dialogflow CX appelle un événement sans entrée.
Barge-in
Peut être défini au niveau de l'agent, du flux et du fulfillment.
Lorsque ce paramètre est activé, un utilisateur final peut interrompre le contenu audio de la réponse Dialogflow CX. Lorsqu'il est interrompu, Dialogflow CX arrête l'envoi du contenu audio et traite la prochaine entrée de l'utilisateur final.
si la file d'attente de messages comporte plusieurs messages, et qu'un message a été mis en file d'attente par un fulfillment associé à une page, à un flux ou à un agent sur lequel la désynchronisation (barge-in) est activée, alors tous les messages suivants de la file d'attente auront également la désynchronisation activée. Dans ce cas, l'intégration arrête la lecture du contenu audio de tous les messages en file d'attente avec la fonctionnalité de désynchronisation (barge-in) activée.
Autoriser l'annulation de la lecture de la réponse partielle
Ne peut être défini qu'au niveau du fulfillment.
Vous pouvez activer ce paramètre lorsque la case Activer les paramètres vocaux avancés est cochée dans Paramètres de l'agent > Voix et réponse vocale interactive et que la réponse partielle est activée au niveau du fulfillment. Ce paramètre permet d'annuler la lecture d'une réponse partielle.
Si un message de la file d'attente est créé par un fulfillment qui autorise l'annulation, la lecture du message est annulée si un autre message est ajouté à la file d'attente. Cela est utile lorsque vous souhaitez qu'un message initial commence à être lu, mais que cette lecture soit annulée si un webhook fonctionnel produit un autre message avant la fin de la lecture du message initial.
Bucket d'exportation audio
Peut être défini au niveau de l'agent et du flux.
Si des données audio sont fournies, elles sont enregistrées dans le bucket Cloud Storage :
| Audio enregistré | Requêtes applicables |
|---|---|
| Entrée audio de l'utilisateur final | DetectIntent, StreamingDetectIntent, AnalyzeContent, StreamingAnalyzeContent |
| Audio de Text-to-Speech (TTS) synthétisé pour une réponse | AnalyzeContent, StreamingAnalyzeContent |
Attribuez le rôle Créateur des objets de l'espace de stockage aux comptes de service suivants dans votre projet :
Au compte de service au format
one-click@df-cx-ALPHANUMERIC_VALUE-ALPHANUMERIC_VALUE.iam.gserviceaccount.comsi vous utilisez une intégration téléphonique intégrée de partenaires.Au compte de service au format
service-PROJECT_NUMBER@gcp-sa-dialogflow.iam.gserviceaccount.comsi vous utilisez l'intégration de passerelle de téléphonie Dialogflow CX. Pour trouver ce compte de service dans IAM, cochez l'option Inclure les attributions de rôles fournies par Google.
DTMF
Pour en savoir plus sur cette fonctionnalité, consultez la documentation DTMF (Dual-tone multi-frequency signaling).