La fonctionnalité de masquage audio de Customer Experience Insights est un framework Open Source qui détecte et masque automatiquement les informations personnelles sensibles dans les enregistrements audio. Elle fournit une solution sécurisée, évolutive et personnalisable aux organisations qui doivent traiter des données audio tout en respectant les réglementations sur la confidentialité.
Cette solution sert d'intermédiaire entre vos points d'ingestion audio bruts et vos plates-formes de stockage ou d'analyse à long terme. Elle traite automatiquement les fichiers audio pour supprimer les données sensibles telles que :
- Numéros de cartes de crédit
- votre numéro de sécurité sociale ;
- Numéros de téléphone
- Adresses e-mail
- Entités personnalisées définies par votre organisation
En masquant ces informations avant le stockage permanent, vous vous assurez que vos data lakes et vos outils d'analyse ne contiennent pas de données toxiques, ce qui réduit les risques de non-conformité et d'exposition des données.
Principales fonctionnalités
- Masquage automatisé : utilise Speech-to-Text et la protection des données sensibles pour transcrire, identifier et masquer les segments sensibles des fichiers audio.
- Prise en charge des déclencheurs doubles : les options de déploiement flexibles vous permettent de déclencher le masquage immédiatement lors de l'importation de fichiers dans Cloud Storage ou en aval après le traitement par Customer Experience Insights.
- Sécurité d'entreprise : conçue avec une architecture "sécurisée par défaut", la fonctionnalité de masquage audio de Customer Experience Insights est compatible avec les VPC privés, VPC Service Controls et les vérifications de sécurité de la chaîne d'approvisionnement pour empêcher tout accès non autorisé et toute falsification de code.
- Évolutivité : basé sur Dataflow, le pipeline s'adapte automatiquement pour gérer des volumes massifs de données audio, ce qui le rend adapté aux centres de contact à haut débit.
- Sortie vérifiable : génère à la fois le fichier audio masqué et une transcription du masquage, ce qui permet la vérification et les pistes d'audit.
Fonctionnement
La solution suit un pipeline de traitement linéaire :
Ingestion et déclenchement :
- Option A (directe) : un fichier audio est importé dans un bucket Cloud Storage "brut" . Un déclencheur Cloud Run lance immédiatement le pipeline.
- Option B (Insights): CX Insights traite une conversation. Un message Pub/Sub déclenche le service Cloud Run, qui lance ensuite le pipeline.
Traitement (Dataflow). Le nœud de calcul Dataflow effectue les opérations suivantes :
- Récupère le fichier audio.
- Envoie l'audio à Speech-to-Text pour générer une transcription horodatée.
- Envoie la transcription à la protection des données sensibles pour identifier les décalages temporels des informations sensibles.
- Utilise
ffmpegpour mettre en sourdine les segments audio correspondant aux informations personnelles identifiées.
Sortie. Une fonction Cloud Run effectue les opérations suivantes :
- Facultatif : déplace l'audio brut d'origine vers un bucket "archive" sécurisé.
- Réécrit l'audio masqué à l'emplacement d'origine ou dans un bucket de sortie spécifié, en remplaçant les segments sensibles par du silence ou une tonalité.
Commencer
Pour utiliser cette solution, vous devez disposer d'un Google Cloud projet pour lequel la facturation est activée.
Prérequis
- Google Cloud Projet
gcloudCLI installée et authentification effectuée- Activation et accès aux services Dataflow, Speech-to-Text et Protection des données sensibles Google Cloud
Accès et déploiement
Le code source complet et les instructions de déploiement sont disponibles dans le dépôt GitHub.