Datastores

Les datastores sont utilisés par les outils de datastore pour trouver des réponses aux questions des utilisateurs finaux à partir de vos données. Les datastores sont un ensemble de sites Web, de documents ou de données dans des systèmes tiers, chacun faisant référence à vos données.

Lorsqu'un utilisateur final pose une question à l'agent, celui-ci recherche une réponse à partir du contenu source donné, puis résume les résultats dans une réponse cohérente. Il fournit également des liens vers les sources de la réponse pour permettre à l'utilisateur final d'en savoir plus. L'agent peut fournir jusqu'à cinq extraits de réponse pour une question donnée.

Sources de datastore

Vous pouvez utiliser différentes sources pour vos données :

Sources de data store à accès restreint

Google propose de nombreuses autres sources de data store first party et tierces en tant que fonctionnalité à accès restreint. Pour afficher les sources disponibles et demander l'accès, consultez Sources de data store supplémentaires.

Contenu de site Web

Lorsque vous ajoutez du contenu de site Web comme source, vous pouvez ajouter et exclure plusieurs sites. Lorsque vous spécifiez un site, vous pouvez utiliser des pages individuelles ou * comme caractère générique pour un modèle. Tout le contenu HTML et PDF sera traité.

Vous devez valider votre domaine lorsque vous utilisez du contenu de site Web comme source.

Limites :

  • Les fichiers provenant d'URL publiques doivent avoir été explorés par le plug-in d'indexation de recherche Google pour exister dans l'index de recherche. Vous pouvez vérifier cela à l'aide de la Google Search Console.
  • Jusqu'à 200 000 pages sont indexées. Si le data store contient plus de pages, l'indexation échoue à ce stade, mais tout contenu déjà indexé est conservé.

Importer des données

Vous pouvez importer des données depuis BigQuery ou Cloud Storage. Ces données peuvent être au format FAQ ou non structurées, et elles peuvent contenir des métadonnées ou ne pas en contenir.

Les options d'importation des données suivantes sont disponibles :

  • Ajouter/Mettre à jour des données : ajoute les documents fournis au data store. Si un nouveau document porte le même ID qu'un document existant, le nouveau document remplace l'ancien.
  • Écraser les données existantes : supprime toutes les données existantes et importe de nouvelles données. Cette action est irréversible.

Data store de FAQ

Les datastores peuvent contenir des réponses aux questions fréquentes. Lorsque les questions des utilisateurs correspondent avec un niveau de confiance élevé à une question importée, l'agent renvoie la réponse à cette question sans la modifier. Vous pouvez fournir un titre et une URL pour chaque paire de questions et réponses affichée par l'agent.

Importez des données dans le data store au format CSV. Chaque fichier doit inclure une ligne d'en-tête décrivant les colonnes.

Exemple :

"question","answer","title","url"
"Why is the sky blue?","The sky is blue because of Rayleigh scattering.","Rayleigh scattering","https://en.wikipedia.org/wiki/Rayleigh_scattering"
"What is the meaning of life?","42","",""

Vous pouvez omettre les colonnes title et url :

"answer","question"
"42","What is the meaning of life?"

Lors du processus d'importation, vous pouvez sélectionner un dossier dans lequel chaque fichier est traité comme un fichier CSV, quelle que soit l'extension du fichier.

Limites :

  • Un espace supplémentaire après , provoque une erreur.
  • Les lignes vides (même à la fin du fichier) provoquent une erreur.

Data store non structuré

Les datastores non structurés peuvent contenir du contenu dans les formats suivants :

  • HTML
  • PDF
  • TXT
  • CSV

Vous pouvez importer des fichiers depuis le bucket Cloud Storage d'un autre projet. Pour ce faire, accordez un accès explicite au processus d'importation. Suivez les instructions du message d'erreur, qui contient le nom de l'utilisateur qui a besoin d'un accès en lecture au bucket pour effectuer l'importation.

Limites :

  • La taille maximale des fichiers est de 2,5 Mo pour les formats basés sur du texte et de 100 Mo pour les autres formats.

Datastore avec métadonnées

Vous pouvez fournir un titre et une URL en tant que métadonnées. Lors d'une conversation, l'agent peut fournir ces informations pour aider les utilisateurs à accéder rapidement à des pages Web internes qui ne sont pas accessibles par le plug-in d'indexation de recherche Google.

Pour importer du contenu avec des métadonnées, vous devez fournir un ou plusieurs fichiers JSON Lines. Chaque ligne de ce fichier décrit un document. Vous n'importez pas directement les documents réels. Les URIs qui renvoient vers les chemins Cloud Storage sont fournis dans le fichier JSON Lines.

Pour fournir vos fichiers JSON Lines, indiquez un dossier Cloud Storage contenant ces fichiers. Ne placez aucun autre fichier dans ce dossier.

Descriptions de champs :

Champ Type Description
id chaîne Identifiant unique du document.
content.mimeType chaîne Type MIME du document. Les types "application/pdf" et "text/html" sont acceptés.
content.uri chaîne URI du document dans Cloud Storage.
structData chaîne Objet JSON sur une seule ligne avec les champs title et url facultatifs.

Exemple :

{ "id": "d001", "content": {"mimeType": "application/pdf", "uri": "gs://example-import/unstructured/first_doc.pdf"}, "structData": {"title": "First Document", "url": "https://internal.example.com/documents/first_doc.pdf"} }
{ "id": "d002", "content": {"mimeType": "application/pdf", "uri": "gs://example-import/unstructured/second_doc.pdf"}, "structData": {"title": "Second Document", "url": "https://internal.example.com/documents/second_doc.pdf"} }
{ "id": "d003", "content": {"mimeType": "text/html", "uri": "gs://example-import/unstructured/mypage.html"}, "structData": {"title": "My Page", "url": "https://internal.example.com/mypage.html"} }

Datastore sans métadonnées

Ce type de contenu ne comporte aucune métadonnée. Au lieu de cela, vous fournissez des liens URI vers les documents individuels. Le type de contenu est déterminé par l'extension du fichier.

Configuration de l'analyse et de la fragmentation

Selon la source de données, vous pouvez configurer les paramètres d'analyse et de fragmentation tels que définis par Agent Search.

Utiliser Cloud Storage pour un document de data store

Si votre contenu n'est pas public, nous vous recommandons de le stocker dans Cloud Storage. Lorsque vous créez des documents de data store, vous fournissez les URL de vos objets Cloud Storage au format suivant : gs://bucket-name/folder-name. Chaque document du dossier est ajouté au data store.

Lors de la création d'un bucket Cloud Storage :

  • Sélectionnez le projet que vous utilisez pour l'agent.
  • Utilisez la classe de stockage Standard.
  • Définissez l'emplacement du bucket sur le même emplacement que celui de votre agent.

Suivez le démarrage rapide de Cloud Storage pour créer un bucket et importer des fichiers.

Langues

Pour connaître les langues acceptées, consultez la colonne du data store dans la documentation de référence sur les langues.

Pour des performances optimales, créez des datastores dans une seule langue.

Après avoir créé un data store, vous pouvez éventuellement spécifier la langue du data store. Si vous définissez la langue du data store, vous pouvez connecter le data store à un agent configuré pour une autre langue. Par exemple, vous pouvez créer un data store en français connecté à un agent en anglais.

Régions où le service est disponible

Pour en savoir plus sur les régions disponibles, consultez la documentation de référence sur les régions.

(Accès restreint) Sources de data store supplémentaires

Les types de data store supplémentaires sont répertoriés dans le tableau suivant. Ils sont disponibles en tant que fonctionnalités à accès restreint. Vous pouvez remplir le formulaire de demande d'accès pour demander l'accès. Une fois votre demande approuvée, vous pourrez voir ces options lorsque vous créerez un data store dans Vertex AI Agent Builder.

Sources de data store tierces

Source de datastore Description
Box Importez des données depuis le site Box de votre organisation.
Confluence Cloud Importez des données depuis votre espace de travail Confluence Cloud.
Dropbox Importez des données depuis votre espace de stockage Dropbox.
EntraID Importez des données depuis le système EntraID de votre organisation.
Jira Cloud Importez des données depuis votre système de gestion des tâches Jira.
OneDrive Importez des données depuis l'espace de stockage OneDrive de votre organisation.
Microsoft Outlook Importez des données depuis Microsoft Outlook.
Salesforce Importez des données depuis Salesforce.
ServiceNow Importez des données depuis ServiceNow.
SharePoint Importez des données depuis le système SharePoint de votre organisation.
Slack Importez des données depuis Slack.
Microsoft Teams Importez des données depuis Microsoft Teams.

Configurer un data store tiers à l'aide d'un connecteur

Cette section décrit le processus de configuration d'un data store à l'aide de données tierces. Pour obtenir des instructions spécifiques à chaque source de données tierce, consultez la documentation de Vertex AI Agent Builder.

Fournisseurs d'identité

Les fournisseurs d'identité vous permettent de gérer les utilisateurs, les groupes et l'authentification. Lorsque vous configurez un data store tiers, vous pouvez utiliser un fournisseur d'identité Google ou un fournisseur d'identité tiers.

Fournisseur d'identité Google :

  • Les utilisateurs de l'agent se connectent à l'aide de leurs identifiants Google. Il s'agit de n'importe quelle adresse e-mail @gmail.com ou de tout compte qui utilise Google comme fournisseur d'identité (par exemple, Google Workspace). Cette étape est ignorée si les utilisateurs s'adressent directement à l'agent Google Cloud , car l'identité Google est automatiquement intégrée au système.
  • Vous pouvez attribuer un accès aux comptes Google à l'aide de Identity and Access Management (IAM).

Fournisseur d'identité tiers :

  • Les utilisateurs de l'agent se connectent à l'aide d'identifiants non Google, par exemple une adresse e-mail Microsoft.
  • Vous devez créer un pool d'employés à l'aide de Google Cloud contenant les fournisseurs d'identité non Google. Vous pouvez ensuite utiliser IAM pour accorder l'accès à l'ensemble du pool ou à des utilisateurs individuels de ce pool.
  • Cette méthode ne peut pas être utilisée avec des Google Cloud projets configurés sous l'organisation @google.com.

Connecteurs

Les datastores tiers sont implémentés à l'aide d'un connecteur. Chaque connecteur peut contenir plusieurs datastores, qui sont stockés en tant qu'entités dans le système Dialogflow CX.

  • Avant de créer un data store, vous devez configurer chaque région avec un seul fournisseur d'identité dans Google Cloud > Agent Builder > Paramètres. Tous les datastores de cette région utilisent le même fournisseur d'identité. Vous pouvez choisir une identité Google ou une identité tierce dans un pool d'employés. Les mêmes identifiants Google sont considérés comme une identité différente s'ils se trouvent dans un pool d'employés. Par exemple, test@gmail.com est considéré comme une identité différente de workforcePools/test-pool/subject/test@gmail.com.
    • Créez un pool d'employés (si nécessaire).
    • Accédez à Agent Builder Paramètres, puis sélectionnez Identité Google ou Identité tierce. Cliquez sur Enregistrer pour enregistrer l'identité dans la région.
    • Vous pouvez maintenant créer un data store dans la région.
  • Chaque data store enregistre les données de la liste de contrôle d'accès (LCA) avec chaque document. Cet enregistrement indique quels utilisateurs ou groupes disposent d'un accès en lecture à quelles entités. Lors de l'exécution, un utilisateur ou un membre d'un groupe ne reçoit de réponses de l'agent que si les réponses proviennent d'entités auxquelles il a accès en lecture. Si un utilisateur n'a aucun accès en lecture à des entités dans le data store, l'agent renvoie une réponse vide.
  • Étant donné que les données du data store sont une copie de l'instance tierce, elles doivent être actualisées régulièrement. Vous pouvez configurer les intervalles d'actualisation sur une échelle de temps en heures ou en jours.
  • Une fois que vous avez configuré votre data store et cliqué sur Créer, il peut s'écouler jusqu'à une heure avant que le data store n'apparaisse dans votre liste de datastores.

Suivi des datastores

Cette fonctionnalité comporte deux volets :

  1. Affichage des traces d'exécution internes du data store et des latences des étapes dans le simulateur d'agent.
  2. Exportation des traces d'exécution internes du data store et des latences des étapes vers Cloud Logging et BigQuery.

Afficher les données dans le simulateur

Pour afficher les données de suivi et d'exécution dans le simulateur d'agent, développez les détails d'un tour de conversation en cliquant sur la flèche de développement à droite de la réponse de l'agent.

L'onglet Exécution affiche les traces d'exécution internes du data store, y compris les éléments suivants :

  • L'entrée utilisateur d'origine.
  • La requête telle qu'elle a été réécrite par le moteur du data store.
  • Les signaux de qualité des étapes d'exécution, tels que l'état du contrôle de sécurité, l'état du contrôle de stabilité, le résultat du contrôle d'ancrage et l'état du contrôle de sécurité.
  • Les extraits de recherche de la recherche dans le data store.
  • La liste des documents d'aide pour les extraits.

L'onglet Latence affiche un graphique temporel pour différentes étapes d'exécution du data store. La liste des étapes varie en fonction de la configuration du data store et du flux d'exécution. Les données affichées peuvent inclure les éléments suivants :

  • Correspondance avec la FAQ : effectue une étape de correspondance avec la FAQ.
  • Réécriture de la requête : réécrit la requête utilisateur d'origine.
  • Recherche : effectue une recherche d'extraits.
  • Résumé : résume la réponse.
  • Contrôles de sécurité : effectue des étapes de contrôle de sécurité.

Afficher les données de suivi dans d'autres emplacements

Étape suivante

Pour savoir comment créer et utiliser un data store avec un agent, consultez la documentation sur les outils de datastore.