Les datastores sont utilisés par les outils de datastore pour trouver des réponses aux questions des utilisateurs finaux à partir de vos données. Les datastores sont un ensemble de sites Web, de documents ou de données dans des systèmes tiers, chacun faisant référence à vos données.
Lorsqu'un utilisateur final pose une question à l'agent, celui-ci recherche une réponse à partir du contenu source donné, puis résume les résultats dans une réponse cohérente. Il fournit également des liens vers les sources de la réponse pour permettre à l'utilisateur final d'en savoir plus. L'agent peut fournir jusqu'à cinq extraits de réponse pour une question donnée.
Sources de datastore
Vous pouvez utiliser différentes sources pour vos données :
- URL de sites Web : explorez automatiquement le contenu de sites Web à partir d'une liste de domaines ou de pages Web.
- BigQuery : importez des données depuis votre table BigQuery.
- Cloud Storage : importez des données depuis votre bucket Cloud Storage.
- AlloyDB : importez des données depuis votre cluster AlloyDB pour PostgreSQL.
- Bigtable : importez des données depuis une table Bigtable.
- Firestore : importez des données depuis votre collection Firestore.
- Cloud SQL : importez des données depuis une table Cloud SQL.
- Spanner : importez des données depuis une table Spanner.
Sources de data store à accès restreint
Google propose de nombreuses autres sources de data store first party et tierces en tant que fonctionnalité à accès restreint. Pour afficher les sources disponibles et demander l'accès, consultez Sources de data store supplémentaires.
Contenu de site Web
Lorsque vous ajoutez du contenu de site Web comme source, vous pouvez ajouter et exclure plusieurs sites.
Lorsque vous spécifiez un site, vous pouvez utiliser des pages individuelles ou * comme caractère générique pour un modèle. Tout le contenu HTML et PDF sera traité.
Vous devez valider votre domaine lorsque vous utilisez du contenu de site Web comme source.
Limites :
- Les fichiers provenant d'URL publiques doivent avoir été explorés par le plug-in d'indexation de recherche Google pour exister dans l'index de recherche. Vous pouvez vérifier cela à l'aide de la Google Search Console.
- Jusqu'à 200 000 pages sont indexées. Si le data store contient plus de pages, l'indexation échoue à ce stade, mais tout contenu déjà indexé est conservé.
Importer des données
Vous pouvez importer des données depuis BigQuery ou Cloud Storage. Ces données peuvent être au format FAQ ou non structurées, et elles peuvent contenir des métadonnées ou ne pas en contenir.
Les options d'importation des données suivantes sont disponibles :
- Ajouter/Mettre à jour des données : ajoute les documents fournis au data store. Si un nouveau document porte le même ID qu'un document existant, le nouveau document remplace l'ancien.
- Écraser les données existantes : supprime toutes les données existantes et importe de nouvelles données. Cette action est irréversible.
Data store de FAQ
Les datastores peuvent contenir des réponses aux questions fréquentes. Lorsque les questions des utilisateurs correspondent avec un niveau de confiance élevé à une question importée, l'agent renvoie la réponse à cette question sans la modifier. Vous pouvez fournir un titre et une URL pour chaque paire de questions et réponses affichée par l'agent.
Importez des données dans le data store au format CSV. Chaque fichier doit inclure une ligne d'en-tête décrivant les colonnes.
Exemple :
"question","answer","title","url"
"Why is the sky blue?","The sky is blue because of Rayleigh scattering.","Rayleigh scattering","https://en.wikipedia.org/wiki/Rayleigh_scattering"
"What is the meaning of life?","42","",""
Vous pouvez omettre les colonnes title et url :
"answer","question"
"42","What is the meaning of life?"
Lors du processus d'importation, vous pouvez sélectionner un dossier dans lequel chaque fichier est traité comme un fichier CSV, quelle que soit l'extension du fichier.
Limites :
- Un espace supplémentaire après
,provoque une erreur. - Les lignes vides (même à la fin du fichier) provoquent une erreur.
Data store non structuré
Les datastores non structurés peuvent contenir du contenu dans les formats suivants :
HTMLPDFTXTCSV
Vous pouvez importer des fichiers depuis le bucket Cloud Storage d'un autre projet. Pour ce faire, accordez un accès explicite au processus d'importation. Suivez les instructions du message d'erreur, qui contient le nom de l'utilisateur qui a besoin d'un accès en lecture au bucket pour effectuer l'importation.
Limites :
- La taille maximale des fichiers est de 2,5 Mo pour les formats basés sur du texte et de 100 Mo pour les autres formats.
Datastore avec métadonnées
Vous pouvez fournir un titre et une URL en tant que métadonnées. Lors d'une conversation, l'agent peut fournir ces informations pour aider les utilisateurs à accéder rapidement à des pages Web internes qui ne sont pas accessibles par le plug-in d'indexation de recherche Google.
Pour importer du contenu avec des métadonnées, vous devez fournir un ou plusieurs
fichiers JSON Lines. Chaque ligne de ce fichier décrit un document. Vous n'importez pas directement les documents réels. Les URIs qui renvoient vers
les chemins Cloud Storage sont fournis dans le fichier JSON Lines.
Pour fournir vos fichiers JSON Lines, indiquez un dossier Cloud Storage contenant ces fichiers. Ne placez aucun autre fichier dans ce dossier.
Descriptions de champs :
| Champ | Type | Description |
|---|---|---|
| id | chaîne | Identifiant unique du document. |
| content.mimeType | chaîne | Type MIME du document. Les types "application/pdf" et "text/html" sont acceptés. |
| content.uri | chaîne | URI du document dans Cloud Storage. |
| structData | chaîne | Objet JSON sur une seule ligne avec les champs title et url facultatifs. |
Exemple :
{ "id": "d001", "content": {"mimeType": "application/pdf", "uri": "gs://example-import/unstructured/first_doc.pdf"}, "structData": {"title": "First Document", "url": "https://internal.example.com/documents/first_doc.pdf"} }
{ "id": "d002", "content": {"mimeType": "application/pdf", "uri": "gs://example-import/unstructured/second_doc.pdf"}, "structData": {"title": "Second Document", "url": "https://internal.example.com/documents/second_doc.pdf"} }
{ "id": "d003", "content": {"mimeType": "text/html", "uri": "gs://example-import/unstructured/mypage.html"}, "structData": {"title": "My Page", "url": "https://internal.example.com/mypage.html"} }
Datastore sans métadonnées
Ce type de contenu ne comporte aucune métadonnée. Au lieu de cela, vous fournissez des liens URI vers les documents individuels. Le type de contenu est déterminé par l'extension du fichier.
Configuration de l'analyse et de la fragmentation
Selon la source de données, vous pouvez configurer les paramètres d'analyse et de fragmentation tels que définis par Agent Search.
Utiliser Cloud Storage pour un document de data store
Si votre contenu n'est pas public, nous vous recommandons de le stocker dans Cloud Storage. Lorsque vous créez des documents de data store, vous fournissez les URL de vos objets Cloud Storage au format suivant : gs://bucket-name/folder-name. Chaque document du dossier est ajouté au data store.
Lors de la création d'un bucket Cloud Storage :
- Sélectionnez le projet que vous utilisez pour l'agent.
- Utilisez la classe de stockage Standard.
- Définissez l'emplacement du bucket sur le même emplacement que celui de votre agent.
Suivez le démarrage rapide de Cloud Storage pour créer un bucket et importer des fichiers.
Langues
Pour connaître les langues acceptées, consultez la colonne du data store dans la documentation de référence sur les langues.
Pour des performances optimales, créez des datastores dans une seule langue.
Après avoir créé un data store, vous pouvez éventuellement spécifier la langue du data store. Si vous définissez la langue du data store, vous pouvez connecter le data store à un agent configuré pour une autre langue. Par exemple, vous pouvez créer un data store en français connecté à un agent en anglais.
Régions où le service est disponible
Pour en savoir plus sur les régions disponibles, consultez la documentation de référence sur les régions.
(Accès restreint) Sources de data store supplémentaires
Les types de data store supplémentaires sont répertoriés dans le tableau suivant. Ils sont disponibles en tant que fonctionnalités à accès restreint. Vous pouvez remplir le formulaire de demande d'accès pour demander l'accès. Une fois votre demande approuvée, vous pourrez voir ces options lorsque vous créerez un data store dans Vertex AI Agent Builder.
Sources de data store tierces
| Source de datastore | Description |
|---|---|
| Box | Importez des données depuis le site Box de votre organisation. |
| Confluence Cloud | Importez des données depuis votre espace de travail Confluence Cloud. |
| Dropbox | Importez des données depuis votre espace de stockage Dropbox. |
| EntraID | Importez des données depuis le système EntraID de votre organisation. |
| Jira Cloud | Importez des données depuis votre système de gestion des tâches Jira. |
| OneDrive | Importez des données depuis l'espace de stockage OneDrive de votre organisation. |
| Microsoft Outlook | Importez des données depuis Microsoft Outlook. |
| Salesforce | Importez des données depuis Salesforce. |
| ServiceNow | Importez des données depuis ServiceNow. |
| SharePoint | Importez des données depuis le système SharePoint de votre organisation. |
| Slack | Importez des données depuis Slack. |
| Microsoft Teams | Importez des données depuis Microsoft Teams. |
Configurer un data store tiers à l'aide d'un connecteur
Cette section décrit le processus de configuration d'un data store à l'aide de données tierces. Pour obtenir des instructions spécifiques à chaque source de données tierce, consultez la documentation de Vertex AI Agent Builder.
Fournisseurs d'identité
Les fournisseurs d'identité vous permettent de gérer les utilisateurs, les groupes et l'authentification. Lorsque vous configurez un data store tiers, vous pouvez utiliser un fournisseur d'identité Google ou un fournisseur d'identité tiers.
Fournisseur d'identité Google :
- Les utilisateurs de l'agent se connectent à l'aide de leurs identifiants Google. Il s'agit de n'importe quelle adresse e-mail
@gmail.comou de tout compte qui utilise Google comme fournisseur d'identité (par exemple, Google Workspace). Cette étape est ignorée si les utilisateurs s'adressent directement à l'agent Google Cloud , car l'identité Google est automatiquement intégrée au système. - Vous pouvez attribuer un accès aux comptes Google à l'aide de Identity and Access Management (IAM).
Fournisseur d'identité tiers :
- Les utilisateurs de l'agent se connectent à l'aide d'identifiants non Google, par exemple une adresse e-mail Microsoft.
- Vous devez créer un pool d'employés à l'aide de Google Cloud contenant les fournisseurs d'identité non Google. Vous pouvez ensuite utiliser IAM pour accorder l'accès à l'ensemble du pool ou à des utilisateurs individuels de ce pool.
- Cette méthode ne peut pas être utilisée avec des Google Cloud projets configurés sous
l'organisation
@google.com.
Connecteurs
Les datastores tiers sont implémentés à l'aide d'un connecteur. Chaque connecteur peut contenir plusieurs datastores, qui sont stockés en tant qu'entités dans le système Dialogflow CX.
- Avant de créer un data store, vous devez configurer chaque région avec un seul
fournisseur d'identité dans Google Cloud > Agent Builder > Paramètres. Tous les datastores de cette région utilisent le même fournisseur d'identité. Vous pouvez choisir une identité Google ou une identité tierce dans un pool d'employés. Les mêmes identifiants Google sont considérés comme une identité différente s'ils se trouvent dans un pool d'employés.
Par exemple,
test@gmail.comest considéré comme une identité différente deworkforcePools/test-pool/subject/test@gmail.com.- Créez un pool d'employés (si nécessaire).
- Accédez à Agent Builder Paramètres, puis sélectionnez Identité Google ou Identité tierce. Cliquez sur Enregistrer pour enregistrer l'identité dans la région.
- Vous pouvez maintenant créer un data store dans la région.
- Chaque data store enregistre les données de la liste de contrôle d'accès (LCA) avec chaque document. Cet enregistrement indique quels utilisateurs ou groupes disposent d'un accès en lecture à quelles entités. Lors de l'exécution, un utilisateur ou un membre d'un groupe ne reçoit de réponses de l'agent que si les réponses proviennent d'entités auxquelles il a accès en lecture. Si un utilisateur n'a aucun accès en lecture à des entités dans le data store, l'agent renvoie une réponse vide.
- Étant donné que les données du data store sont une copie de l'instance tierce, elles doivent être actualisées régulièrement. Vous pouvez configurer les intervalles d'actualisation sur une échelle de temps en heures ou en jours.
- Une fois que vous avez configuré votre data store et cliqué sur Créer, il peut s'écouler jusqu'à une heure avant que le data store n'apparaisse dans votre liste de datastores.
Suivi des datastores
Cette fonctionnalité comporte deux volets :
- Affichage des traces d'exécution internes du data store et des latences des étapes dans le simulateur d'agent.
- Exportation des traces d'exécution internes du data store et des latences des étapes vers Cloud Logging et BigQuery.
Afficher les données dans le simulateur
Pour afficher les données de suivi et d'exécution dans le simulateur d'agent, développez les détails d'un tour de conversation en cliquant sur la flèche de développement à droite de la réponse de l'agent.
L'onglet Exécution affiche les traces d'exécution internes du data store, y compris les éléments suivants :
- L'entrée utilisateur d'origine.
- La requête telle qu'elle a été réécrite par le moteur du data store.
- Les signaux de qualité des étapes d'exécution, tels que l'état du contrôle de sécurité, l'état du contrôle de stabilité, le résultat du contrôle d'ancrage et l'état du contrôle de sécurité.
- Les extraits de recherche de la recherche dans le data store.
- La liste des documents d'aide pour les extraits.
L'onglet Latence affiche un graphique temporel pour différentes étapes d'exécution du data store. La liste des étapes varie en fonction de la configuration du data store et du flux d'exécution. Les données affichées peuvent inclure les éléments suivants :
- Correspondance avec la FAQ : effectue une étape de correspondance avec la FAQ.
- Réécriture de la requête : réécrit la requête utilisateur d'origine.
- Recherche : effectue une recherche d'extraits.
- Résumé : résume la réponse.
- Contrôles de sécurité : effectue des étapes de contrôle de sécurité.
Afficher les données de suivi dans d'autres emplacements
- Si vous configurez l'agent conversationnel avec la journalisation de l'historique des conversations, vous pouvez afficher le suivi du data store dans l'historique des conversations.
- Si vous configurez l'agent conversationnel avec la journalisation, vous pouvez afficher les traces et les latences dans l'Explorateur de journaux cloud.
- Si vous configurez l'agent conversationnel avec l'exportation BigQuery, vous pouvez afficher les traces et les latences dans une table BigQuery exportée.
Étape suivante
Pour savoir comment créer et utiliser un data store avec un agent, consultez la documentation sur les outils de datastore.