Datenspeicher

Datenspeicher werden von Datenspeicher-Tools verwendet, um anhand Ihrer Daten Antworten auf Fragen von Endnutzern zu finden. Datenspeicher sind Sammlungen von Websites, Dokumenten oder Daten in Drittanbietersystemen, die auf Ihre Daten verweisen.

Wenn ein Endnutzer dem Agenten eine Frage stellt, sucht der Agent in den angegebenen Quellinhalten nach einer Antwort und fasst die Ergebnisse in einer kohärenten Antwort des Agenten zusammen. Außerdem werden unterstützende Links zu den Quellen der Antwort bereitgestellt, damit der Endnutzer weitere Informationen erhält. Der Agent kann bis zu fünf Antwort-Snippets für eine bestimmte Frage liefern.

Datenspeicherquellen

Sie können verschiedene Quellen für Ihre Daten verwenden:

Datenspeicherquellen mit eingeschränktem Zugriff

Google bietet viele zusätzliche Datenspeicherquellen von Erstanbietern und Drittanbietern als Feature mit eingeschränktem Zugriff an. Unter Zusätzliche Datenspeicherquellen finden Sie die verfügbaren Quellen und können Zugriff anfordern.

Websiteinhalte

Wenn Sie Websiteinhalte als Quelle hinzufügen, können Sie mehrere Websites hinzufügen und ausschließen. Wenn Sie eine Website angeben, können Sie einzelne Seiten oder * als Platzhalter für ein Muster verwenden. Alle HTML- und PDF-Inhalte werden verarbeitet.

Sie müssen Ihre Domain bestätigen, wenn Sie Websiteinhalte als Quelle verwenden.

Einschränkungen:

  • Dateien aus öffentlichen URLs müssen vom Google-Suchindexer gecrawlt worden sein, damit sie im Suchindex erscheinen. Sie können dies mit der Google Search Console prüfen.
  • Bis zu 200.000 Seiten werden indexiert. Wenn der Datenspeicher mehr Seiten enthält, schlägt die Indexierung an dieser Stelle fehl. Bereits indexierte Inhalte bleiben jedoch erhalten.

Daten importieren

Sie können Daten entweder aus BigQuery oder Cloud Storage importieren. Diese Daten können in Form von FAQs oder unstrukturiert sein und Metadaten enthalten oder nicht.

Die folgenden Optionen für den Datenimport sind verfügbar:

  • Daten hinzufügen/aktualisieren:Fügt die angegebenen Dokumente dem Datenspeicher hinzu. Wenn ein neues Dokument dieselbe ID wie ein vorhandenes Dokument hat, wird das alte Dokument durch das neue ersetzt.
  • Vorhandene Daten überschreiben:Löscht alle vorhandenen Daten und lädt neue Daten hoch. Diese Aktion kann nicht rückgängig gemacht werden.

FAQ-Datenspeicher

Datenspeicher können Antworten auf häufig gestellte Fragen enthalten. Wenn Nutzerfragen mit hoher Wahrscheinlichkeit mit einer hochgeladenen Frage übereinstimmen, gibt der Agent die Antwort auf diese Frage unverändert zurück. Sie können für jedes Frage-Antwort-Paar, das der Agent anzeigt, einen Titel und eine URL angeben.

Laden Sie Daten im CSV-Format in den Datenspeicher hoch. Jede Datei muss eine Kopfzeile enthalten, in der die Spalten beschrieben werden.

Beispiel:

"question","answer","title","url"
"Why is the sky blue?","The sky is blue because of Rayleigh scattering.","Rayleigh scattering","https://en.wikipedia.org/wiki/Rayleigh_scattering"
"What is the meaning of life?","42","",""

Sie können die Spalten title und url weglassen:

"answer","question"
"42","What is the meaning of life?"

Während des Uploads können Sie einen Ordner auswählen, in dem jede Datei unabhängig von der Dateierweiterung als CSV-Datei verarbeitet wird.

Einschränkungen:

  • Ein zusätzliches Leerzeichen nach , verursacht einen Fehler.
  • Leere Zeilen (auch am Ende der Datei) verursachen einen Fehler.

Unstrukturierter Datenspeicher

Unstrukturierte Datenspeicher können Inhalte in den folgenden Formaten enthalten:

  • HTML
  • PDF
  • TXT
  • CSV

Sie können Dateien aus dem Cloud Storage-Bucket eines anderen Projekts importieren. Dazu müssen Sie dem Importprozess expliziten Zugriff gewähren. Folgen Sie der Anleitung in der Fehlermeldung. Sie enthält den Namen des Nutzers, der Lesezugriff auf den Bucket benötigt, um den Import auszuführen.

Einschränkungen:

  • Die maximale Dateigröße beträgt 2,5 MB für textbasierte Formate und 100 MB für andere Formate.

Datenspeicher mit Metadaten

Sie können einen Titel und eine URL als Metadaten angeben. Während einer Unterhaltung kann der Agent diese Informationen bereitstellen, damit Nutzer schnell auf interne Webseiten verlinken können, die für den Google-Suchindexer nicht zugänglich sind.

Wenn Sie Inhalte mit Metadaten importieren möchten, müssen Sie eine oder mehrere JSON Lines-Dateien angeben. Jede Zeile dieser Datei beschreibt ein Dokument. Sie laden die eigentlichen Dokumente nicht direkt hoch. In der JSON Lines-Datei werden URIs angegeben, die auf die Cloud Storage-Pfade verweisen.

Geben Sie einen Cloud Storage-Ordner an, der diese Dateien enthält. Fügen Sie diesem Ordner keine anderen Dateien hinzu.

Feldbeschreibungen:

Feld Typ Beschreibung
id String Eindeutige Kennung des Dokuments.
content.mimeType String MIME-Typ des Dokuments. „application/pdf“ und „text/html“ werden unterstützt.
content.uri String URI für das Dokument in Cloud Storage.
structData String Einzeiliges JSON-Objekt mit optionalen Feldern title und url.

Beispiel:

{ "id": "d001", "content": {"mimeType": "application/pdf", "uri": "gs://example-import/unstructured/first_doc.pdf"}, "structData": {"title": "First Document", "url": "https://internal.example.com/documents/first_doc.pdf"} }
{ "id": "d002", "content": {"mimeType": "application/pdf", "uri": "gs://example-import/unstructured/second_doc.pdf"}, "structData": {"title": "Second Document", "url": "https://internal.example.com/documents/second_doc.pdf"} }
{ "id": "d003", "content": {"mimeType": "text/html", "uri": "gs://example-import/unstructured/mypage.html"}, "structData": {"title": "My Page", "url": "https://internal.example.com/mypage.html"} }

Datenspeicher ohne Metadaten

Diese Art von Inhalt hat keine Metadaten. Stattdessen geben Sie URI-Links zu den einzelnen Dokumenten an. Der Inhaltstyp wird durch die Dateierweiterung bestimmt.

Konfiguration für das Parsen und Aufteilen in Blöcke

Je nach Datenquelle können Sie die Einstellungen für das Parsen und Aufteilen in Blöcke konfigurieren, wie in der Agent Search definiert.

Cloud Storage für ein Datenspeicherdokument verwenden

Wenn Ihr Inhalt nicht öffentlich ist, sollten Sie ihn in Cloud Storage speichern. Wenn Sie Datenspeicherdokumente erstellen, geben Sie die URLs für Ihre Cloud Storage-Objekte im folgenden Format an: gs://bucket-name/folder-name. Jedes Dokument im Ordner wird dem Datenspeicher hinzugefügt.

Beim Erstellen des Cloud Storage-Bucket:

Folgen Sie der Cloud Storage-Kurzanleitung um einen Bucket zu erstellen und Dateien hochzuladen.

Sprachen

Informationen zu den unterstützten Sprachen finden Sie in der Sprachreferenz in der Spalte „Datenspeicher“.

Für eine optimale Leistung sollten Sie Datenspeicher in einer einzigen Sprache erstellen.

Nachdem Sie einen Datenspeicher erstellt haben, können Sie optional die Sprache des Datenspeichers angeben. Wenn Sie die Sprache des Datenspeichers festlegen, können Sie den Datenspeicher mit einem Agenten verbinden, der für eine andere Sprache konfiguriert ist. Sie können beispielsweise einen französischen Datenspeicher erstellen, der mit einem englischen Agenten verbunden ist.

Unterstützte Regionen

Informationen zu den unterstützten Regionen finden Sie in der Regionsreferenz.

(Eingeschränkter Zugriff) Zusätzliche Datenspeicherquellen

In der folgenden Tabelle sind zusätzliche Datenspeichertypen aufgeführt. Sie sind als Features mit eingeschränktem Zugriff verfügbar. Sie können das Formular für die Zugriffsanfrage ausfüllen, um Zugriff anzufordern. Nach der Genehmigung werden diese Optionen angezeigt, wenn Sie einen Datenspeicher in Vertex AI Agent Builder erstellen.

Datenspeicherquellen von Drittanbietern

Datenspeicherquelle Beschreibung
Box Daten von der Box-Website Ihrer Organisation importieren.
Confluence Cloud Daten aus Ihrem Confluence Cloud-Workspace importieren.
Dropbox Daten aus Ihrem Dropbox-Speicher importieren.
EntraID Daten aus dem EntraID-System Ihrer Organisation importieren.
Jira Cloud Daten aus Ihrem Jira-Aufgabenverwaltungssystem importieren.
OneDrive Daten aus dem OneDrive-Speicher Ihrer Organisation importieren.
Microsoft Outlook Daten aus Microsoft Outlook importieren.
Salesforce Daten aus Salesforce importieren.
ServiceNow Daten aus ServiceNow importieren.
SharePoint Daten aus dem SharePoint-System Ihrer Organisation importieren.
Slack Daten aus Slack importieren.
Microsoft Teams Daten aus Microsoft Teams importieren.

Datenspeicher von Drittanbietern mit einem Connector einrichten

In diesem Abschnitt wird beschrieben, wie Sie einen Datenspeicher mit Daten von Drittanbietern einrichten. Eine Anleitung speziell für jede Datenquelle von Drittanbietern finden Sie in der Vertex AI Agent Builder-Dokumentation.

Identitätsanbieter

Mit Identitätsanbietern können Sie Nutzer, Gruppen und die Authentifizierung verwalten. Wenn Sie einen Datenspeicher von Drittanbietern einrichten, können Sie entweder einen Google-Identitätsanbieter oder einen Identitätsanbieter von Drittanbietern verwenden.

Google-Identitätsanbieter :

  • Nutzer des Agenten melden sich mit ihren Google-Anmeldedaten an. Dabei kann es sich um eine beliebige @gmail.com-E‑Mail-Adresse oder ein beliebiges Konto handeln, bei dem Google als Identitätsanbieter verwendet wird (z. B. Google Workspace). Dieser Schritt wird übersprungen, wenn Nutzer direkt mit dem Agenten sprechen Google Cloud , da die Google Identität automatisch in das System integriert ist.
  • Sie können den Zugriff auf Google-Konten mit Identity and Access Management (IAM) zuweisen.

Identitätsanbieter von Drittanbietern :

  • Nutzer des Agenten melden sich mit Anmeldedaten an, die nicht von Google stammen, z. B. mit einer Microsoft-E‑Mail-Adresse.
  • Sie müssen einen Personalpool mit Google Cloud den Identitätsanbietern erstellen, die nicht von Google stammen. Anschließend können Sie mit IAM den Zugriff auf den gesamten Pool oder auf einzelne Nutzer in diesem Pool gewähren.
  • Diese Methode kann nicht mit Google Cloud Projekten verwendet werden, die unter der @google.com Organisation eingerichtet wurden.

Connectors

Datenspeicher von Drittanbietern werden mit einem Connector implementiert. Jeder Connector kann mehrere Datenspeicher enthalten, die als Entitäten im Dialogflow CX-System gespeichert werden.

  • Bevor Sie einen Datenspeicher erstellen, müssen Sie jede Region mit einem einzelnen Identitätsanbieter unter Google Cloud > Agent Builder > Einstellungen einrichten. Alle Datenspeicher in dieser Region verwenden denselben Identitätsanbieter. Sie können entweder eine Google-Identität oder eine Identität von Drittanbietern in einem Personalpool auswählen. Dieselben Google-Anmeldedaten werden als andere Identität betrachtet, wenn sie sich in einem Personalpool befinden. Beispielsweise wird test@gmail.com als andere Identität als workforcePools/test-pool/subject/test@gmail.com betrachtet.
    • Erstellen Sie einen Personalpool (bei Bedarf).
    • Rufen Sie in Agent Builder Einstellungen auf und wählen Sie entweder Google-Identität oder Identität von Drittanbieter aus. Klicken Sie auf Speichern , um die Identität in der Region zu speichern.
    • Sie können jetzt einen Datenspeicher in der Region erstellen.
  • In jedem Datenspeicher werden ACL-Daten (Access Control List) mit jedem Dokument gespeichert. In diesem Datensatz wird erfasst, welche Nutzer oder Gruppen Lesezugriff auf welche Entitäten haben. Während der Laufzeit erhalten Nutzer oder Gruppenmitglieder nur dann Antworten vom Agenten, wenn die Antworten aus Entitäten stammen, auf die sie Lesezugriff haben. Wenn ein Nutzer keinen Lesezugriff auf Entitäten im Datenspeicher hat, gibt der Agent eine leere Antwort zurück.
  • Da die Daten im Datenspeicher eine Kopie der Drittanbieterinstanz sind, müssen sie regelmäßig aktualisiert werden. Sie können die Aktualisierungsintervalle auf einer Zeitskala von Stunden oder Tagen konfigurieren.
  • Nachdem Sie Ihren Datenspeicher konfiguriert und auf Erstellen geklickt haben, kann es bis zu einer Stunde dauern, bis der Datenspeicher in der Liste der Datenspeicher angezeigt wird.

Datenspeicher-Tracing

Dieses Feature besteht aus zwei Teilen:

  1. Anzeige der internen Tracings der Datenspeicherausführung und der Schrittlatenzen im Agentensimulator.
  2. Export der internen Tracings der Datenspeicherausführung und der Schrittlatenzen in Cloud Logging und BigQuery.

Daten im Simulator ansehen

Wenn Sie Tracing- und Ausführungsdaten im Agentensimulator anzeigen möchten, maximieren Sie die Details zu einer Unterhaltungsrunde, indem Sie rechts neben der Antwort des Agenten auf den Pfeil zum Maximieren klicken.

Auf dem Tab Ausführung werden die internen Tracings der Datenspeicherausführung angezeigt, darunter:

  • Die ursprüngliche Nutzereingabe.
  • Die Abfrage, wie sie von der Datenspeicher-Engine umgeschrieben wurde.
  • Qualitätssignale aus Ausführungsschritten, z. B. Status der Sicherheitsprüfung, Status der Stabilitätsprüfung, Ergebnis der Grounding-Prüfung und Status der Sicherheitsprüfung.
  • Such-Snippets aus der Datenspeichersuche.
  • Die Liste der unterstützenden Dokumente für die Snippets.

Auf dem Tab Latenz wird ein Zeitdiagramm für verschiedene Ausführungsschritte des Datenspeichers angezeigt. Die Liste der Schritte variiert je nach Konfiguration des Datenspeichers und Ausführungsablauf. Die angezeigten Daten können Folgendes umfassen:

  • FAQ-Übereinstimmung:Führt einen Schritt zur FAQ-Übereinstimmung aus.
  • Abfrage umschreiben:Schreibt die ursprüngliche Nutzerabfrage um.
  • Suchen:Führt eine Snippetsuche aus.
  • Zusammenfassung:Fasst die Antwort zusammen.
  • Sicherheitsprüfungen:Führt Schritte zur Sicherheitsprüfung aus.

Tracing-Daten an anderen Orten ansehen

  • Wenn Sie den Konversations-Agenten mit der Protokollierung des Unterhaltungsverlaufs konfigurieren, können Sie das Datenspeicher-Tracing unter Unterhaltungsverlauf ansehen.
  • Wenn Sie den Konversations-Agenten mit Protokollierung konfigurieren, können Sie Tracings und Latenzen im Log-Explorer der Cloud ansehen.
  • Wenn Sie den Konversations-Agenten mit dem BigQuery-Export konfigurieren, können Sie Tracings und Latenzen in einer exportierten BigQuery-Tabelle ansehen.

Nächste Schritte

Informationen zum Erstellen und Verwenden eines Datenspeichers mit einem Agenten finden Sie in der Dokumentation zu Datenspeicher-Tools.