Wenn Ihr Datenspeicher die einfache Website-Suche verwendet, entspricht die Aktualität des Index Ihres Speichers der Aktualität, die in der Google Suche verfügbar ist.
Wenn die erweiterte Websiteindexierung in Ihrem Datenspeicher aktiviert ist, werden die Webseiten in Ihrem Datenspeicher auf folgende Weise aktualisiert:
- Automatische Aktualisierung
- Manuelle Aktualisierung
- Aktualisierung auf Grundlage der Sitemap
Auf dieser Seite werden die automatische und die manuelle Aktualisierung beschrieben. Informationen zur Aktualisierung auf Grundlage der Sitemap finden Sie unter Indexierung und Aktualisierung gemäß Sitemap.
Hinweis
Wenn Sie die Datei robots.txt auf Ihrer Website verwenden, aktualisieren Sie sie. Weitere
Informationen finden Sie unter
Ihrer Website robots.txt Datei vorbereiten.
Automatische Aktualisierung
Die automatische Aktualisierung in Agent Search funktioniert so:
- Nachdem Sie einen Datenspeicher erstellt haben, wird ein erster Index für die enthaltenen Seiten generiert.
- Nach der ersten Indexierung werden alle neu gefundenen Seiten indexiert und vorhandene Seiten nach bestem Bemühen erneut gecrawlt.
- Datenspeicher mit einer Abfragerate von 50 Abfragen pro 30 Tage werden regelmäßig aktualisiert.
Manuelle Aktualisierung
Wenn Sie bestimmte Webseiten in einem Datenspeicher aktualisieren möchten, in dem die
erweiterte Websiteindexierung aktiviert ist, können Sie die
Methode
recrawlUris aufrufen. Im Feld uris geben Sie jede Webseite an, die Sie crawlen möchten. Die recrawlUris Methode ist ein Vorgang mit langer Ausführungszeit, der ausgeführt wird, bis die angegebenen Webseiten gecrajwlt wurden oder bis nach 24 Stunden eine Zeitüberschreitung auftritt, je nachdem, was zuerst eintritt. Wenn für die Methode recrawlUris eine Zeitüberschreitung auftritt, können Sie die Methode noch einmal aufrufen und die Webseiten angeben, die noch gecrawlt werden müssen. Sie können die Methode operations.get abfragen, um den Status Ihres erneuten Crawlings zu überwachen.
Beschränkungen für das erneute Crawlen
Es gibt Beschränkungen für die Häufigkeit, mit der Sie Webseiten crawlen können, und für die Anzahl der Webseiten, die Sie gleichzeitig crawlen können:
- Anrufe pro Tag Die maximale Anzahl der Aufrufe der Methode
recrawlUrisbeträgt 20 pro Tag und Projekt. - Webseiten pro Aufruf Die maximale Anzahl von
uris-Werten, die Sie mit einem Aufruf der MethoderecrawlUrisangeben können, beträgt 10.000.
Webseiten in Ihrem Datenspeicher erneut crawlen
Sie können bestimmte Webseiten in einem Datenspeicher, in dem die erweiterte Websiteindexierung aktiviert ist, manuell crawlen.
REST
So crawlen Sie bestimmte Webseiten in Ihrem Datenspeicher über die Befehlszeile:
Suchen Sie nach Ihrer Datenspeicher-ID. Wenn Sie die ID Ihres Datenspeichers bereits haben, fahren Sie mit dem nächsten Schritt fort.
Rufen Sie in der Google Cloud Console die Seite AI Applications (KI-Anwendungen) auf und klicken Sie im Navigationsmenü auf Datenspeicher.
Klicken Sie auf den Namen des Datenspeichers.
Rufen Sie auf der Seite Daten Ihres Datenspeichers die Datenspeicher-ID ab.
Rufen Sie die Methode
recrawlUrisauf und geben Sie im Feldurisjede Webseite an, die Sie crawlen möchten. Jederuristeht für eine einzelne Seite, auch wenn er Sternchen (*) enthält. Platzhaltermuster werden nicht unterstützt.curl -X POST \ -H "Authorization: Bearer $(gcloud auth print-access-token)" \ -H "Content-Type: application/json" \ -H "X-Goog-User-Project: PROJECT_ID" \ "https://discoveryengine.googleapis.com/v1alpha/projects/PROJECT_ID/locations/global/collections/default_collection/dataStores/DATA_STORE_ID/siteSearchEngine:recrawlUris" \ -d '{ "uris": [URIS] }'Ersetzen Sie Folgendes:
PROJECT_ID: die ID Ihres Google Cloud Projekts in.DATA_STORE_ID: die ID des Agent Search-Datenspeichers.URIS: die Liste der Webseiten, die Sie crawlen möchten, z. B."https://example.com/page-1", "https://example.com/page-2", "https://example.com/page-3".
Die Ausgabe sieht etwa so aus:
{ "name": "projects/PROJECT_ID/locations/global/collections/default_collection/dataStores/DATA_STORE_ID/operations/recrawl-uris-0123456789012345678", "metadata": { "@type": "type.googleapis.com/google.cloud.discoveryengine.v1alpha.RecrawlUrisMetadata" } }Speichern Sie den Wert
nameals Eingabe für den Vorgangoperations.get, wenn Sie den Status Ihres erneuten Crawlings überwachen.
Status Ihres erneuten Crawlings überwachen
Die recrawlUris Methode, mit der Sie Webseiten in einem Daten
speicher crawlen, ist ein Vorgang mit langer Ausführungszeit, der ausgeführt wird, bis die angegebenen Webseiten gecrawlt wurden
oder bis nach 24 Stunden eine Zeitüberschreitung auftritt, je nachdem, was zuerst eintritt. Sie können den
Status dieses Vorgangs mit langer Ausführungszeit überwachen, indem Sie die Methode operations.get abfragen und den Wert name angeben, der von der
recrawlUris Methode zurückgegeben wird. Fragen Sie weiter ab, bis die Antwort angibt, dass (1) alle Ihre Webseiten gecrawlt wurden oder (2) für den Vorgang eine Zeitüberschreitung aufgetreten ist, bevor alle Ihre Webseiten gecrawlt wurden. Wenn für recrawlUris eine Zeitüberschreitung auftritt, können Sie die Methode noch einmal aufrufen und die Websites angeben, die nicht gecrawlt wurden.
REST
So überwachen Sie den Status eines erneuten Crawlings über die Befehlszeile:
Suchen Sie nach Ihrer Datenspeicher-ID. Wenn Sie die ID Ihres Datenspeichers bereits haben, fahren Sie mit dem nächsten Schritt fort.
Rufen Sie in der Google Cloud Console die Seite AI Applications (KI-Anwendungen) auf und klicken Sie im Navigationsmenü auf Datenspeicher.
Klicken Sie auf den Namen des Datenspeichers.
Rufen Sie auf der Seite Daten Ihres Datenspeichers die Datenspeicher-ID ab.
Fragen Sie die
operations.getMethode ab.curl -X GET \ -H "Authorization: Bearer $(gcloud auth print-access-token)" \ -H "Content-Type: application/json" \ -H "X-Goog-User-Project: PROJECT_ID" \ "https://discoveryengine.googleapis.com/v1alpha/OPERATION_NAME"Ersetzen Sie Folgendes:
PROJECT_ID: die ID Ihres Google Cloud Projekts in.OPERATION_NAME: der Vorgangsname, der im Feldnamezurückgegeben wird , wenn Sie die MethoderecrawlUrisin Webseiten in Ihrem Datenspeicher erneut crawlen aufrufen. Sie können den Vorgangsnamen auch durch Auflisten von Vorgängen mit langer Ausführungszeit abrufen.
Werten Sie jede Antwort aus.
Wenn eine Antwort angibt, dass ausstehende URIs vorhanden sind und das erneute Crawlen noch nicht abgeschlossen ist, werden Ihre Webseiten noch gecrawlt. Fragen Sie weiter ab.
Beispiel
{ "name": "projects/PROJECT_ID/locations/global/collections/default_collection/dataStores/DATA_STORE_ID/operations/recrawl-uris-0123456789012345678", "metadata": { "@type": "type.googleapis.com/google.cloud.discoveryengine.v1alpha.RecrawlUrisMetadata", "createTime": "2023-09-05T22:07:28.690950Z", "updateTime": "2023-09-05T22:22:10.978843Z", "validUrisCount": 4000, "successCount": 2215, "pendingCount": 1785 }, "done": false, "response": { "@type": "type.googleapis.com/google.cloud.discoveryengine.v1alpha.RecrawlUrisResponse", } }
Die Antwortfelder können so beschrieben werden:
createTime: gibt die Startzeit des Vorgangs mit langer Ausführungszeit an.updateTime: gibt den Zeitpunkt der letzten Aktualisierung der Metadaten des Vorgangs mit langer Ausführungszeit an. gibt an, dass die Metadaten alle fünf Minuten aktualisiert werden, bis der Vorgang abgeschlossen ist.validUrisCount: gibt an,dass Sie in Ihrem Aufruf der MethoderecrawlUris4.000 gültige URIs angegeben haben.successCount: gibt an,dass 2.215 URIs erfolgreich gecrawlt wurden.pendingCount: gibt an,dass 1.785 URIs noch nicht gecrawlt wurden.done: Ein Wert vonfalsegibt an, dass das erneute Crawlen noch nicht abgeschlossen ist.
Wenn eine Antwort angibt, dass keine ausstehenden URIs vorhanden sind (kein Feld
pendingCountwird zurückgegeben) und das erneute Crawlen abgeschlossen ist, wurden Ihre Webseiten gecrawlt. Beenden Sie die Abfrage. Sie können diesen Vorgang beenden.Beispiel
{ "name": "projects/PROJECT_ID/locations/global/collections/default_collection/dataStores/DATA_STORE_ID/operations/recrawl-uris-0123456789012345678", "metadata": { "@type": "type.googleapis.com/google.cloud.discoveryengine.v1alpha.RecrawlUrisMetadata", "createTime": "2023-09-05T22:07:28.690950Z", "updateTime": "2023-09-05T22:37:11.367998Z", "validUrisCount": 4000, "successCount": 4000 }, "done": true, "response": { "@type": "type.googleapis.com/google.cloud.discoveryengine.v1alpha.RecrawlUrisResponse" } }
Die Antwortfelder können so beschrieben werden:
createTime: gibt die Startzeit des Vorgangs mit langer Ausführungszeit an.updateTime: gibt den Zeitpunkt der letzten Aktualisierung der Metadaten des Vorgangs mit langer Ausführungszeit an. gibt an, dass die Metadaten alle fünf Minuten aktualisiert werden, bis der Vorgang abgeschlossen ist.validUrisCount: gibt an,dass Sie in Ihrem Aufruf der MethoderecrawlUris4.000 gültige URIs angegeben haben.successCount: gibt an,dass 4.000 URIs erfolgreich gecrawlt wurden.done: Ein Wert vontruegibt an, dass das erneute Crawlen abgeschlossen ist.
Wenn eine Antwort angibt, dass ausstehende URIs vorhanden sind und das erneute Crawlen abgeschlossen ist, ist für das erneute Crawlen eine Zeitüberschreitung aufgetreten (nach 24 Stunden), bevor alle Ihre Webseiten gecrawlt wurden. Beginnen Sie noch einmal mit Webseiten in Ihrem Datenspeicher erneut crawlen. Verwenden Sie die Werte
failedUrisin der Antwortoperations.getfür die Werte im Feldurisin Ihrem neuen Aufruf der MethoderecrawlUris.Beispiel
{ "name": "projects/PROJECT_ID/locations/global/collections/default_collection/dataStores/DATA_STORE_ID/operations/recrawl-uris-8765432109876543210", "metadata": { "@type": "type.googleapis.com/google.cloud.discoveryengine.v1alpha.RecrawlUrisMetadata", "createTime": "2023-09-05T22:07:28.690950Z", "updateTime": "2023-09-06T22:09:10.613751Z", "validUrisCount": 10000, "successCount": 9988, "pendingCount": 12 }, "done": true, "response": { "@type": "type.googleapis.com/google.cloud.discoveryengine.v1alpha.RecrawlUrisResponse", "failedUris": [ "https://example.com/page-9989", "https://example.com/page-9990", "https://example.com/page-9991", "https://example.com/page-9992", "https://example.com/page-9993", "https://example.com/page-9994", "https://example.com/page-9995", "https://example.com/page-9996", "https://example.com/page-9997", "https://example.com/page-9998", "https://example.com/page-9999", "https://example.com/page-10000" ], "failureSamples": [ { "uri": "https://example.com/page-9989", "failureReasons": [ { "corpusType": "DESKTOP", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." }, { "corpusType": "MOBILE", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." } ] }, { "uri": "https://example.com/page-9990", "failureReasons": [ { "corpusType": "DESKTOP", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." }, { "corpusType": "MOBILE", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." } ] }, { "uri": "https://example.com/page-9991", "failureReasons": [ { "corpusType": "DESKTOP", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." }, { "corpusType": "MOBILE", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." } ] }, { "uri": "https://example.com/page-9992", "failureReasons": [ { "corpusType": "DESKTOP", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." }, { "corpusType": "MOBILE", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." } ] }, { "uri": "https://example.com/page-9993", "failureReasons": [ { "corpusType": "DESKTOP", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." }, { "corpusType": "MOBILE", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." } ] }, { "uri": "https://example.com/page-9994", "failureReasons": [ { "corpusType": "DESKTOP", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." }, { "corpusType": "MOBILE", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." } ] }, { "uri": "https://example.com/page-9995", "failureReasons": [ { "corpusType": "DESKTOP", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." }, { "corpusType": "MOBILE", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." } ] }, { "uri": "https://example.com/page-9996", "failureReasons": [ { "corpusType": "DESKTOP", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." }, { "corpusType": "MOBILE", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." } ] }, { "uri": "https://example.com/page-9997", "failureReasons": [ { "corpusType": "DESKTOP", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." }, { "corpusType": "MOBILE", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." } ] }, { "uri": "https://example.com/page-9998", "failureReasons": [ { "corpusType": "DESKTOP", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." }, { "corpusType": "MOBILE", "errorMessage": "Page was crawled but was not indexed by UCS within 24 hours." } ] } ] } }
Hier einige Beschreibungen der Antwortfelder:
createTime: Die Startzeit des Vorgangs mit langer Ausführungszeit.updateTime: Der Zeitpunkt der letzten Aktualisierung der Metadaten des Vorgangs mit langer Ausführungszeit. Die Metadaten werden alle fünf Minuten aktualisiert, bis der Vorgang abgeschlossen ist.validUrisCount: gibt an,dass Sie in Ihrem Aufruf der MethoderecrawlUris10. 000 gültige URIs angegeben haben.successCount: gibt an,dass 9. 988 URIs erfolgreich gecrawlt wurden.pendingCount: gibt an, dass 12 URIs noch nicht gecrawlt wurden.done: Ein Wert vontruegibt an, dass das erneute Crawlen abgeschlossen ist.failedUris: Eine Liste der URIs, die nicht gecrawlt wurden, bevor für das erneute Crawlen eine Zeitüberschreitung aufgetreten ist.failureInfo: Informationen zu URIs, die nicht gecrawlt werden konnten. Es werden maximal zehnfailureInfo-Arraywerte zurückgegeben, auch wenn mehr als zehn URIs nicht gecrawlt werden konnten.errorMessage: Der Grund, warum ein URI nicht gecrawlt werden konnte, nachcorpusType. Weitere Informationen finden Sie unter Fehlermeldungen.
Zeitnahe Aktualisierung
Google empfiehlt, neue und aktualisierte Seiten manuell zu aktualisieren , damit Sie den neuesten Index haben.
Fehlermeldungen
Wenn Sie den Status Ihres erneuten Crawlings überwachen und für das erneute Crawlen eine Zeitüberschreitung auftritt, während Sie
die Methode operations.get abfragen, gibt operations.get Fehlermeldungen für
Webseiten zurück, die nicht gecrawlt wurden. In der folgenden Tabelle sind die Fehlermeldungen aufgeführt, ob der Fehler vorübergehend ist (ein temporärer Fehler, der sich von selbst behebt) und welche Maßnahmen Sie ergreifen können, bevor Sie die Methode recrawlUris noch einmal aufrufen. Sie können alle vorübergehenden Fehler sofort noch einmal versuchen. Alle nicht vorübergehenden Fehler können nach der Behebung noch einmal versucht werden.
| Fehlermeldung | Ist das ein vorübergehender Fehler? | Maßnahmen vor dem erneuten Crawlen |
|---|---|---|
| Die Seite wurde gecrawlt, aber nicht innerhalb von 24 Stunden von Agent Search indexiert. | Ja | Verwenden Sie die Werte failedUris in der Antwort operations.get für die Werte im Feld uris, wenn Sie die Methode recrawlUris aufrufen. |
Das Crawlen wurde von der Website blockiert.robots.txt |
Nein | Entfernen Sie die Blockierung des URI in der robots.txt-Datei Ihrer Website, sorgen Sie dafür,
dass der User-Agent „Google-CloudVertexBot“ die Website crawlen darf,
und versuchen Sie es noch einmal. Weitere Informationen finden Sie unter
Websitedaten in
Daten für die Aufnahme vorbereiten. Wenn Sie nicht auf die
robots.txt Datei zugreifen können, wenden Sie sich an den Domaininhaber. |
| Seite nicht erreichbar | Nein | Prüfen Sie den URI, den Sie beim Aufrufen der Methode recrawlUris angegeben haben. Geben Sie den Literal-URI und kein URI-Muster an. |
| Zeitüberschreitung beim Crawlen | Ja | Verwenden Sie die Werte failedUris in der Antwort operations.get für die Werte im Feld uris, wenn Sie die Methode recrawlUris aufrufen. |
| Die Seite wurde vom Google-Crawler abgelehnt. | Ja | Verwenden Sie die Werte failedUris in der Antwort operations.get für die Werte im Feld uris, wenn Sie die Methode recrawlUris aufrufen. |
| Der Google-Crawler konnte der URL nicht folgen. | Nein | Wenn mehrere Weiterleitungen vorhanden sind, verwenden Sie den URI aus der letzten Weiterleitung und versuchen Sie es noch einmal. |
| Seite nicht gefunden (404) | Nein | Prüfen Sie den URI, den Sie beim Aufrufen der Methode recrawlUris angegeben haben. Geben Sie den Literal-URI und kein URI-Muster an.
Alle Seiten, die mit einem `4xx`-Fehlercode antworten, werden aus dem Index entfernt. |
| Authentifizierung für Seite erforderlich | Nein | Die erweiterte Websiteindexierung unterstützt das Crawlen von Webseiten, für die eine Authentifizierung erforderlich ist, nicht. |
Umgang mit gelöschten Seiten
Wenn eine Seite gelöscht wird, empfiehlt Google, die gelöschten URLs manuell zu aktualisieren.
Wenn der Datenspeicher Ihrer Website bei einer automatischen
oder einer manuellen Aktualisierung gecrawlt wird und eine Webseite mit einem 4xx Clientfehler
code oder einem 5xx Serverfehlercode antwortet, wird die nicht reagierende Webseite aus dem
Index entfernt.
Wenn der Datenspeicher so konfiguriert ist, dass der Sitemap-Modus auf Genau festgelegt ist, wird die URL aus dem Index gelöscht, wenn Sie sie aus der Sitemap entfernen.
Wenn der Datenspeicher so konfiguriert ist, dass der Sitemap-Modus auf Ermittlung festgelegt ist,
wird die URL nicht aus dem Index gelöscht, wenn Sie sie aus der Sitemap entfernen. Die URL wird erst dann aus dem Index gelöscht, wenn die Website gecrawlt wird und die Seite einen 4xx- oder 5xx-Code zurückgibt.