ייבוא מ-Spanner

כדי להטמיע נתונים מ-Spanner, צריך ליצור מאגר נתונים ולהטמיע נתונים באמצעות Google Cloud המסוף או ה-API.

הגדרת גישה ל-Spanner מפרויקט אחר

אם נתוני Spanner נמצאים באותו פרויקט כמו Gemini Enterprise, אפשר לדלג אל ייבוא נתונים מ-Spanner.

כדי לתת ל-Gemini Enterprise גישה לנתוני Spanner שנמצאים בפרויקט אחר, צריך לבצע את השלבים הבאים:

  1. מחליפים את המשתנה PROJECT_NUMBER במספר הפרויקט שלכם ב-Gemini Enterprise, ואז מעתיקים את התוכן של בלוק הקוד הזה. זה המזהה של חשבון השירות שלך ב-Gemini Enterprise:

    service-PROJECT_NUMBER@gcp-sa-discoveryengine.iam.gserviceaccount.com
    
  2. עוברים לדף IAM & Admin.

    IAM & Admin

  3. עוברים לפרויקט Spanner בדף IAM ואדמין ולוחצים על הענקת גישה.

  4. בשדה New principals (חשבונות משתמשים חדשים), מזינים את המזהה של חשבון השירות ובוחרים באחת מהאפשרויות הבאות:

    • אם לא תשתמשו ב-Data Boost במהלך הייבוא, תצטרכו לבחור בתפקיד Cloud Spanner > Cloud Spanner Database Reader.
    • אם אתם מתכננים להשתמש ב-Data Boost במהלך הייבוא, צריך לבחור בתפקיד Cloud Spanner > Cloud Spanner Database Admin או בתפקיד מותאם אישית עם ההרשאות Cloud Spanner Database Reader ו-spanner.databases.useDataBoost. מידע על Data Boost זמין במאמר סקירה כללית על Data Boost במסמכי Spanner.
  5. לוחצים על Save.

לאחר מכן, עוברים אל ייבוא נתונים מ-Spanner.

ייבוא נתונים מ-Spanner

המסוף

כדי להשתמש במסוף להעברת נתונים מ-Spanner, פועלים לפי השלבים הבאים:

  1. נכנסים לדף Gemini Enterprise במסוף Google Cloud .

    Gemini Enterprise

  2. עוברים לדף מאגרי נתונים.

  3. לוחצים על יצירת מאגר נתונים.

  4. בדף Select a data source, בוחרים באפשרות Cloud Spanner.

  5. מציינים את מזהה הפרויקט, מזהה המכונה, מזהה מסד הנתונים ומזהה הטבלה של הנתונים שרוצים לייבא.

  6. בוחרים אם להפעיל את התכונה 'הגדלת נפח הנתונים'. מידע על Data Boost זמין במאמר סקירה כללית על Data Boost במסמכי Spanner.

  7. לוחצים על Continue.

  8. בוחרים אזור לאחסון הנתונים.

  9. מזינים שם למאגר הנתונים.

  10. לוחצים על יצירה.

  11. כדי לבדוק את סטטוס ההטמעה, עוברים לדף מאגרי נתונים ולוחצים על השם של מאגר הנתונים כדי לראות את הפרטים שלו בדף נתונים. ההטמעה מסתיימת כשהסטטוס בעמודה סטטוס בכרטיסייה פעילות משתנה מבתהליך להייבוא הושלם.

    בהתאם לגודל הנתונים, תהליך ההטמעה יכול להימשך כמה דקות או כמה שעות.

REST

כדי להשתמש בשורת הפקודה כדי ליצור מאגר נתונים ולייבא נתונים מ-Spanner, פועלים לפי השלבים הבאים:

  1. יוצרים מאגר נתונים.

    curl -X POST \
    -H "Authorization: Bearer $(gcloud auth print-access-token)" \
    -H "Content-Type: application/json" \
    -H "X-Goog-User-Project: PROJECT_ID" \
    "https://discoveryengine.googleapis.com/v1alpha/projects/PROJECT_ID/locations/global/collections/default_collection/dataStores?dataStoreId=DATA_STORE_ID" \
    -d '{
      "displayName": "DISPLAY_NAME",
      "industryVertical": "GENERIC",
      "solutionTypes": ["SOLUTION_TYPE_SEARCH"],
      "contentConfig": "CONTENT_REQUIRED",
    }'
    

    מחליפים את מה שכתוב בשדות הבאים:

    • PROJECT_ID: המזהה של פרויקט Gemini Enterprise.
    • DATA_STORE_ID: המזהה של מאגר הנתונים. המזהה יכול להכיל רק אותיות קטנות, ספרות, קווים תחתונים ומקפים.
    • DISPLAY_NAME: השם המוצג של מאגר הנתונים. יכול להיות שההודעה תוצג במסוף. Google Cloud
  2. ייבוא נתונים מ-Spanner.

      curl -X POST \
      -H "Authorization: Bearer $(gcloud auth print-access-token)" \
      -H "Content-Type: application/json" \
      "https://discoveryengine.googleapis.com/v1/projects/PROJECT_ID/locations/global/collections/default_collection/dataStores/DATA_STORE_ID/branches/0/documents:import" \
      -d '{
        "cloudSpannerSource": {
          "projectId": "SPANNER_PROJECT_ID",
          "instanceId": "INSTANCE_ID",
          "databaseId": "DATABASE_ID",
          "tableId": "TABLE_ID",
          "enableDataBoost": "DATA_BOOST_BOOLEAN"
        },
        "reconciliationMode": "RECONCILIATION_MODE",
        "autoGenerateIds": "AUTO_GENERATE_IDS",
        "idField": "ID_FIELD",
      }'
    

    מחליפים את מה שכתוב בשדות הבאים:

    • PROJECT_ID: המזהה של פרויקט Gemini Enterprise.
    • DATA_STORE_ID: המזהה של מאגר הנתונים.
    • SPANNER_PROJECT_ID: המזהה של פרויקט Spanner.
    • INSTANCE_ID: המזהה של מופע Spanner.
    • DATABASE_ID: המזהה של מסד הנתונים של Spanner.
    • TABLE_ID: המזהה של טבלת Spanner.
    • DATA_BOOST_BOOLEAN: אופציונלי. האם להפעיל את הגדלת נפח הנתונים. מידע על Data Boost זמין במאמר סקירה כללית על Data Boost במאמרי העזרה של Spanner.
    • RECONCILIATION_MODE: אופציונלי. הערכים הם FULL ו-INCREMENTAL. ערך ברירת המחדל הוא INCREMENTAL. הגדרה של INCREMENTAL גורמת לרענון מצטבר של נתונים מ-Spanner למאגר הנתונים. הפעולה הזו היא פעולת upsert, שמוסיפה מסמכים חדשים ומחליפה מסמכים קיימים במסמכים מעודכנים עם אותו מזהה. ציון הערך FULL גורם לביצוע rebase מלא של המסמכים במאגר הנתונים. במילים אחרות, מסמכים חדשים ומעודכנים מתווספים למאגר הנתונים, ומסמכים שלא נמצאים ב-Spanner מוסרים ממנו. השימוש במצב FULL מועיל אם רוצים למחוק באופן אוטומטי מסמכים שכבר לא צריכים.
    • AUTO_GENERATE_IDS: אופציונלי. ההגדרה קובעת אם מזהי המסמכים ייווצרו באופן אוטומטי. אם המדיניות מוגדרת לערך true, מזהי המסמכים נוצרים על סמך גיבוב של מטען הייעודי. חשוב לדעת שמזהי מסמכים שנוצרו יכולים להשתנות בין ייבוא לייבוא. אם אתם יוצרים מזהים באופן אוטומטי בכמה ייבואים, מומלץ מאוד להגדיר את reconciliationMode ל-FULL כדי לשמור על מזהי מסמכים עקביים.

    • ID_FIELD: אופציונלי. מציינים אילו שדות הם מזהי המסמכים.

השלבים הבאים

  • כדי לצרף את מאגר הנתונים לאפליקציה, יוצרים אפליקציה ובוחרים את מאגר הנתונים לפי השלבים שמפורטים במאמר יצירת אפליקציה לחיפוש.

  • כדי לראות תצוגה מקדימה של תוצאות החיפוש אחרי שמגדירים את האפליקציה ואת מאגר הנתונים, אפשר לעיין במאמר בנושא תצוגה מקדימה של תוצאות החיפוש.