מידע על חיפוש ב-Knowledge Catalog

אפשר להשתמש בחיפוש ב-Knowledge Catalog (לשעבר Dataplex Universal Catalog) כדי לגלות משאבים בארגון באמצעות שאילתות בשפה טבעית עם התאמה סמנטית, מילות מפתח ופרדיקטים מובנים.

תרחישים לדוגמה

ברשימה הבאה מתוארים תרחישי שימוש נפוצים בחיפוש, יחד עם תיאורים ודוגמאות לשאילתות:

  • חיפוש נכס ספציפי: אפשר לחפש מילות מפתח שקשורות לשם הנכס, לעמודות או לתיאור שלו כדי למצוא נכס ספציפי.

    שאילתות לדוגמה

    • retail_transactions_2026
    • customer_id
    • column:customer_id
  • גילוי נתונים רחב: זיהוי נכסים רלוונטיים בארגון באמצעות שאילתות בשפה טבעית או שאילתות מילות מפתח פתוחות.

    שאילתות לדוגמה

    • quarterly financial reports
    • ad campaign click through rates tables
    • server health metrics
    • audit logs system=bigquery
  • אחזור נכסים בהיקף מוגדר לזרימות עבודה: אפשר למנות נכסים בתוך מאגר ספציפי, כמו פרויקט, או עם מאפיינים ספציפיים, כמו סוג או מערכת. הגישה הזו נפוצה בתהליכי עבודה מבוססי תוכנה ומבוססי סוכנים.

    שאילתות לדוגמה

    • type=table projectid:banking-prod aspect:classification.tier=PII
    • system=spanner projectid:inventory-service (parent=marketing_analytics OR parent=finance_analytics)

איך זה עובד

החיפוש מאנדקס באופן אוטומטי את כל ההקשר של נכסי הנתונים שמתעדכנים ב-Knowledge Catalog. הדוגמאות הבאות ממחישות את המצב הזה:

  • מטא-נתונים שמיובאים אוטומטית ממקורות נתונים Google Cloud כמו BigQuery ו-Cloud SQL
  • הקשר למשאבים שאתם מטמיעים באמצעות מחברים ושילובים
  • הקשר נוסף שאתם יוצרים למשאבים, למשל ייצוג של הקשר עסקי או תיאור של הסמנטיקה של הנתונים. ההקשר יכול להיות גם בצורה של היבטים או מונחים עסקיים מקושרים.

במהלך עיבוד השאילתה, מערכת החיפוש משתמשת בשילוב של התאמה סמנטית והתאמה למילות מפתח. בטבלה הבאה מפורטים סוגי השאילתות שאפשר להשתמש בהם בחיפוש ב-Knowledge Catalog, יחד עם תיאורים ודוגמאות לשאילתות:

סוג השאילתה Usage דוגמאות
מילת מפתח יחידה התאמה מדויקת והתאמה של מחרוזת משנה בין רכיבי מטא-נתונים, כמו שם הנכס, התיאור והסכימה. prd_fin_invoices_fct_v02
מילות מפתח חלקיות וקטעי טוקנים התאמה של מחרוזות משנה בתוכן של מטא-נתונים, מציאת משאבים גם עם מונחים מקוצרים, מילים מופרדות או וריאציות של שמות. fin transactions 2026 (התאמות prd_fin_transactions_fy2026_raw)
שאילתות בשפה טבעית השימוש בהתאמה סמנטית לא מחייב התאמות מדויקות של שמות או עמודות. customer churn prediction features
פסקי דין מובְנים משלב שאילתות טקסט חופשי עם מסנני פרדיקטים מפורשים כדי לצמצם את תוצאות החיפוש. audit logs system=bigquery
תחביר מורחב חיפוש מדויק, מצומצם להיקף ספציפי. תחביר מורחב משמש לרוב בתרחישי שימוש אקטיביים ותכנותיים. מידע נוסף זמין במאמר בנושא תחביר החיפוש. (system:bigquery OR system:spanner) AND column:credit_card_number aspect:classification.tier=PII -projectid:sandbox-project

יש כמה דרכים לגשת לחיפוש ב-Knowledge Catalog:

טווח החיפוש

תוצאות החיפוש ב-Knowledge Catalog מכבדות את ההרשאות שיש לכם לגבי המשאבים התואמים במערכות המקור.

לדוגמה, אם יש לכם גישת קריאה למטא-נתונים של BigQuery לאובייקט מסוים, האובייקט הזה יופיע בתוצאות החיפוש של Knowledge Catalog. אם יש לכם גישה לטבלה ב-BigQuery אבל לא למערך הנתונים שמכיל את הטבלה הזו, הטבלה עדיין תופיע בחיפוש ב-Knowledge Catalog כמו שציפיתם.

כברירת מחדל, החיפוש מוגבל לארגון שלכם. התוצאות כוללות רק משאבים מאותו ארגון של הפרויקט שבו אתם מחפשים.

תוצאות החיפוש כוללות רק את המשאבים ששייכים לאותו גבול גזרה של VPC Service Controls כמו הפרויקט שבו מתבצע החיפוש. כשמשתמשים במסוףGoogle Cloud , זהו הפרויקט שנבחר במסוף.

כדי להרחיב את היקף תוצאות החיפוש מעבר למשאבים ב-service perimeter של VPC Service Controls בפרויקט, אפשר להשתמש בכללי תעבורת נתונים נכנסת (ingress) ויוצאת (egress) של VPC Service Controls. הכללים האלה מאפשרים להחליף נתונים באופן פרטי ויעיל בארגון. אפשר להגדיר כללי תעבורת נתונים נכנסת (ingress) ותעבורת נתונים יוצאת (egress) באמצעות מסוףGoogle Cloud או באמצעות קובצי JSON או YAML. אפשר להיעזר בדוגמה הבאה של YAML ובמסמכי התיעוד של VPC Service Controls כדי להתאים את הכלל לדרישות הספציפיות שלכם.

egressPolicies:
  - egressFrom:
      identityType: ANY_USER_ACCOUNT
    egressTo:
      # Specify which resources should be present in the search results. In this example,
      # BigQuery.
      operations:
      - methodSelectors:
        - method: '*'
        serviceName: bigquery.googleapis.com
      # Specify project ids under which the search is performed.
      resources:
      - projects/SEARCH_PROJECT_ID
ingressPolicies:
  - ingressFrom:
      identityType: ANY_USER_ACCOUNT
      sources:
      - accessLevel: '*'
    ingressTo:
      # Specify which resources should be present in the search results. In this example,
      # BigQuery.
      operations:
      - methodSelectors:
        - method: '*'
        serviceName: bigquery.googleapis.com
      # Specify project ids to expose in search results.
      resources:
      - projects/INGRESS_PROJECT_ID

במאמר תפקידי IAM ב-Knowledge Catalog מוסבר אילו תפקידים בניהול הזהויות והרשאות הגישה (IAM) צריך להשתמש כדי לחפש ב-Knowledge Catalog.

בידוד תוצאות החיפוש לפי סביבה באמצעות VPC Service Controls

כדי לבודד את תוצאות החיפוש ב-Knowledge Catalog בין סביבות כמו פיתוח, בדיקה וייצור, צריך להגדיר היקפים נפרדים של VPC Service Controls לכל סביבה. מקצים את הפרויקטים שמכילים את נכסי הנתונים ואת הפרויקטים שמשמשים לביצוע חיפושים לגבולות הגזרה המתאימים של הסביבה. חיפושים שמבוצעים מפרויקט בתוך גבולות גזרה מסוימים מחזירים רק תוצאות של נכסים שנמצאים בתוך גבולות הגזרה האלה.

מגבלות על ביטול שליחה בחיפוש

שאילתות חיפוש ב-Knowledge Catalog לא מבטיחות היזכרות מלאה, כלומר יכול להיות שהחיפוש לא יחזיר תוצאות שתואמות לשאילתה. בנוסף, אם תחזרו על שאילתות חיפוש, יכול להיות שתקבלו תוצאות שונות (או שלא תקבלו תוצאות בכלל).

כדי לשלוח שאילתה לכל המטא-נתונים של Knowledge Catalog, אפשר לייצא את המטא-נתונים ל-Cloud Storage ואז לשלוח שאילתה מ-BigQuery. מידע נוסף זמין במאמר בנושא ייצוא מטא-נתונים.

המאמרים הבאים