מידע על חיפוש ב-Knowledge Catalog

אפשר להשתמש בחיפוש ב-Knowledge Catalog (לשעבר Dataplex Universal Catalog) כדי לגלות משאבים בארגון באמצעות שאילתות בשפה טבעית עם התאמה סמנטית, מילות מפתח ופרדיקטים מובנים.

תרחישים לדוגמה

ברשימה הבאה מתוארים תרחישי שימוש נפוצים בחיפוש, יחד עם תיאורים ודוגמאות לשאילתות:

  • חיפוש נכס ספציפי: אפשר לחפש מילות מפתח שקשורות לשם הנכס, לעמודות או לתיאור שלו כדי למצוא נכס ספציפי.

    שאילתות לדוגמה

    • retail_transactions_2026
    • customer_id
    • column:customer_id
  • גילוי נתונים רחב: זיהוי נכסים רלוונטיים בארגון באמצעות שאילתות בשפה טבעית או שאילתות מילות מפתח.

    שאילתות לדוגמה

    • quarterly financial reports
    • ad campaign click through rates tables
    • server health metrics
    • audit logs system=bigquery
  • אחזור נכסים בהיקף מוגדר לזרימות עבודה: אפשר למנות נכסים בתוך מאגר ספציפי, כמו פרויקט, או עם מאפיינים ספציפיים, כמו סוג או מערכת. הגישה הזו נפוצה בתהליכי עבודה מבוססי תוכנה ומבוססי סוכנים.

    שאילתות לדוגמה

    • type=table projectid:banking-prod aspect:classification.tier=PII
    • system=spanner projectid:inventory-service (parent=marketing_analytics OR parent=finance_analytics)

איך זה עובד

החיפוש מאנדקס באופן אוטומטי את כל ההקשר של נכסי הנתונים שמתעדכנים ב-Knowledge Catalog. הדוגמאות הבאות ממחישות את המצב הזה:

  • מטא-נתונים שמיובאים אוטומטית ממקורות נתונים Google Cloud כמו BigQuery ו-Cloud SQL
  • הקשר למשאבים שאתם מטמיעים באמצעות מחברים ושילובים
  • הקשר נוסף שאתם יוצרים למשאבים, למשל ייצוג של הקשר עסקי או תיאור של הסמנטיקה של הנתונים. ההקשר יכול להיות גם בצורה של היבטים או מונחים עסקיים מקושרים.

במהלך עיבוד השאילתה, החיפוש משתמש בשילוב של התאמה סמנטית והתאמה למילות מפתח. בטבלה הבאה מפורטים סוגי השאילתות שאפשר להשתמש בהן בחיפוש ב-Knowledge Catalog, יחד עם תיאורים ודוגמאות לשאילתות:

סוג השאילתה Usage דוגמאות
מילת מפתח יחידה התאמה מדויקת והתאמה של מחרוזת משנה בין רכיבי מטא-נתונים, כמו שם הנכס, התיאור והסכימה. prd_fin_invoices_fct_v02
מילות מפתח חלקיות וקטעי טוקנים התאמה של מחרוזות משנה בתוכן של מטא-נתונים, חיפוש משאבים גם אם יש מונחים מקוצרים, מילים מופרדות או וריאציות בשמות. fin transactions 2026 (התאמות prd_fin_transactions_fy2026_raw)
שאילתות בשפה טבעית השימוש בהתאמה סמנטית לא מחייב התאמות מדויקות של שמות או עמודות. customer churn prediction features
פסקי דין מובְנים משלב שאילתות של טקסט חופשי עם מסנני פרדיקטים מפורשים כדי לצמצם את תוצאות החיפוש. audit logs system=bigquery
תחביר מורחב לחיפוש מדויק, מצומצם להיקף ספציפי. תחביר מורחב משמש לרוב בתרחישי שימוש אקטיביים ותוכנתיים. מידע נוסף זמין במאמר בנושא תחביר החיפוש. (system:bigquery OR system:spanner) AND column:credit_card_number aspect:classification.tier=PII -projectid:sandbox-project

יש כמה דרכים לגשת לחיפוש ב-Knowledge Catalog:

היקף החיפוש

תוצאות החיפוש ב-Knowledge Catalog מכבדות את ההרשאות שיש לכם לגבי המשאבים התואמים במערכות המקור.

לדוגמה, אם יש לכם גישת קריאה למטא-נתונים של BigQuery לאובייקט מסוים, האובייקט הזה יופיע בתוצאות החיפוש של Knowledge Catalog. אם יש לכם גישה לטבלה ב-BigQuery אבל לא למערך הנתונים שמכיל את הטבלה הזו, הטבלה עדיין תופיע בחיפוש ב-Knowledge Catalog כמו שציפיתם.

כברירת מחדל, החיפוש מוגבל לארגון שלכם. התוצאות כוללות רק משאבים מאותו ארגון של הפרויקט שבו אתם מחפשים.

תוצאות החיפוש כוללות רק את המשאבים ששייכים לאותו היקף של אמצעי בקרה לשירותי VPC כמו הפרויקט שבו מתבצע החיפוש. כשמשתמשים במסוףGoogle Cloud , זהו הפרויקט שנבחר במסוף.

כדי להרחיב את היקף תוצאות החיפוש מעבר למשאבים ב-service perimeter של VPC Service Controls בפרויקט, אפשר להשתמש בכללי תעבורת נתונים נכנסת (ingress) ויוצאת (egress) של VPC Service Controls. הכללים האלה מאפשרים להחליף נתונים באופן פרטי ויעיל בארגון. אפשר להגדיר כללי תעבורת נתונים נכנסת (ingress) ותעבורת נתונים יוצאת (egress) באמצעותGoogle Cloud המסוף או באמצעות קובצי JSON או YAML. אפשר להיעזר בדוגמה הבאה של YAML ובמסמכי התיעוד של VPC Service Controls כדי להתאים את הכלל לדרישות הספציפיות שלכם.

egressPolicies:
  - egressFrom:
      identityType: ANY_USER_ACCOUNT
    egressTo:
      # Specify which resources should be present in the search results. In this example,
      # BigQuery.
      operations:
      - methodSelectors:
        - method: '*'
        serviceName: bigquery.googleapis.com
      # Specify project ids under which the search is performed.
      resources:
      - projects/SEARCH_PROJECT_ID
ingressPolicies:
  - ingressFrom:
      identityType: ANY_USER_ACCOUNT
      sources:
      - accessLevel: '*'
    ingressTo:
      # Specify which resources should be present in the search results. In this example,
      # BigQuery.
      operations:
      - methodSelectors:
        - method: '*'
        serviceName: bigquery.googleapis.com
      # Specify project ids to expose in search results.
      resources:
      - projects/INGRESS_PROJECT_ID

במאמר תפקידי IAM ב-Knowledge Catalog מוסבר אילו תפקידים בניהול הזהויות והרשאות הגישה (IAM) צריך להשתמש כדי לחפש ב-Knowledge Catalog.

בידוד תוצאות החיפוש לפי סביבה באמצעות VPC Service Controls

כדי לבודד את תוצאות החיפוש ב-Knowledge Catalog בין סביבות כמו פיתוח, בדיקה וייצור, מגדירים היקפים נפרדים של VPC Service Controls לכל סביבה. מקצים את הפרויקטים שמכילים את נכסי הנתונים ואת הפרויקטים שמשמשים לביצוע חיפושים לגבולות הגזרה של הסביבה המתאימה. חיפושים שמבוצעים מפרויקט בתוך גבולות גזרה ספציפיים מחזירים רק תוצאות של נכסים שנמצאים באותם גבולות גזרה.

מגבלות על ביטול שליחה בחיפוש

החיפוש ב-Knowledge Catalog מותאם לגילוי חקרני במקום לאחזור מלאי מקיף, ולכן שאילתות חיפוש לא מבטיחות זכירות מלאה. יכול להיות ששאילתה לא תכלול תוצאות תואמות, והתוצאות שיוחזרו עשויות להיות שונות בשאילתות חוזרות.

הגורמים לירידה בערך ה-Recall

כשאתם מחפשים, קטלוג הידע בודק באופן דינמי את ההרשאות שלכם מול מגבלת בקרת גישה של 600 הגבלות (כללי הערכת הרשאות). אם בדיקת הגישה חורגת מהמגבלה הזו, המערכת מפסיקה את הבדיקה מוקדם כדי שהחיפושים יהיו מהירים. במקרים כאלה, יכול להיות שהחיפוש לא יכלול נכסים תואמים.

הסיכוי להגיע למגבלה הזו גבוה יותר אם מתקיים אחד מהתנאים הבאים:

  • תפקידי IAM שמוקצים ישירות למאות משאבים נפרדים.
  • חברות בהרבה קבוצות Google, שכל אחת מהן מעניקה גישה למשאבים נפרדים.
  • חברות בקבוצות Google שקיבלו גישה ישירה למאות משאבים נפרדים.

פתרון בעיות שקשורות להגבלות על ביטול השליחה ולתוצאות חסרות

כדי לפתור בעיות באחזור או לאחזר מטא-נתונים מלאים, בוחרים בגישה שמתאימה למטרה שלכם:

  • כדי לפתור בעיות של תוצאות חיפוש חסרות או לא עקביות: מצמצמים את מספר בדיקות הגישה הכולל כדי לא לחרוג מהמגבלה של 600 בדיקות. כדאי להעניק גישה רק למשאבים שאתם צריכים, ולהסיר גישה למשאבים או לקבוצות Google שאתם לא צריכים הרשאות לגביהם. אפשר גם להקצות תפקידים ברמת הפרויקט או התיקייה במקום במשאבים ספציפיים.
  • כדי לאחזר מלאי מטא-נתונים מלא ומובטח: אל תשתמשו בחיפוש. במקום זאת, אפשר לייצא מטא-נתונים ל-Cloud Storage ולשאול שאילתות לגבי מערך הנתונים המלא באמצעות BigQuery.

המאמרים הבאים