אפשר להשתמש בחיפוש ב-Knowledge Catalog (לשעבר Dataplex Universal Catalog) כדי לגלות משאבים בארגון באמצעות שאילתות בשפה טבעית עם התאמה סמנטית, מילות מפתח ופרדיקטים מובנים.
תרחישים לדוגמה
ברשימה הבאה מתוארים תרחישי שימוש נפוצים בחיפוש, יחד עם תיאורים ודוגמאות לשאילתות:
חיפוש נכס ספציפי: אפשר לחפש מילות מפתח שקשורות לשם הנכס, לעמודות או לתיאור שלו כדי למצוא נכס ספציפי.
שאילתות לדוגמה
retail_transactions_2026customer_idcolumn:customer_id
גילוי נתונים רחב: זיהוי נכסים רלוונטיים בארגון באמצעות שאילתות בשפה טבעית או שאילתות מילות מפתח פתוחות.
שאילתות לדוגמה
quarterly financial reportsad campaign click through rates tablesserver health metricsaudit logs system=bigquery
אחזור נכסים בהיקף מוגדר לזרימות עבודה: אפשר למנות נכסים בתוך מאגר ספציפי, כמו פרויקט, או עם מאפיינים ספציפיים, כמו סוג או מערכת. הגישה הזו נפוצה בתהליכי עבודה מבוססי תוכנה ומבוססי סוכנים.
שאילתות לדוגמה
type=table projectid:banking-prod aspect:classification.tier=PIIsystem=spanner projectid:inventory-service (parent=marketing_analytics OR parent=finance_analytics)
איך זה עובד
החיפוש מאנדקס באופן אוטומטי את כל ההקשר של נכסי הנתונים שמתעדכנים ב-Knowledge Catalog. הדוגמאות הבאות ממחישות את המצב הזה:
- מטא-נתונים שמיובאים אוטומטית ממקורות נתונים Google Cloud כמו BigQuery ו-Cloud SQL
- הקשר למשאבים שאתם מטמיעים באמצעות מחברים ושילובים
- הקשר נוסף שאתם יוצרים למשאבים, למשל ייצוג של הקשר עסקי או תיאור של הסמנטיקה של הנתונים. ההקשר יכול להיות גם בצורה של היבטים או מונחים עסקיים מקושרים.
במהלך עיבוד השאילתה, מערכת החיפוש משתמשת בשילוב של התאמה סמנטית והתאמה למילות מפתח. בטבלה הבאה מפורטים סוגי השאילתות שאפשר להשתמש בהם בחיפוש ב-Knowledge Catalog, יחד עם תיאורים ודוגמאות לשאילתות:
| סוג השאילתה | Usage | דוגמאות |
|---|---|---|
| מילת מפתח יחידה | התאמה מדויקת והתאמה של מחרוזת משנה בין רכיבי מטא-נתונים, כמו שם הנכס, התיאור והסכימה. | prd_fin_invoices_fct_v02 |
| מילות מפתח חלקיות וקטעי טוקנים | התאמה של מחרוזות משנה בתוכן של מטא-נתונים, מציאת משאבים גם עם מונחים מקוצרים, מילים מופרדות או וריאציות של שמות. | fin transactions 2026 (התאמות
prd_fin_transactions_fy2026_raw) |
| שאילתות בשפה טבעית | השימוש בהתאמה סמנטית לא מחייב התאמות מדויקות של שמות או עמודות. | customer churn prediction features |
| פסקי דין מובְנים | משלב שאילתות טקסט חופשי עם מסנני פרדיקטים מפורשים כדי לצמצם את תוצאות החיפוש. | audit logs system=bigquery |
| תחביר מורחב | חיפוש מדויק, מצומצם להיקף ספציפי. תחביר מורחב משמש לרוב בתרחישי שימוש אקטיביים ותכנותיים. מידע נוסף זמין במאמר בנושא תחביר החיפוש. | (system:bigquery OR system:spanner) AND
column:credit_card_number aspect:classification.tier=PII
-projectid:sandbox-project |
גישה לחיפוש ב-Knowledge Catalog
יש כמה דרכים לגשת לחיפוש ב-Knowledge Catalog:
- דרך הדף חיפוש במסוף Google Cloud . מידע נוסף זמין במאמר חיפוש משאבים.
-
gcloud dataplex entries searchה-CLI של gcloud. -
searchEntriesAPI וספריות לקוח של Cloud. - שרת MCP מרוחק ו-MCP Toolbox for Databases לשימוש אינטראקטיבי ולהפעלת עומסי עבודה פרוגרמטיים ומבוססי-סוכנים.
טווח החיפוש
תוצאות החיפוש ב-Knowledge Catalog מכבדות את ההרשאות שיש לכם לגבי המשאבים התואמים במערכות המקור.
לדוגמה, אם יש לכם גישת קריאה למטא-נתונים של BigQuery לאובייקט מסוים, האובייקט הזה יופיע בתוצאות החיפוש של Knowledge Catalog. אם יש לכם גישה לטבלה ב-BigQuery אבל לא למערך הנתונים שמכיל את הטבלה הזו, הטבלה עדיין תופיע בחיפוש ב-Knowledge Catalog כמו שציפיתם.
כברירת מחדל, החיפוש מוגבל לארגון שלכם. התוצאות כוללות רק משאבים מאותו ארגון של הפרויקט שבו אתם מחפשים.
תוצאות החיפוש כוללות רק את המשאבים ששייכים לאותו גבול גזרה של VPC Service Controls כמו הפרויקט שבו מתבצע החיפוש. כשמשתמשים במסוףGoogle Cloud , זהו הפרויקט שנבחר במסוף.
כדי להרחיב את היקף תוצאות החיפוש מעבר למשאבים ב-service perimeter של VPC Service Controls בפרויקט, אפשר להשתמש בכללי תעבורת נתונים נכנסת (ingress) ויוצאת (egress) של VPC Service Controls. הכללים האלה מאפשרים להחליף נתונים באופן פרטי ויעיל בארגון. אפשר להגדיר כללי תעבורת נתונים נכנסת (ingress) ותעבורת נתונים יוצאת (egress) באמצעות מסוףGoogle Cloud או באמצעות קובצי JSON או YAML. אפשר להיעזר בדוגמה הבאה של YAML ובמסמכי התיעוד של VPC Service Controls כדי להתאים את הכלל לדרישות הספציפיות שלכם.
egressPolicies:
- egressFrom:
identityType: ANY_USER_ACCOUNT
egressTo:
# Specify which resources should be present in the search results. In this example,
# BigQuery.
operations:
- methodSelectors:
- method: '*'
serviceName: bigquery.googleapis.com
# Specify project ids under which the search is performed.
resources:
- projects/SEARCH_PROJECT_ID
ingressPolicies:
- ingressFrom:
identityType: ANY_USER_ACCOUNT
sources:
- accessLevel: '*'
ingressTo:
# Specify which resources should be present in the search results. In this example,
# BigQuery.
operations:
- methodSelectors:
- method: '*'
serviceName: bigquery.googleapis.com
# Specify project ids to expose in search results.
resources:
- projects/INGRESS_PROJECT_ID
במאמר תפקידי IAM ב-Knowledge Catalog מוסבר אילו תפקידים בניהול הזהויות והרשאות הגישה (IAM) צריך להשתמש כדי לחפש ב-Knowledge Catalog.
בידוד תוצאות החיפוש לפי סביבה באמצעות VPC Service Controls
כדי לבודד את תוצאות החיפוש ב-Knowledge Catalog בין סביבות כמו פיתוח, בדיקה וייצור, צריך להגדיר היקפים נפרדים של VPC Service Controls לכל סביבה. מקצים את הפרויקטים שמכילים את נכסי הנתונים ואת הפרויקטים שמשמשים לביצוע חיפושים לגבולות הגזרה המתאימים של הסביבה. חיפושים שמבוצעים מפרויקט בתוך גבולות גזרה מסוימים מחזירים רק תוצאות של נכסים שנמצאים בתוך גבולות הגזרה האלה.
מגבלות על ביטול שליחה בחיפוש
שאילתות חיפוש ב-Knowledge Catalog לא מבטיחות היזכרות מלאה, כלומר יכול להיות שהחיפוש לא יחזיר תוצאות שתואמות לשאילתה. בנוסף, אם תחזרו על שאילתות חיפוש, יכול להיות שתקבלו תוצאות שונות (או שלא תקבלו תוצאות בכלל).
כדי לשלוח שאילתה לכל המטא-נתונים של Knowledge Catalog, אפשר לייצא את המטא-נתונים ל-Cloud Storage ואז לשלוח שאילתה מ-BigQuery. מידע נוסף זמין במאמר בנושא ייצוא מטא-נתונים.
המאמרים הבאים
- הסבר על תחביר החיפוש ב-Knowledge Catalog
- איך מחפשים משאבים
- אפשר לנסות תרחישי שימוש ב-Knowledge Catalog.
- אפשר להשתמש בסוכן הגילוי של Knowledge Catalog כדי לקבל תשובות לשאילתות מורכבות בשפה טבעית.