Knowledge Catalog (לשעבר Dataplex Universal Catalog) מספק פלטפורמה מאוחדת ומובנית לניהול מטא-נתונים בכל נכסי הנתונים המבוזרים שלכם. הוא מגלה, מאנדקס ומארגן באופן אוטומטי מבנים טכניים, הקשר עסקי, מדדים של איכות הנתונים ויחסים תפעוליים.
באמצעות ארגון המטא-נתונים במטא-מודל גמיש וניתן להרחבה, Knowledge Catalog יוצר את הבסיס המבני של גרף ההקשר הפעיל ב-Agentic Data Cloud של Google. גרף ההקשר הזה מאפשר לצוותי נתונים לגלות נכסים ולנהל אותם, וגם מאפשר לסוכני AI גנרטיבי לאחזר הקשר עסקי מהימן ומבוסס.
מטא-מודל של Knowledge Catalog
ב-Knowledge Catalog, המטא-נתונים מאורגנים באמצעות היררכיה מודולרית של קונטיינרים, נכסים, סכימות ויחסים:
- מאגרים ונכסים: קבוצות של רשומות מארגנות רשומות, שמייצגות נכסי נתונים בודדים ואת עמודות הסכימה שלהם.
- העשרה מובְנית: סוגי היבטים מגדירים סכימות להיבטים, שמצרפים מטא-נתונים מובְנים לרשומות, לעמודות או לקשרים.
- תקנים וניהול: סוגי רשומות מגדירים תבניות שמחילות היבטים נדרשים על רשומות.
- קשרי גומלין: סוגי קישורים לרשומות מגדירים קשרי גומלין (קישורים לרשומות) שמקשרים בין רשומות קשורות לבין מונחים עסקיים.
בטבלה הבאה מפורטים ההבדלים בין משאבים שמנוהלים על ידי המערכת (שמסופקים באופן אוטומטי על ידי Google Cloud) לבין משאבים מותאמים אישית שמוגדרים על ידי המשתמש:
| רכיב מטא-מודל | מנוהל על ידי המערכת (מובנה) | בהגדרת משתמש (בהתאמה אישית) |
|---|---|---|
| קבוצות של נקודות כניסה | מוגדר מראש לכל פרויקט עבור Google Cloud שירותים (לדוגמה, @bigquery, @spanner, @pubsub). |
נוצר על ידי משתמשים כדי לקבץ ולנהל נכסי נתונים בהתאמה אישית והרשאות. |
| רשומות | מאוכלסים אוטומטית ממקורות Google Cloud (כמו טבלאות, תצוגות, מערכי נתונים ומודלים של BigQuery). | נוצר על ידי משתמשים כדי לייצג מקורות נתונים, קבצים או מסדי נתונים של צד שלישי בהתאמה אישית. |
| סוגי היבטים | תבניות מערכת מוגדרות מראש (לדוגמה, Schema, Overview, Contacts, DataQuality, Lineage). |
נוצר על ידי משתמשים כדי להגדיר סכימות של מטא-נתונים ספציפיים לדומיין (כמו סיווג של פרטים אישיים מזהים או רמות של הסכמי רמת שירות). |
| היבטים | מאוכלס באופן אוטומטי ממערכות מקור, מיומני שאילתות או מסריקות אוטומטיות. | נוצר על ידי משתמשים, צינורות או סוכנים ומצורף לרשומות, עמודות או קישורים לרשומות. |
| סוגי רשומות | תבניות מוגדרות מראש שמייצגות Google Cloud סוגי משאבים. | מוגדר על ידי משתמשים כדי לציין היבטים חובה ואופציונליים של נכסי נתונים מותאמים אישית. |
| קישורים לדף הנחיתה | סוגי קשרים מובנים (כמו synonym,
definition, schema-join,
related). |
מופעים שנוצרו בין רשומות או עמודות ספציפיות כדי ליצור מודל של חיבורים בין מערכות. |
בקטעים הבאים מתוארים הרכיבים העיקריים שמרכיבים את מטא-מודל של Knowledge Catalog.
קבוצות של רשומות
קבוצת רשומות (EntryGroup) היא מאגר אזורי של רשומות וקישורים לרשומות, שמשמש כגבול אדמיניסטרטיבי ואבטחתי לניהול המשאבים האלה.
אפשר להשתמש בקבוצות של רשומות כדי להגדיר את הדברים הבאים:
- בקרת גישה לניהול זהויות והרשאות גישה (IAM): אפשר לתת הרשאות צפייה או עריכה לצוותים ספציפיים בקבוצת רשומות בלי לשנות את ההרשאות של רשומות בודדות.
- שיוך למיקום ולפרויקט: קיבוץ נכסים לפי אזור גיאוגרפי ובעלות על פרויקט.
במקורות Google Cloud , Knowledge Catalog יוצר באופן אוטומטי קבוצות של רשומות מערכת לכל פרויקט (למשל @bigquery או @spanner). במקורות נתונים מותאמים אישית, אתם יוצרים קבוצות של רשומות בהתאמה אישית.
לדוגמה, צוות הכספים יכול ליצור קבוצת רשומות בהתאמה אישית בשם production_finance_data כדי לנהל את הרשאות הגישה לכל הרשומות בהתאמה אישית שקשורות לכספים במקום אחד.
מידע נוסף זמין במאמר בנושא קבוצות של רשומות.
רשומות ונתיבי סכימה
רשומה (Entry) מייצגת נכס נתונים יחיד. רשומה יכולה לייצג טבלה מובנית במסד נתונים, מודל אנליטי, טבלת אובייקטים לא מובנית או מערך נתונים חיצוני מותאם אישית.
הרכיבים העיקריים של רשומה כוללים את הפרטים הבאים:
- מזהה רשומה: שם משאב ייחודי בתוך קבוצת הרשומות שכוללת אותו.
- סוג הרשומה: התבנית שמגדירה את המבנה של הרשומה ואת ההיבטים הנדרשים.
- מאפיינים: מאפיינים של מטא-נתונים מובְנים שמצורפים לרשומה.
- נתיבי סכימה (עמודות): חלקים או שדות ספציפיים בנכס הנתונים, כמו עמודה בטבלה ב-BigQuery או שדה בסכימת JSON.
בעזרת עמודות אפשר לצרף מטא-נתונים לשדות ספציפיים בנכס. אתם לא מגדירים את העמודות באופן ידני, הן מתמלאות כשמצרפים רכיב מסוג schema לרשומה. אפשר להפנות לשדות מוטמעים באמצעות נתיבים עם סימון נקודות (לדוגמה, customer.address.postal_code).
לדוגמה, טבלה ב-BigQuery בשם orders_project.sales.customer_orders מיוצגת כרשומה. כדי לתאר את השדה email_address בטבלה ככזה שמכיל מידע רגיש, צריך לצרף היבט סיווג ישירות לנתיב העמודה email_address.
מידע נוסף זמין במאמר בנושא רשומות.
סוגי היחסים
סוג היבט (AspectType) הוא תבנית סכימה לשימוש חוזר שמגדירה את השדות, סוגי הנתונים וכללי האימות של היבט. כל היבט הוא מופע של סוג היבט.
סוגי ההיבטים יכולים להיות מוגדרים על ידי המערכת (מסופקים על ידי Google Cloud) או מותאמים אישית (נוצרים על ידי הארגון שלכם).
כשמגדירים את metadata_template לסוג מאפיין מותאם אישית, אפשר להשתמש בסוגי הנתונים הנתמכים הבאים:
| סוג הנתונים של השדה | תיאור | תרחיש שימוש לדוגמה |
|---|---|---|
string |
ערך טקסט (UTF-8). | כתובת האימייל של הבעלים, תווית סיווג הנתונים, שם המחלקה. |
integer / number |
ערכים מספריים (מספרים שלמים או מספרים עם נקודה צפה (floating-point)). | מספר הימים לשמירת הנתונים, אחוז היעד של הסכם רמת השירות (SLA), דירוג העדיפות. |
boolean |
דגל True או False. | contains_pii: true, is_certified: false. |
enum |
רשימה מוגדרת מראש של ערכי מחרוזת מותרים. | סביבה: ["DEV", "STAGING", "PROD"]. |
datetime / timestamp |
תאריך ושעה בפורמט ISO 8601. | התאריך האחרון לאישור, המועד האחרון לבדיקת התאימות. |
record |
אובייקט מובנה מקונן שמכיל שדות צאצא. | ContactInfo { name: string, email: string, phone: string }. |
array |
רשימה של ערכים חוזרים מכל סוג פרימיטיבי או רשומה. | רשימת בעלי הנתונים המשניים: ["user1@example.com", "user2@example.com"]. |
map |
צמדים של מחרוזות מפתח/ערך למאפיינים שניתנים להרחבה. | תגי פריסה בהתאמה אישית: {"cost_center": "1042", "tier": "gold"}. |
לדוגמה, כדי להגדיר תבנית לשימוש חוזר לפרטים ליצירת קשר, אפשר ליצור סוג מאפיין בשם ContactInfo עם שדות לowner_name (string), email (string) ו-support_channel (string).
מידע נוסף זמין במאמר בנושא סוגי היבטים.
היבטים
אספקט (Aspect) הוא קבוצה של שדות מטא-נתונים קשורים שתואמים לסוג אספקט. ההיבטים מצורפים לרשומה, לנתיב רשומה (עמודה) או לקישור רשומה כדי לתאר את המשאב הזה.
בניגוד למערכות תיוג מדור קודם, ההיבטים ב-Knowledge Catalog מוכללים ישירות ברשומות האב שלהם או בקישורי הרשומות שלהם, מה שמאפשר לכם לבצע פעולות אטומיות של קריאה וכתיבה.
היבטים משמשים בכמה פונקציות:
- מבנה טכני: ההיבט
Schemaמתאר עמודות בטבלה, סוגי נתונים ותיאורים. - הקשר עסקי: היבטים מותאמים אישית שמתארים את הבעלות, התאימות והסטטוס של מחזור החיים.
- אמינות תפעולית: היבטים של איכות הנתונים מתעדים את תוצאות הסריקה של כללים אוטומטיים ואת ציוני האימות.
- גרפים של ישויות לא מובְנים: ההיבט
GraphProfileכולל ישויות שחולצו על ידי AI וקצוות של קשרים מקבצים לא מעובדים.
לדוגמה, אפשר ליצור מופע של סוג ההיבט ContactInfo עם הערכים {"owner_name": "Alex", "email": "alex@example.com"} ולצרף אותו לרשומה customer_orders.
מידע נוסף מופיע במאמר בנושא היבטים.
סוגי רשומות
סוג רשומה (EntryType) הוא תבנית ניהול ליצירת רשומות בהתאמה אישית. הוא אוכף סטנדרטים של איכות מטא-נתונים על ידי הגדרת סוגי ההיבטים הנדרשים שצריך לצרף לרשומה מסוג מסוים.
כשיוצרים רשומה מסוג רשומה ספציפי, Knowledge Catalog מוודא שכל סוגי ההיבטים שמסומנים ב-required בסוג הרשומה קיימים ותקינים.
לדוגמה, אפשר ליצור סוג רשומה בשם CertifiedDataProduct
שמציין את סוגי ההיבטים OwnerInfo ו-DataRetentionPolicy כנדרשים. כל רשומה חדשה שנוצרת עם סוג הרשומה הזה חייבת לכלול את ההיבטים האלה לפני ששומרים אותה.
מידע נוסף זמין במאמר בנושא סוגי רשומות.
קישורי כניסה וסוגי קישורי כניסה
קישור כניסה (EntryLink) יוצר קשר סמנטי בין שני רשומות נתונים או בין עמודות ספציפיות ברשומות. כל קישור לכניסה הוא מופע של סוג קישור לכניסה (EntryLinkType).
קישורים לכניסה יכולים להיות מכוונים או לא מכוונים:
- סימטרי (לא מכוון): קשרים שבהם שני הצדדים הם עמיתים (לדוגמה,
synonym,relatedאוschema-join). - אסימטרי (מכוון): קשרים עם מקור ויעד מפורשים (לדוגמה,
definition, קישור מונח במילון מונחים עסקי לעמודה בטבלה).
אפשר גם לצרף היבטים ישירות לקישורים של רשומות (חוץ מקישורים מסוג schema-join
). כך תוכלו לתאר את הקשר עצמו, למשל לתעד ציוני מהימנות של הצטרפות, כללי טרנספורמציה או הערות מיפוי.
Knowledge Catalog תומך בסוגים הבאים של קישורי כניסה מובנים:
-
synonym: מקשר בין מושגים עסקיים מקבילים או בין מונחים חלופיים. -
related: חיבור נכסים עם צימוד רופף בין מערכות. -
definition: מקשר בין הגדרות במילון המונחים הארגוני לבין עמודות או רשומות פיזיות. -
schema-join: מחבר בין טבלאות שאפשר לבצע בהן הצטרפות לאורך נתיבי מפתח זר או סכימה תואמים.
מידע נוסף זמין במאמר EntryLinks REST reference.
מילוני מונחים ארגוניים
מילון המונחים הארגוני מאפשר לכם ליצור טקסונומיה עסקית רשמית על ידי הגדרת מילוני מונחים, קטגוריות ומונחים עסקיים.
באמצעות קישורי כניסה מסוג definition או synonym, אפשר למפות מונחים עסקיים ישירות לערכים פיזיים ולנתיבי עמודות. כשמשתמשים או סוכני AI מחפשים בקטלוג באמצעות שפה טבעית, מנוע החיפוש מפענח את המונחים העסקיים האלה כדי לאתר את נכסי הנתונים הפיזיים הנכונים.
מידע נוסף זמין במאמר בנושא ניהול מילונים עסקיים.
מקורות נתמכים Google Cloud
מערכת Knowledge Catalog מעכלת באופן אוטומטי מטא-נתונים מהGoogle Cloud מקורות הבאים. בשירותים מסוימים, כמו AlloyDB ל-PostgreSQL ו-Cloud SQL, צריך קודם להפעיל את השילוב עם Knowledge Catalog כדי שאפשר יהיה להטמיע מטא-נתונים:
Analytics ו-lakehouse
- מערכי נתונים, טבלאות, תצוגות, מודלים, שגרות, חיבורים ומערכי נתונים מקושרים ב-BigQuery
- שיתוף ב-BigQuery (לשעבר Analytics Hub) – חילופי נתונים ורישומים
- מאגרי Dataform ונכסי קוד
- שירותים, מסדי נתונים וטבלאות של Dataproc Metastore
טבלאות בקטלוג REST של Iceberg (כולל Google Cloud קטלוג זמן הריצה של Lakehouse IRC, קטלוג Databricks Unity IRC, קטלוג AWS Glue Data Catalog IRC וקטלוג Snowflake Horizon IRC)
AI ולמידת מכונה
- מודלים, מערכי נתונים, קבוצות תכונות, תצוגות תכונות ומופעים של חנות אונליין ב-Vertex AI
בינה עסקית
- מכונות, מרכזי בקרה, רכיבים של מרכזי בקרה, תצוגות, פרויקטים של LookML, מודלים, ניתוחים ותצוגות ב-Looker (Google Cloud Core) (תצוגה מקדימה)
מסדי נתונים
- מופעים, אשכולות וטבלאות של Bigtable (כולל פרטים על משפחות עמודות)
- מכונות, מסדי נתונים, טבלאות ותצוגות של Spanner
סטרימינג והעברת הודעות
- נושאים ב-Pub/Sub
נתונים לא מובְנים
מסדי נתונים תפעוליים
- אשכולות, מכונות, מסדי נתונים, סכימות, טבלאות ותצוגות (תצוגה מקדימה) של AlloyDB ל-PostgreSQL. Knowledge Catalog מאחזר מטא-נתונים רק ממופעים ראשיים של AlloyDB ולא ממופעים משוכפלים לקריאה. מידע נוסף זמין במאמר בנושא ניהול משאבי AlloyDB ל-PostgreSQL באמצעות Knowledge Catalog.
- מכונות, מסדי נתונים, סכימות, טבלאות ותצוגות של Cloud SQL. Knowledge Catalog מאחזר מטא-נתונים רק ממופעים ראשיים של Cloud SQL ולא ממופעים משוכפלים לקריאה. מידע נוסף מופיע במאמר ניהול משאבי Cloud SQL באמצעות Knowledge Catalog.
כדי לייבא מטא-נתונים ממקור של צד שלישי אל Knowledge Catalog, אפשר להשתמש במחברים של Knowledge Catalog או בצינור קישוריות מנוהל. מידע נוסף זמין במאמרים מידע על מחברים של Knowledge Catalog וסקירה כללית על קישוריות מנוהלת.
אילוצים של פרויקטים ומיקומים
משאבי קטלוג ב-Knowledge Catalog מאוחסנים ב Google Cloud פרויקטים ובמיקומים גיאוגרפיים ספציפיים. ההגבלות הבאות חלות על היקף ההרשאות:
| משאב | כלל מיקום | כלל פרויקט |
|---|---|---|
| רשומות | המיקום של הרשומה חייב להיות זהה למיקום של EntryType שלה,
או שEntryType חייב להיות global. |
אפשר להפנות לסוגי רשומות גלובליים או לסוגי רשומות באותו פרויקט. |
| היבטים ברשומות | הערך של המאפיין AspectType צריך להיות מאוחסן באותו מיקום שבו מאוחסנת הרשומה, או שהערך של AspectType צריך להיות global. |
אפשר להפנות לסוגי היבטים גלובליים או לסוגי היבטים באותו פרויקט. |
| קישורים לדף הנחיתה | המיקום של קישור הכניסה חייב להיות זהה לערך EntryLinkType שלו, או
שערך EntryLinkType חייב להיות global. |
אפשר לקשר רשומות שנמצאות בפרויקטים שונים באותו ארגון. |
| סוגי רשומות | מורכב מסוגי היבטים שמאוחסנים באותו מיקום כמו סוג הרשומה, או מסוגי היבטים שהם global. |
אם סוג רשומה מפנה לסוגי היבטים בהתאמה אישית, סוגי ההיבטים צריכים להיות באותו פרויקט ובאותו מיקום. |
פידים של שינויים במטא-נתונים
אפשר להשתמש בפידים של שינויים במטא-נתונים כדי להזרים אירועים של שינויים במטא-נתונים ב-Knowledge Catalog כמעט בזמן אמת.
פיד של שינויים במטא-נתונים מפרסם התראות לגבי יצירה, עדכון או מחיקה של רשומות בנושא Pub/Sub שאתם מגדירים. לקוחות מנויים יכולים להשתמש באירועים האלה כדי להפוך תהליכי עבודה תפעוליים לאוטומטיים, כמו הפעלה של הערכות איכות נתונים כשסכימה משתנה או עדכון של לוחות בקרה של ניהול במורד הזרם.
מידע נוסף זמין במאמר מידע על פידים של שינויים במטא-נתונים.
תמחור
ב-Knowledge Catalog, החיוב על נפח המטא-נתונים המאוחסן מתבצע לפי מק"ט האחסון של המטא-נתונים. מידע נוסף מופיע במאמר בנושא תמחור של Knowledge Catalog.
אין חיובים על הפעולות הבאות:
- יצירה וניהול של משאבי מטא-מודל של קטלוג (סוגי רשומות, סוגי היבטים, קבוצות רשומות, רשומות וקישורי רשומות).
- קריאות ל-Search API ושאילתות חיפוש שבוצעו במסוף Google Cloud .
המאמרים הבאים
הוספת מטא-נתונים לטבלה
איתור נכסים וצירוף מטא-נתונים של היבטים בהתאמה אישית לטבלה ב-BigQuery.
הוספת מקורות נתונים בהתאמה אישית
הגדרת סוגי רשומות והטמעה של מטא-נתונים מותאמים אישית ממסדי נתונים ומצינורות חיצוניים.
ניהול מילוני מונחים עסקיים
ליצור טקסונומיה עסקית ולמפות מונחים ישירות לטבלאות ולעמודות פיזיות.
חיפוש וגילוי של נכסים
אפשר לגלות משאבים ב-Google Cloud ובמקורות מותאמים אישית באמצעות פרדיקטים של חיפוש.
אחזור הקשר לסוכני AI
אחזור מטא-נתונים שמוכנים לשימוש במודלים גדולים של שפה (LLM) והקשר פעיל כדי להנחות סוכני AI גנרטיבי.
מעבר מ-Data Catalog
העברת תבניות תגים, רשומות בהתאמה אישית ותהליכי עבודה אל Knowledge Catalog.