מידע על המחשה של השתלשלות הנתונים ב-Knowledge Catalog

שושלת הנתונים עוזרת לכם להבין איך הנתונים עוברים במערכות שלכם. היא עושה זאת על ידי מעקב אחרי הקשרים בין נכסי הנתונים לבין התהליכים שמשנים אותם. אפשר לראות את פרטי השושלת האלה כתרשימים וכרשימות במסוף Google Cloud .

במסמך הזה מוסבר על רמת הפירוט של שושלת הנתונים ברמת הטבלה וברמת העמודה, ומופיעות בו הוראות לשימוש בתצוגות גרף ורשימה כדי לבדוק את שושלת הנתונים במסוף Google Cloud .

פרטים על מודל נתוני הבסיס מופיעים במאמר בנושא מודל מידע על שושלת הנתונים.

ההבדלים בין שושלת נתונים ברמת הטבלה לבין שושלת נתונים ברמת העמודה

השגת שקיפות לגבי מקורות הנתונים מאפשרת לכם לעקוב אחרי המקור של הנתונים ואחרי מסלול השינוי שלהם, גם ברמת הטבלה וגם ברמת העמודה.

מתי כדאי להשתמש בתיעוד של מקורות נתונים ברמת הטבלה

השורה של הטבלה מספקת סקירה כללית ברמה גבוהה של צינורות הנתונים, ומציגה את הקשרים בין טבלאות שלמות. אפשר להשתמש בתיעוד המקור ברמת הטבלה למשימות ברמת המאקרו, כמו:

  • גילוי נתונים. אנליסט שיוצר לוח בקרה חדש יכול להשתמש בנתוני השושלת ברמת הטבלה כדי לעקוב אחרי טבלת סיכום עד למקורות שלה, ולוודא שהנתונים מגיעים ממסד נתונים מהימן.

  • תכנון ההעברה אדמין של מסד נתונים שמתכנן להעביר מסד נתונים מרכזי יכול להשתמש בנתוני השושלת ברמת הטבלה כדי לזהות כל דוח ומרכז בקרה במורד הזרם שתלויים בו.

  • ביקורת ומשילות מידע (data governance). אחראי על ניהול הנתונים יכול להשתמש בתיעוד המקור והיעד ברמת הטבלה וברמת העמודה כדי לבדוק איך נתונים מטבלה שמכילה פרטים אישיים מזהים (PII) זורמים דרך צינור.

מתי כדאי להשתמש בנתוני שושלת ברמת העמודה

השילוב של נתוני שושלת ברמת העמודה מאפשר לכם לקבל תצוגה מפורטת יותר, כי הוא עוקב אחרי זרימת הנתונים בין עמודות נפרדות. בתצוגה הזו, הקישורים באירוע של שושלת הנתונים מייצגים את הקשר בין עמודת מקור לעמודת יעד. לכל אחד מהקישורים ברמת העמודה יש סוג תלות שמתאר את השינוי:

  • Exact copy: הערכים מועתקים בין העמודות.

  • Other: סוגים אחרים של תלות בין עמודות.

אפשר להשתמש בנתוני שושלת ברמת העמודה למשימות כמו:

  • ניתוח שורש הבעיה. אם אנליסט נתונים מוצא ערך שגוי בעמודה, הוא יכול להשתמש בתיעוד המקור של העמודה כדי לאתר את עמודות המקור ולמצוא את שורש הבעיה.

  • ניתוח השפעות. לפני שמהנדס נתונים מוציא משימוש עמודה, הוא יכול להשתמש בתיעוד המקור של עמודה כדי למצוא כל עמודה במורד הזרם שתלויה בה.

  • אימות של מקורות נתונים למדדים. אנליסט נתונים יכול להשתמש בשושלת נתונים ברמת העמודה כדי לזהות אילו עמודות מקור משמשות לחישוב מדד, בלי לפענח שאילתת SQL מורכבת.

השבחת נתונים ברמת העמודה נאספת באופן אוטומטי עבור סוגי המשימות הבאים ב-BigQuery:

במקרה של משימות Managed Service for Apache Spark, התמיכה תלויה בסוג ובגרסה של התלות ב-Open Lineage שבה נעשה שימוש ב-Managed Service for Apache Spark. הגרסה המינימלית הנתמכת היא 1.34. אלה הגרסאות המינימליות הנתמכות של תמונות אשכולות של Managed Service for Apache Spark:

  • 3.0.3
  • 2.3.22
  • 2.2.75
  • 2.1.107

אלה גרסאות המינימום של זמן הריצה של Managed Service for Apache Spark שנתמכות:

  • 3.0.3
  • 2.3.20

תצוגות של היסטוריית השינויים במסוף Google Cloud

במסוף Google Cloud אפשר לקיים אינטראקציה עם מידע על שרשרת מקורות הנתונים בשתי דרכים: אפשר לעיין בתרשים של שרשרת מקורות הנתונים בכמה אזורים זמינים, או להשתמש בחלונית Lineage explorer כדי לקבל תצוגה ממוקדת יותר באזור ספציפי. אפשר גם לעבור בין תצוגת הגרף לתצוגת הרשימה כדי לנתח את זרימת הנתונים ברמות פירוט שונות.

תצוגות של שושלת הנתונים זמינות רק לרשומות ב-Knowledge Catalog (לשעבר Dataplex Universal Catalog), לנכסי BigQuery ולמשאבי Vertex AI (מודלים, מערכי נתונים, תצוגות של מאגר תכונות וקבוצות תכונות).

כדי לראות את התצוגות השונות שמוזכרות במאמר הזה, אפשר לעיין במאמר בנושא שימוש ב-Data Lineage עם מערכות. Google Cloud

תצוגת תרשים של שרשרת היוחסין

בתצוגת הגרף מוצגים באופן חזותי הזרימה של נכסי הנתונים והקשרים בין מערכות ואזורים. כך אפשר להבין את ארכיטקטורת הנתונים, לעקוב אחרי המקורות והיעדים ולזהות דפוסים. בתרשימי שרשרת היוחסין האלה, שנוצרים על ידי שירות Data Lineage API עבור רשומה ספציפית ב-Knowledge Catalog, מוצגת הטרנספורמציה של הנתונים לאורך זמן. אפשר לראות בהם את הזרימה במעלה הזרם, במורד הזרם או בשני הכיוונים מרשומת הבסיס שנבחרה.

‫Data Lineage API מקבל באופן אוטומטי מידע על נכסים ממערכות נתמכות וממקורות מותאמים אישית באמצעות קריאות ל-API.

הרכיבים העיקריים בתרשים הם:

  • צמתים. הצמתים מייצגים את ישויות הנתונים. בתצוגה ברמת הטבלה, הצומת מציג את שם הטבלה והעמודות שלה. בתצוגה ברמת העמודה, כל צומת מייצג טבלה ועמודה ספציפיות.

  • קצוות. הקצוות הם הקווים שמחברים בין הצמתים ומייצגים את התהליכים שמתרחשים ביניהם. המראה של קו תלוי בתצוגת השושלת:

    • בתצוגה ברמת הטבלה, לקצוות יש סמלים שמציינים טרנספורמציות של נתונים.
    • בתצוגה ברמת העמודה, לקצוות יש תוויות שמציינות את השינויים בנתונים. לדוגמה, תווית קצה יכולה להיות Exact copy כדי לתאר איך עמודת מקור הועתקה לעמודת יעד.
  • עיבוד סמלים ותוויות. סמלים ותוויות של תהליכים מופיעים בקצוות כדי לספק מידע נוסף על הטרנספורמציה.

    • סמלים. הסמלים מייצגים את תהליך השינוי. כשבודקים את הגרף באופן ידני, הסמלים בקצוות מייצגים את מערכת המקור של התהליך (לדוגמה, BigQuery או Vertex AI). אם יש כמה תהליכים, מוצג סמל של 'כמה תהליכים'. אם המערכת לא יודעת מהו מקור התהליך, יופיע סמל של גלגל שיניים. כשמחילים מסננים, סמל גלגל השיניים מופיע בכל התהליכים.
    • תוויות. בתצוגת שושלת הנתונים ברמת העמודה, התווית מתארת את סוג התלות בין העמודות: Exact copy או Other.

עיון בתרשים של שרשרת המקור

כשפותחים את הכרטיסייה Lineage, רואים את תצוגת הגרף שמוגדרת כברירת מחדל. תצוגת ברירת המחדל מספקת סקירה כללית ברמה גבוהה של המערכות והאזורים, עם הרחבה ידנית והדרגתית של הגרף שיכולה לטעון חמישה צמתים בכל פעם. סמלי תהליך בקצוות מייצגים את מערכת המקור או מציינים כמה תהליכים.

גרף שושלת ברירת המחדל של Knowledge Catalog שמציג טרנספורמציות של נתונים ברמת הטבלה במערכות של Google Cloud כמו BigQuery.
תצוגת ברירת המחדל של תרשים השושלת

סינון והדגשה של תצוגות שושלת נתונים

בגרפים גדולים ומורכבים של שושלת הנתונים, אפשר להחיל מסננים או הדגשה כדי לצמצם את הרעש החזותי ולהתמקד בבדיקת שושלת הנתונים באזור ספציפי. משתמשים בחלונית Lineage explorer כדי להגדיר את הקריטריונים. כשמחילים מסננים, סרגל סינון מופיע בחלק העליון של התצוגות תרשים ורשימה, והמסננים הפעילים מוצגים כצ'יפים.

כדי לשפר את התצוגה החזותית של שרשרת המקור, אפשר לבחור באחד מהמצבים הבאים:

  • הדגשה: הצמתים התואמים מודגשים בצבעים ובגבולות, והגרף המלא נשאר גלוי. כך אפשר לאתר נכסים ספציפיים בלי לאבד את ההקשר הכללי של גרף השושלת.

  • מסנן: הצמתים שלא תואמים מוסתרים, והגרף מפשט את עצמו כדי להציג רק את הצמתים התואמים ואת הנתיבים ביניהם. נכסים שלא תואמים, שמהווים חלק מנתיב בין צמתים תואמים, מקובצים לצמתים מכווצים. המצב הזה שימושי לצמצום המורכבות ולהתמקדות רק בנכסים רלוונטיים וביחסים הישירים ביניהם.

כדי לסנן או להדגיש את שרשרת המקור, משתמשים בקריטריונים הבאים:

  • פרויקט: סינון לפי Google Cloud מזהה פרויקט.
  • מערכת: סינון לפי המערכת שבה נמצא נכס הנתונים (לדוגמה, BigQuery או Cloud Storage).
  • שם הישות: סינון לפי שם הנכס. אפשר להשתמש בתו * לחיפושים עם תו כללי (רק בקידומת ובסיומת – לדוגמה, *table או test*).
  • תת-סוג: סינון לפי תת-סוג של נכס (לדוגמה, dashboard או model).
  • שם העמודה: סינון שושלת לפי שם העמודה כדי לראות פרטים ברמת העמודה.
  • כיוון: הצגת שושלת במעלה הזרם או במורד הזרם, או שניהם.
  • טווח זמן: סינון של שרשרת המקור לפי שעת התחלה או שעת סיום ספציפיות.
  • סוג התלות: סינון של שושלת הנתונים ברמת העמודה לפי סוג התלות. דוגמאות לאפשרויות זמינות: All או Exact copy.

כדי לצמצם עוד יותר את העומס, אפשר לבחור באפשרות הסתרת טבלאות זמניות ב-BigQuery כדי להסתיר נכסים זמניים שנוצרו על ידי BigQuery, כמו טבלאות במערכי נתונים שהשמות שלהם מתחילים ב-_script.

חלונית הכלי לבדיקת מקורות נתונים שמציגה מסננים למקורות נתונים ברמת העמודה, כיוון וטווח זמן.
חלונית הכרטיסייה Lineage explorer

בתצוגה הממוקדת בכרטיסיית התצוגה Graph (גרף), הגרף מתרחב אוטומטית עד שלוש רמות, ונטען כל הקשר שמתאים לקריטריוני הסינון. כלי לבדיקת מקורות נתונים מאחזר עד 10 רמות של גרף מקורות הנתונים, אבל רק שלוש הרמות הראשונות מוצגות בתצוגה מורחבת כברירת מחדל. כדי להרחיב את התרשים ולראות את הרמות שנותרו, לוחצים על החיצים.

התצוגה הממוקדת תומכת בשושלת נתונים ברמת הטבלה וברמת העמודה, כולל המחשה של הנתיב מכל צומת שנבחר בחזרה אל השורש. בתצוגה הממוקדת הזו, סמל גלגל שיניים כללי משמש לכל התהליכים.

תצוגה ממוקדת של תרשים ההשתלשלות שבה מוצגים נכסי נתונים מסוננים.
תצוגה ממוקדת של גרף שושלת ברמת הטבלה

כדי לראות את שרשרת המקור ברמת העמודה, משתמשים באחת מהשיטות הבאות:

  • בתצוגת תרשים ממוקדת, לוחצים על סמל העמודה בטבלה כדי לעבור לנתוני מקור ברמת העמודה.

    הסמל שמשמש למעבר לנתוני שושלת ברמת העמודה.
    סמל העמודה
  • בתצוגת ברירת המחדל של הגרף או בתצוגה הממוקדת של הגרף, מחילים שם של עמודה בחלונית Lineage explorer.

תרשים של שרשרת היוחסין שמציג את הקשרים בין טבלאות ברמת העמודה.
תצוגת שושלת ברמת העמודה

כדי להסיר את כל המסננים ולחזור לתצוגת ברירת המחדל, לוחצים על איפוס.

כדי לעבור בין מצב הדגשה למצב סינון, אפשר לעיין במאמר שיפור הוויזואליזציה של שרשרת היוחסין.

צפייה בפרטים של צומת ב-Lineage

כדי לראות את הפרטים של צומת, לוחצים על הצומת. מופיעה חלונית צדדית עם מידע מפורט על נכס הנתונים שנבחר. לדוגמה, בתצוגת שושלת ברמת הטבלה, כשלוחצים על צומת מוצג מידע כמו השם המלא של הנכס, הסוג שלו ומאפיינים רלוונטיים אחרים.

חלונית הפרטים של צומת שנבחר בתרשים של שרשרת המקור.
פרטי הצומת

צפייה בהיסטוריה של הפעלות שיוך

גרף מלא של שרשרת היוחסין הוא תוצאה של הרצות של הרבה משימות שונות. כל משימה יוצרת קישור ספציפי בתרשים. רישום של כמה הפעלות יופיע כהפעלות חדשות, אבל לא ישנה את המראה הסטטי של התרשים.

כדי לראות את הפרטים של כל הרצה, לוחצים על קצה עם תהליך בגרף. בחלונית שאילתה שמופיעה, לוחצים על הכרטיסייה הפעלות.

חלונית השאילתה שבה מוצגות הכרטיסיות Details (פרטים) ו-Runs (הפעלות).
חלונית השאילתה

בדיקה של הלוגיקה של טרנספורמציית הנתונים

כדי להבין את הלוגיקה העסקית של טרנספורמציה בלי לחפש את הקוד, אפשר לראות את שאילתת ה-SQL המדויקת שהופעלה. כדי לראות את קוד ה-SQL, לוחצים על קצה עם תהליך בגרף. בחלונית הצדדית שמופיעה, לוחצים על הכרטיסייה פרטים.

המחשה ויזואלית של נתיב שושלת הנתונים

המחשה של נתיב השושלת עוזרת לכם לעקוב אחרי הנתיב מכל צומת שנבחר בתרשים בחזרה אל רשומת הבסיס. כשבוחרים צומת ולוחצים על הצגת הנתיב, התרשים מדגיש רק את הצמתים והתהליכים שיוצרים את נתיב השושלת הישיר אל רשומת הבסיס.

כדי לראות את הוויזואליזציה של נתיב השושלת, בחלונית Lineage explorer, מחילים מסנן כדי ליצור תצוגה ממוקדת של Graph. לאחר מכן, בתצוגה הממוקדת תרשים, בוחרים צומת. בחלונית הפרטים של הצומת שנבחר, לוחצים על הצגת הנתיב.

המחשה של נתיב השושלת זמינה לשושלת ברמת הטבלה ולשושלת ברמת העמודה. אפשר גם להשתמש בהצגה חזותית של נתיב השושלת בתצוגת רשימה.

לחצן להמחשת נתיב השושלת בתצוגת תרשים השושלת ברמת העמודה.
לחצן להצגת תרשים של נתיב המקור בתצוגת תרשים המקור ברמת העמודה

תצוגת רשימה של נתוני השושלת

בתצוגה List מוצג ייצוג טבלאי ומובנה של שרשרת המקור, שמתעדכן באופן אוטומטי עם התצוגה Graph. הוא מאפשר למיין, לסנן ולהוריד נכסי נתונים. התצוגה הזו מתאימה במיוחד לניתוח של קשרים בין מקורות ליעדים, להצגת פרטים על הנכסים הרלוונטיים ולייצוא של נתוני שושלת.

התצוגה רשימה זמינה גם לנתוני שושלת ברמת הטבלה וגם לנתוני שושלת ברמת העמודה. אפשר לעבור בין התצוגות המפורטות והפשוטות הבאות של רשימת המשימות:

  • תצוגת רשימה פשוטה: התצוגה הזו שימושית לקבלת רשימה ייחודית ומצומצמת של כל הנכסים שקשורים למוצא. העמודות, כמו System, ‏ Project, ‏ Entity,‏ FQN (שם מוגדר במלואו),‏ Direction ו-Depth, עוזרות לכם לראות את כל נכסי הנתונים ב-lineage, איפה הם נמצאים, מה המקור המקורי שלהם והמרחק שלהם מהנכס המרכזי שמנותח. הוא אידיאלי לקבלת סקירה כללית ברמה גבוהה של כל הישויות שמשתתפות בהעברת הנתונים. זו תצוגת ברירת המחדל.

  • תצוגת רשימה מפורטת: התצוגה הזו מיועדת לניתוח של קשרי גומלין בין מקור ליעד. העמודות הנפרדות מקור ויעד מאפשרות לכם לראות כל קישור ספציפי להמרת נתונים. התצוגה הזו מתאימה למשימות שדורשות הבנה מעמיקה של תנועת הנתונים בין זוגות ספציפיים של נכסים, כמו ביקורת של זרימות נתונים פרטניות, הבנת התלות בין טבלאות או ייצוא של רשומות מפורטות של שרשרת מקורות לכל חיבור.

תצוגת רשימת קשרי התלות ברמת הטבלה

בתצוגה הזו מוצגים הקשרים בין הטבלאות בכללותן. משתמשים במסננים שמופיעים כדי לבחור את העמודות שרוצים.

טבלה שמציגה את רשימת הצאצאים ברמת הטבלה בתצוגה פשוטה.
תצוגת רשימה פשוטה ברמת הטבלה

כדי לראות את העמודות שזמינות בתצוגות הרשימה ברמת הטבלה, מרחיבים את הקטעים הבאים.

העמודות שזמינות בתצוגת רשימה פשוטה ברמת הטבלה

  • מערכת: המערכת שבה נמצא נכס הנתונים. לדוגמה, [BigQuery](/bigquery/docs).
  • Project: מזהה הפרויקט ב- Google Cloud שמכיל את נכס הנתונים.
  • Entity: השם של נכס הנתונים. לדוגמה, שם של טבלה.
  • FQN: השם המלא (FQN) של ישות או עמודה במקור המקורי.
  • כיוון: מציין אם הנכס שמופיע ברשימה הוא במעלה הזרם (מקור) או במורד הזרם (יעד) בתהליך של שרשרת המקור.
  • עומק: מספר השלבים בשרשרת היוחסין מהנכס המרכזי שמנותח.

העמודות שזמינות בתצוגת רשימה מפורטת ברמת הטבלה

  • מערכת המקור: המערכת שבה נמצא נכס נתוני המקור. לדוגמה, BigQuery.
  • פרויקט המקור: מזהה הפרויקט ב- Google Cloud שמכיל את נכס נתוני המקור.
  • מקור: השם של נכס נתוני המקור. לדוגמה, שם של טבלה.
  • Source FQN: ה-FQN של ישות המקור.
  • מערכת היעד: המערכת שבה נמצא נכס נתוני היעד. לדוגמה, BigQuery.
  • Target project (פרויקט היעד): מזהה הפרויקט ב- Google Cloud שמכיל את נכס נתוני היעד.
  • יעד: השם של נכס נתוני היעד. לדוגמה, שם של טבלה.
  • Target FQN: ה-FQN של ישות היעד.
  • כיוון: מציין אם הנכס שמופיע ברשימה הוא במעלה הזרם (מקור) או במורד הזרם (יעד) בתהליך של שרשרת המקור.
  • עומק: מספר השלבים בשרשרת היוחסין מהנכס המרכזי שמנותח.

תצוגת רשימת קשרי התלות ברמת העמודה

בתצוגה הזו מוצגים הקשרים בין העמודות השונות בטבלאות המקור והיעד. משתמשים במסננים שמופיעים כדי לבחור את העמודות שרוצים.

טבלה שבה מוצגת רשימה פשוטה של שורות ברמת העמודה.
תצוגת רשימה פשוטה ברמת העמודה

כדי לראות את העמודות שזמינות בתצוגות הרשימה ברמת העמודה, מרחיבים את הקטעים הבאים.

העמודות שזמינות בתצוגת רשימה פשוטה ברמת העמודה

  • מערכת: המערכת שבה נמצא נכס הנתונים. לדוגמה: BigQuery.
  • Project: מזהה הפרויקט ב- Google Cloud שמכיל את נכס הנתונים.
  • Entity: השם של נכס הנתונים. לדוגמה, שם של טבלה.
  • עמודה: העמודה הספציפית שנבחרה בחלונית Lineage Explorer בתוך הישות.
  • FQN: השם המלא (FQN) של ישות המקור או העמודה המקורית.
  • כיוון: מציין אם הנכס שמופיע ברשימה הוא במעלה הזרם (מקור) או במורד הזרם (יעד) בתהליך של שרשרת המקור.
  • עומק: מספר השלבים בשרשרת היוחסין מהנכס המרכזי שמנותח.

העמודות שזמינות בתצוגת רשימה מפורטת ברמת העמודה

  • מערכת המקור: המערכת שבה נמצא נכס נתוני המקור.
  • פרויקט המקור: מזהה הפרויקט ב- Google Cloud שמכיל את נכס נתוני המקור.
  • Source FQN: ה-FQN של עמודת המקור.
  • מערכת היעד: המערכת שבה נמצא נכס נתוני היעד.
  • Target project (פרויקט היעד): מזהה הפרויקט ב- Google Cloud שמכיל את נכס נתוני היעד.
  • Target FQN: ה-FQN של עמודת היעד.
  • כיוון: מציין אם זרימת הנתונים היא במעלה הזרם או במורד הזרם.
  • סוגי תלות: תיאור של אופי הקשר בין העמודות.
  • עומק: מספר השלבים בשרשרת המקור של הנכס המרכזי שמנותח.

המאמרים הבאים