מידע על שושלת נתונים

שושלת נתונים היא מפה חזותית שעוקבת אחרי כל מחזור החיים של הנתונים. הוא מראה לכם מאיפה הנתונים מגיעים (המקור), לאן הם עוברים (יעדים) ואת כל השינויים או הטרנספורמציות שמתרחשים לאורך הדרך.

אתם יכולים לראות את המפה המלאה של מסלול הנתונים ישירות במסוףGoogle Cloud לנכסים שנוצרו במוצרים כמו Knowledge Catalog (לשעבר Dataplex Universal Catalog), ‏BigQuery (כולל טבלאות חיצוניות שנוצרו בשביל Iceberg REST Catalog) ו-Vertex AI. תהליכי עבודה מתפרסים בדרך כלל על פני כמה אזורים, ולכן Knowledge Catalog תומך בשושלת נתונים במספר אזורים, שמאפשרת תצוגה מאוחדת של מסלול הנתונים בסביבה העסקית הגלובלית של Google Cloud . משתמשים מתקדמים יכולים גם לאחזר את המידע הזה באמצעות Data Lineage API.

למה צריך שושלת נתונים

חברות מודרניות מעבירות ומשנות כמויות גדולות של נתונים כל הזמן. לדוגמה, הפיכת נתונים גולמיים של רכישות לקוחות לדוחות, למרכזי בקרה ולמודלים של למידת מכונה. המורכבות הזו יוצרת אתגרים קריטיים לצוות שלכם:

  • אמון ואימות. משתמשי נתונים מתקשים לעיתים קרובות לוודא שהדוחות והמספרים שהם רואים מדויקים ומגיעים ממקור מהימן.

  • פתרון בעיות. כששגיאה מופיעה בדוח סופי, יכול להיות שצוותי הנתונים יתקשו לאתר את שורש הבעיה בכל שלב, וזה ייקח להם הרבה זמן.

  • ניהול שינויים. לפני שמשנים או מוחקים נתון מסוים (כמו עמודה בטבלה), הצוותים צריכים לדעת על כל דוח או מודל במורד הזרם שמסתמך על הנתון הזה, כדי למנוע שיבושים במערכות קריטיות.

  • תאימות. כדי לעמוד בדרישות הרגולטוריות, המנהלים צריכים לראות איך משתמשים במידע אישי רגיש (כמו מידע על לקוחות או מידע פיננסי) בארגון.

הפתרון לבעיות האלה הוא מעקב אחר מקורות הנתונים, שמאפשר לכם לראות בצורה ברורה, ויזואלית ומתועדת את המסלול של הנתונים. כך תוכלו להבין את מקורות הנתונים, לעקוב אחרי שגיאות, להעריך את ההשפעה של שינויים ולשמור על תאימות.

איך פועל שושלת היוחסין של הנתונים

תהליך העבודה של שושלת הנתונים כולל את השלבים הבאים:

  1. מקורות נתונים והטמעה: מידע על שושלת מגיע ממקורות הנתונים ומתחיל את התהליך כולו.

    • Google Cloud שירותים: כשמפעילים את Data Lineage API, שירותים נתמכים כמו BigQuery ו-Dataflow מדווחים באופן אוטומטי על אירועי שושלת בכל פעם שנתונים מועברים או עוברים שינוי.

    • מקורות בהתאמה אישית: בכל מערכת שלא נתמכת באופן אוטומטי על ידי שילוביGoogle Cloud , אתם יכולים להשתמש ב-Data Lineage API כדי לתעד באופן ידני את פרטי שושלת הנתונים. מומלץ לייבא אירועים בפורמט שמותאם לתקן OpenLineage.

  2. פלטפורמת שושלת: פלטפורמה מרכזית שקולטת, מעצבת ומאחסנת את כל נתוני השושלת.

    • ‫Data Lineage API: ממשק ה-API הזה משמש כנקודת הכניסה היחידה לכל המידע הנכנס על שושלת היוחסין. הוא משתמש במודל נתונים היררכי שמורכב משלושה מושגי ליבה: תהליך, הפעלה ואירוע.

    • עיבוד ואחסון: הפלטפורמה מעבדת את הנתונים הנכנסים ומאחסנת אותם במסדי נתונים מהימנים שעברו אופטימיזציה לשאילתות.

  3. חוויית המשתמש: אתם יכולים לבצע אינטראקציה עם פרטי שושלת היוחסין שמאוחסנים בשתי דרכים עיקריות:

    • בחינה חזותית: במסוף Google Cloud , שירות קצה קדמי מאחזר את נתוני שושלת היוחסין ומציג אותם כתרשים או כרשימה אינטראקטיביים. התכונה הזו נתמכת ב-Knowledge Catalog, ב-BigQuery, ב-Lakehouse (לטבלאות של Iceberg REST Catalog), בשכבה הפיזית (Cloud Storage) וב-Vertex AI (למודלים, למערכי נתונים, דרך צינורות עיבוד נתונים, לתצוגות של Feature Store ולקבוצות של תכונות). התצוגה הזו מתאימה במיוחד לבחינה חזותית של מסלול הנתונים.

    • גישה פרוגרמטית: באמצעות לקוח API, אתם יכולים לתקשר ישירות עם Data Lineage API כדי לנהל את שושלת היוחסין באופן אוטומטי. כך תוכלו לכתוב מידע על שושלת היוחסין ממקורות בהתאמה אישית. בנוסף, אפשר לקרוא את נתוני השושלת המאוחסנים ולשאול עליהם שאילתות כדי להשתמש בהם באפליקציות אחרות או כדי ליצור דוחות בהתאמה אישית.

באיזו שיטה כדאי להשתמש כדי לעקוב אחרי מקורות הנתונים?

כדי לבצע חיפושים מיידיים ברמה אחת, משתמשים בשיטה SearchLinks. כדי ליצור תרשים מלא של שרשרת היוחסין או לבצע ניתוח מפורט של ההשפעה (עד 100 רמות), משתמשים בשיטה SearchLineageStreaming.

בוחרים את השיטה שהכי מתאימה לתרחיש לדוגמה:

תכונה SearchLinks SearchLineageStreaming
עומק רמה אחת (שכנים מיידיים) עד 100 רמות
הפעלה סינכרוני סטרימינג בזמן אמת
תרחיש שימוש חיפושים פשוטים של מקורות או יעדים ישירים יצירת גרף מלא של שרשרת היוחסין או ביצוע ניתוח השפעה

זיהוי כיוון

  • Upstream (מקורות):
    • בשדה SearchLinks, מגדירים את השדה target ל-FQN של הנכס.
    • ב-SearchLineageStreaming, מגדירים את direction לערך UPSTREAM.
  • Downstream (יעדים):
    • ב-SearchLinks, מגדירים את השדה source ל-FQN של הנכס.
    • ב-SearchLineageStreaming, מגדירים את direction לערך DOWNSTREAM.

מודל מידע של שושלת נתונים

שושלת היא תיעוד של נתונים שעוברים טרנספורמציה ממקורות ליעדים. ‫Data Lineage API אוסף את המידע הזה ומארגן אותו במודל נתונים היררכי שמשתמש במושגים של תהליכים, הרצות ואירועים.

קונספט תיאור
תהליך הגדרה של טרנספורמציה של נתונים.
ריצה הפעלה של תהליך.
אירוע רשומה של תנועת הנתונים במהלך הפעלה.

מהו תהליך של שרשרת צאצאים?

תהליך הוא הגדרה של פעולת טרנספורמציה של נתונים במערכת ספציפית. ב-BigQuery, תהליך הוא משימה מסוג משימה נתמך. כל ההפעלות של אותה שאילתת SQL מקושרות לתהליך אחד, וכך אפשר לעקוב אחרי כל מופע שבו נעשה שימוש בלוגיקה ספציפית של טרנספורמציה.

לדוגמה, שאילתת ה-SQL הבאה היא תהליך. השאילתה הזו יוצרת טבלה על ידי ספירת המספר הכולל של הנסיעות לכל ספק משתי טבלאות מקור.

  CREATE TABLE `dataplex-docs.data_lineage_demo.total_green_trips_22_21`
  AS
  SELECT
      vendor_id,
      COUNT(*) AS number_of_trips
  FROM
      (
          SELECT vendor_id
          FROM `dataplex-docs.data_lineage_demo.nyc_green_trips_2022`
          UNION ALL
          SELECT vendor_id
          FROM `dataplex-docs.data_lineage_demo.nyc_green_trips_2021`
      )
  GROUP BY
      vendor_id;

הפורמט של שם משאב REST לתהליך הוא projects/PROJECT_NUMBER/locations/LOCATION/processes/PROCESS_ID.

לדוגמה: projects/123456789123/locations/us/processes/sh-0548bbf4ff3c8072a6c7372ba1acafb6

מידע נוסף על המשאב process זמין במאמר הפניה למשאב Process.

מהי הרצת שושלת?

הרצה היא ביצוע יחיד של תהליך. תהליכים יכולים לכלול כמה הרצות.

כל הרצה היא פעולה ייחודית שמאופיינת על ידי startTime,‏ endTime ומצב סופי, כמו COMPLETED,‏ FAILED או ABORTED.

לדוגמה, אם מריצים את שאילתת ה-SQL מהקטע Process בשעה 9:00 בבוקר, נוצרת הרצה ספציפית. אם מריצים את אותה שאילתה שוב בשעה 10:00, נוצרת ריצה חדשה ושונה. שתי ההרצות מקושרות לאותו תהליך אב.

הפורמט של שם המשאב ב-REST של הרצה מראה שהיא צאצא של תהליך: projects/PROJECT_NUMBER/locations/LOCATION/processes/PROCESS_ID/runs/RUN_ID.

לדוגמה: projects/123456789123/locations/us/processes/sh-0548bbf4ff3c8072a6c7372ba1acafb6/runs/83dd03a51cd2ac80f465c9e267a950b1

מידע נוסף על משאב run זמין במאמר הפניה למשאב Run.

מהו אירוע של שושלת נתונים?

אירוע מייצג נקודת זמן שבה טרנספורמציית נתונים מעבירה נתונים בין ישות מקור לישות יעד. אירוע הוא רשומה מפורטת של תנועת נתונים ספציפית שמקשרת בין טבלאות מקור ויעד להרצה ספציפית. לאירוע יכולים להיות גם כמה מקורות ויעדים.

לדוגמה, אם ההרצה מבצעת את שאילתת ה-SQL שמוסברת בקטע תהליך, אירוע של שושלת מתעד את העובדה שטבלאות המקור nyc_green_trips_2021 ו-nyc_green_trips_2022 משמשות ליצירת טבלת היעד total_green_trips_22_21.

אירוע של שרשרת מקורות מכיל רשימה של קישורים שמגדירים את המקור והיעד. האירועים משמשים ליצירת תרשימי שושלת נתונים. אף על פי שהגרפים האלה של שרשרת היוחסין מוצגים במסוף Google Cloud , אי אפשר לראות בו אירועים בודדים באופן ישיר. אתם יכולים ליצור, לקרוא ולמחוק אירועים באמצעות Data Lineage API, אבל לא לעדכן אותם.

כל קישור בתוך אירוע מגדיר נתיב יחיד של זרימת נתונים מישות מקור לישות יעד. ישות היא הפניה לנכס נתונים, כמו טבלה ב-BigQuery, והיא מזוהה על ידי שם מלא (FQN). אירוע יחיד יכול להכיל כמה קישורים, וזה קורה בדרך כלל בפעולות כמו איחוד טבלאות, שבהן כמה מקורות תורמים ליעד אחד.

פרטים על האופן שבו אירועים תומכים בתיעוד מקורות נתונים ברמת העמודה זמינים במאמר בנושא תיעוד מקורות נתונים ברמת העמודה.

אילו מקורות נתונים נתמכים לצורך מעקב אחר מקורות נתונים?

אפשר לאכלס את המידע על שושלת הנתונים ב-Knowledge Catalog בדרכים הבאות:

  • באופן אוטומטי משירותים משולבים Google Cloud
  • באופן ידני, באמצעות Data Lineage API למקורות מותאמים אישית
  • על ידי ייבוא אירועים מ-OpenLineage

BigQuery

כשמפעילים את תכונת מקורות הנתונים בפרויקט BigQuery, Knowledge Catalog מתעד באופן אוטומטי את פרטי מקורות הנתונים לגבי הפריטים הבאים:

משימות העתקה, שאילתה וטעינה ב-BigQuery מיוצגות כתהליכים.

כדי לראות את פרטי התהליך, בתרשים של שושלת הנתונים, לוחצים על סמל פרטי התהליך פרטי
התהליך..

כל תהליך מכיל את job_id של BigQuery ברשימת ה-attributes של המשימה האחרונה ב-BigQuery.

שירותים נוספים

התכונה 'מקורות נתונים' תומכת בשילוב עם השירותים הבאים שלGoogle Cloud :

  • Cloud Data Fusion

    אי אפשר להגביל את מעקב המקורות רק ל-Cloud Data Fusion אם Data Lineage API מופעל בפרויקט.

  • Dataflow

    אתם יכולים לתעד אירועים של שרשרת מקורות נתונים באמצעות משימות Dataflow ולפרסם אותם ב-Data Lineage API.

  • טבלאות קטלוג REST של Lakehouse for Iceberg

  • ‫Looker (Google Cloud core) (גרסת Preview)

    יש תמיכה בהמחשה של מטא-נתונים של Looker (ליבת Google Cloud) ממקורות BigQuery באמצעות מעקב אחר מקורות הנתונים. צריך להפעיל את מעקב מקורות הנתונים ברמת המשאב של Looker (ליבת Google Cloud) וברמת שירות מעקב מקורות הנתונים.

  • Managed Service for Apache Airflow

    ב-Managed Airflow, השליטה בשילוב של שושלת הנתונים היא ברמת הסביבה. שושלת הנתונים מופעלת באופן אוטומטי בכל סביבות Managed Airflow החדשות שעומדות בדרישות. בסביבות קיימות, אפשר להפעיל או להשבית את השילוב של שושלת הנתונים דרך הגדרות הסביבה. אתם יכולים להגדיר את ההטמעה של שושלת הנתונים ב-Managed Airflow כדי להפעיל או להשבית את ההטמעה האוטומטית של שושלת הנתונים.

  • ‫Managed Service for Apache Spark: אשכולות Apache Hive

    אתם יכולים לתעד אירועים של שרשרת מקורות נתונים באמצעות משימות Apache Spark Hive ב-Managed Service for Apache Spark ולפרסם אותם ב-Data Lineage API. אתם יכולים להגדיר את הטמעת שושלת הנתונים ב-Managed Service for Apache Spark כדי להפעיל או להשבית את הטמעת שושלת הנתונים האוטומטית.

  • Managed Service for Apache Spark: אשכולות Apache Spark

    אתם יכולים לתעד אירועים של שרשרת מקורות נתונים באמצעות משימות Spark ב-Managed Service for Apache Spark ולפרסם אותם ב-Data Lineage API. אתם יכולים להגדיר את הטמעת שרשרת מקורות הנתונים ב-Managed Service for Apache Spark כדי להפעיל או להשבית את ההטמעה האוטומטית של שרשרת מקורות הנתונים.

  • Managed Service for Apache Spark: פריסה ללא שרת

    אתם יכולים לתעד אירועים של שרשרת מקורות נתונים באמצעות משימות Serverless של Managed Service for Apache Spark ולפרסם אותם ב-Data Lineage API. אתם יכולים להגדיר את הטמעת שושלת הנתונים ב-Managed Service for Apache Spark כדי להפעיל או להשבית את הטמעת שושלת הנתונים האוטומטית.

  • Vertex AI Feature Store

    שושלת הנתונים עוקבת אחרי המטא-נתונים של תצוגות Feature Store וקבוצות הפיצ'רים.

  • Vertex AI Pipelines

    התכונה 'מקורות נתונים' מופעלת באופן אוטומטי עבור צינורות של Vertex AI Pipelines, ועוקבת אחרי ארטיפקטים של קלט ופרמטרים של ביצוע (כמו מודלים, מערכי נתונים ורכיבים), וגם אחרי נכסים נגזרים במורד הזרם.

שושלת נתונים של מקורות נתונים בהתאמה אישית

אתם יכולים להשתמש ב-Data Lineage API כדי לתעד באופן ידני מידע על מקורות נתונים שלא נתמכים במערכות משולבות, כמו מסדי נתונים חיצוניים או צינורות נתונים מקומיים. ב-Knowledge Catalog אפשר ליצור תרשימי שושלת לתיעוד שושלת ידני אם משתמשים ב-fullyQualifiedName שתואם לשמות המלאים של רשומות קיימות ב-Knowledge Catalog. אם רוצים לתעד את מקור הנתונים של מקור נתונים בהתאמה אישית, צריך קודם ליצור רשומה בהתאמה אישית.

כל תהליך של מקור נתונים בהתאמה אישית יכול להכיל מפתח sql ברשימת המאפיינים. הערך של המפתח הזה משמש להדגשת קוד בחלונית הפרטים של תרשים שושלת היוחסין של הנתונים. הצהרת ה-SQL מוצגת כמו שהיא. אתם אחראים לסנן מידע רגיש. שם המפתח sql הוא תלוי אותיות רישיות (case-sensitive).

לדוגמה, מטען ייעודי (payload) של משאב תהליך עם מאפיין sql מותאם אישית:

{
  "displayName": "custom-sql-query",
  "attributes": {
    "sql": "SELECT user_id, SUM(amount) FROM `project.dataset.purchases` GROUP BY user_id"
  }
}

מידע נוסף זמין במאמר מעקב אחרי מידע על שושלת נתונים במערכת חיצונית.

OpenLineage

אם אתם כבר משתמשים ב-OpenLineage כדי לאסוף מידע על שושלת נתונים ממקורות נתונים אחרים, אתם יכולים לייבא אירועים של OpenLineage ל-Knowledge Catalog ולצפות באירועים האלה במסוף Google Cloud . מידע נוסף זמין במאמר שילוב עם OpenLineage.

מעקב אוטומטי אחרי שושלת נתונים

כשמפעילים את Data Lineage API, Google Cloud מערכות שתומכות ב-Data Lineage מתחילות לדווח על תנועת הנתונים שלהן. כל מערכת משולבת יכולה לשלוח מידע על שושלת היוחסין של הנתונים למגוון שונה של מקורות נתונים.

שליטה בהטמעת שושלת נתונים

שליטה ביצירת נתוני שושלת עוזרת לכם לנהל את העלויות ואת מדיניות השליטה. לדוגמה, אפשר להשבית את איסוף נתוני השושלת בפרויקטים של פיתוח או בעומסי עבודה גדולים שלא דורשים מעקב אחר השושלת.

מידע על הגדרה ושליטה בהעברה של נתוני שושלת זמין במאמר שליטה בהעברה של נתוני שושלת לשירות.

שושלת נתונים במספר אזורים

שושלת נתונים הוא שירות אזורי במהותו. מטא-נתונים של שושלת, כולל קישורים, תהליכים ואירועים, נרשמים ומבודדים בצורה מאובטחת במיקום הגיאוגרפי הספציפי שבו מתבצעת טרנספורמציה של נתוני הבסיס או שינוי של נכס.

ככל שארכיטקטורות הנתונים של ארגונים מודרניים מתרחבות, תהליכי העבודה של צינורות עיבוד הנתונים חוצים לעיתים קרובות את גבולות הפרויקטים והאזורים. לדוגמה, צינור טרנספורמציה של BigQuery שפועל ב-us-central1 עשוי לקרוא טבלת מקור ב-us-east1 ולהפיק מדדים מצטברים לקטגוריה של Cloud Storage שנמצאת ב-europe-west1.

כדי לקבל תצוגה מקיפה מקצה לקצה של מחזור החיים של הנתונים במרחבים הגיאוגרפיים העצמאיים האלה, אפשר להשתמש בשיטת חיפוש של שושלת נתונים בכמה אזורים.

מידע נוסף מופיע במאמר מידע על חיפוש שושלת נתונים בכמה אזורים.

שיקולים ומגבלות לגבי שושלת נתונים

כשאתם מתכננים את אסטרטגיית משילות המידע (data governance), חשוב לזכור את השילובים הבאים של שושלת נתונים, את הפרמטרים של התאימות ואת מגבלות השירות.

אמצעי בקרה על שרשרת המקור ברמת המוצר

כשמפעילים את Data Lineage API, מערכות נתמכות מדווחות על שושלת נתונים בהתאם לאמצעי הבקרה שלהן ברמת המוצר. רשימה מלאה של המערכות הנתמכות ואמצעי הבקרה שלהן זמינה במאמר מערכות נתמכות למעקב אחר מקורות נתונים.

תאימות של שושלת נתונים

  • שושלת הנתונים מתעדת מטא-נתונים על תנועת הנתונים, אבל לא מתעדת את הנתונים עצמם. לפרטים על השדות שנכללים במטא-נתונים, אפשר לעיין במודל המידע של Data Lineage ובהפניה ל-Data Lineage API.
  • מקורות הנתונים כחלק מ-Knowledge Catalog תומכים ב-VPC-SC.
  • ב-Knowledge Catalog אין אפשרות להשתמש במפתחות הצפנה בניהול הלקוח (CMEK) כדי להגן על מטא-נתונים של שושלת הנתונים שנאספו.

מגבלות על שושלת נתונים

יש מגבלות על מעקב אחר מקורות נתונים:

  • כל פרטי השושלת נשמרים במערכת למשך 30 ימים בלבד.

  • פרטי השושלת נשמרים גם אחרי שמוחקים את מקור הנתונים שקשור אליהם. לדוגמה, אם מוחקים טבלה ב-BigQuery, עדיין אפשר לראות את שושלת הנתונים שלה דרך ה-API והמסוף למשך עד 30 יום.

  • התכונה "역사(lineage) נתונים" לא מתעדת באופן אוטומטי מידע על היסטוריה ישירה של שגרות ב-BigQuery. אם משתמשים בשגרה בשאילתה, נתוני שושלת הנתונים מתעדים את השושלת בין הטבלאות שהשגרה קוראת כהסתמכויות של טבלאות שהשאילתה כותבת.

כשבוחרים צומת בתרשים השושלת, חלונית הצד של פרטי הצומת ריקה במקרים הבאים:

  • המשאב נמצא בארגון אחר.
  • המשתמש לא חבר בארגון שמארח את המשאב.

מגבלות על שושלת היוחסין ברמת העמודה

לשושלת יוחסין ברמת העמודה יש את המגבלות הנוספות הבאות:

  • אירועים מותאמים אישית של OpenLineage שנשלחים באמצעות Data Lineage API לא תומכים ב-lineage ברמת העמודה.

  • שושלת יוחסין ברמת העמודה לא נאספת בשביל משימות טעינה או שגרות ב-BigQuery. הם כוללים סקריפטים עם כמה הצהרות וטבלאות מצטברות של Dataform, שעוברים קומפילציה להליכים מאוחסנים זמניים.

  • שושלת היוחסין ברמת העמודה לא נאספת בשאילתות שטבלאות המקור שלהן נמצאות כולן במערכי נתונים זמניים.

  • אין איסוף של שושלת ברמת העמודה במעלה הזרם עבור טבלאות חיצוניות.

  • אם עבודה יוצרת יותר מ-1,500 קישורים ברמת העמודה, לא נאסף שושלת ברמת העמודה. במקרים כאלה, נאסף רק שושלת יוחסין ברמת הטבלה.

  • כשמשנים את השם של טבלאות באמצעות פעולות ALTER TABLE RENAME (בדרך כלל נעשה שימוש בפעולות האלה בדפוסי ETL של החלפת טבלאות), שושלת הנתונים ברמת העמודה לא מועברת ולא נשמרת.

  • התמיכה בשושלת נתונים ברמת העמודה מוגבלת לעמודות ברמה העליונה בטבלאות ב-BigQuery. אין תמיכה בשדות מוטמעים בתוך סוגים מורכבים (כמו STRUCT או JSON).

  • פונקציית החיפוש עם פרמטר השדה פועלת רק על קישורים שמגדירים באופן מפורש קשרים בין עמודות. היא לא מחזירה תוצאות או עוברת על קישורים שמוגדרים רק ברמת הטבלה. אין תמיכה בחיפוש בין קישורים ברמת הטבלה לבין קישורים ברמת העמודה (לדוגמה, חיפוש של כל העמודות שקשורות לקישור ברמת הטבלה, או להיפך). ה-API מחזיר רק קישורים שבהם גם המקור וגם היעד מציינים שדה.

  • התמיכה בטבלאות עם חלוקה למחיצות מוגבלת, כי עמודות של חלוקה למחיצות כמו _PARTITIONDATE ו-_PARTITIONTIME לא מזוהות בתרשים של שרשרת המקור.

  • מגבלות של המסוף:

    • המעבר בתרשים של שרשרת המקור מוגבל לעומק של 20 רמות ול-10,000 קישורים בכל כיוון.

תמחור

ב-Knowledge Catalog נעשה שימוש במק"ט של עיבוד פרימיום (שנמדד ביחידות של עיבוד נתונים, או DCU) כדי לחייב על שושלת הנתונים. לפרטים על התעריפים, אפשר לעיין בתמחור של Knowledge Catalog או להשתמש ב Google Cloud מחשבון התמחור.

גורמי עלות והשפעה על החיוב

כשמתכננים את ההטמעה של מעקב אחר מקורות נתונים, חשוב לזכור את גורמי העלות הבאים:

  • הפעלה לכל פרויקט. ‫Data Lineage API פועל על בסיס כל פרויקט. לפני שמפעילים את התכונה בתהליכי עבודה של פרויקטים עם הרבה נתונים, כדאי לבדוק את ההשפעה על החיוב.
  • אחסון מטא-נתונים וחיפוש. מטא-נתונים של שושלת (תהליכים, הפעלות, אירועים וקישורים) שמאוחסנים במהלך חלון השמירה של 30 ימים מחויבים במסגרת מק"ט האחסון של מטא-נתונים. הצגת שרשרת מקורות הנתונים במסוף Google Cloud לא גוררת חיובים על שאילתות או סריקות ב-BigQuery.
  • BigQuery Omni. העיבוד של שרשרת היוחסין מבוזר לאזורים ספציפיים, והעלויות תלויות באזורים שבהם מתבצע העיבוד.
  • מערכי נתונים מרובי אזורים ב-BigQuery. אם אתם משתמשים במערכי נתונים במספר אזורים (לדוגמה, US במספר אזורים), BigQuery מנתב באופן דינמי שאילתות באזורים פיזיים של מרכזי נתונים. שושלת הנתונים פועלת לצד הרצת השאילתה במיקום הפיזי שבו המשימה בוצעה (לדוגמה, us-east1). כתוצאה מכך, בחשבונית החיוב ב-Cloud מופיעים פריטי מק"ט של DCU לשושלת נתונים אזורית.
  • סוגים מותאמים אישית של מקורות תנועה. אם קוראים ל-Data Lineage API Origin sourceType עם ערך שונה מ-CUSTOM, זה גורם לעלויות נוספות.

מעקב אחרי העלויות ובקרה עליהן

  • מגבלות על מדדים ב-Cloud Monitoring. צריכת יחידות DCU של מעקב אחר מקורות נתונים מתבצעת בחישוב ללא שרתים, ולא מפיקה מדדים של סדרות זמן בזמן אמת ב-Cloud Monitoring תחת dataplex.googleapis.com/*.
  • סינון חיובים ושיוך שלהם בחשבון לחיוב ב-Cloud כדי להפריד ולשייך את החיובים על שושלת נתונים מחיובים אחרים במק"ט של עיבוד פרימיום ב-Knowledge Catalog, בדוח החיוב ב-Cloud או בייצוא של החיוב ב-Cloud ל-BigQuery, משתמשים בתווית goog-dataplex-workload-type עם הערך LINEAGE. דוגמאות מפורטות לשאילתות מופיעות במאמר מעקב אחרי עלויות של יחידות DCU ב-Knowledge Catalog ושיוך שלהן באמצעות ייצוא של נתוני החיוב ב-Cloud.
  • השבתה בפרויקטים של פיתוח. כדי למנוע עלויות עיבוד מיותרות, מפעילים את Data Lineage API רק בפרויקטים שבהם נדרש מעקב אחר שרשרת המקור.
  • להפסיק את החיובים. השימוש ב-Data Lineage API כרוך בחיובים נפרדים מחיובים על שימוש ב-Dataplex API. השבתה של Dataplex API לא משביתה את Data Lineage API ולא מפסיקה את החיובים שלו. כדי להפסיק את החיובים על שושלת נתונים, צריך להשבית את שושלת הנתונים באמצעות השבתת Data Lineage API.

המאמרים הבאים