מידע על אמצעי בקרה להטמעה של היסטוריית הנתונים

כדי לנהל את העלויות ואת מדיניות השליטה, אפשר להפעיל או להשבית את ההטמעה של שרשרת מקורות הנתונים בשירותים ספציפיים. Google Cloud לדוגמה, אפשר להשבית את איסוף נתוני השושלת בפרויקטים של פיתוח או בעומסי עבודה גדולים שלא דורשים מעקב אחר השושלת.

שילובים נתמכים של שירותים

בטבלה הבאה מפורטים השילובים שתומכים בשליטה בהטמעה של היסטוריית הנתונים:

שם השילוב תמיכה בשליטה בהעברה ערך ברירת המחדל פרטי השילוב
‫Managed Service for Apache Spark: אשכולות Apache Spark כן מופעל שימוש ב-Spark data lineage
‫Managed Service for Apache Spark: אשכולות של Apache Hive כן מופעל הפעלת מעקב אחר מקורות נתונים ב-Hive
‫Managed Service for Apache Spark: פריסה ללא שרת כן מופעל שימוש ב-data lineage עם Managed Service for Apache Spark
BigQuery כן מופעל מעקב אחר שרשרת מקורות נתונים של טבלה ב-BigQuery
Managed Service for Apache Airflow כן מופעל מעקב אחר מקורות נתונים באמצעות Knowledge Catalog
Looker (Google Cloud core)‎ כן (תצוגה מקדימה) מופעל Looker Core data lineage
Cloud Data Fusion לא מופעל הצגת שרשרת המקורות בקטלוג הידע
Dataflow לא הושבת בצד Dataflow שימוש בשושלת נתונים ב-Dataflow
Vertex AI Pipelines לא מופעל מעקב אחרי שושלת הנתונים של ארטיפקטים של פייפליין

איך פועל אמצעי הבקרה על הטמעת שושלת הנתונים

אתם יכולים לשלוט בהטמעת הנתונים ברמת הארגון, התיקייה והפרויקט, ולשלב את ההגדרות האלה עם הגדרות ספציפיות לשירות כדי להשיג שליטה מדויקת בהטמעה של שושלת הנתונים.

ב-Knowledge Catalog מתבצעת הערכה של היררכיית המשאבים, החל מפרויקט, אחר כך תיקיות ואז הארגון, כדי לקבוע את ההגדרה האפקטיבית. ההגדרה הראשונה שמוגדרת באופן מפורש בכל רמה במסלול הזה כלפי מעלה היא זו שתהיה בתוקף.

  • אם מגדירים הגדרה ברמת הפרויקט, Knowledge Catalog משתמש בזה.
  • אם לא מוגדרת הגדרה ברמת הפרויקט, Knowledge Catalog משתמש בהגדרה מהתיקייה הקרובה ביותר ברמת ההורה עם הגדרה מפורשת.
  • אם לא מוגדרת תצורה ברמת הפרויקט או התיקייה, Knowledge Catalog משתמש בתצורה ברמת הארגון.
  • אם לא מוגדרת הגדרה באף אחת מהרמות האלה, Knowledge Catalog משתמש בברירת המחדל של המערכת לשילוב.

כדי לנהל את השליטה בהטמעה בכמות גדולה, צריך להפעיל את Data Lineage API לכל הפרויקטים בתיקייה או בארגון באמצעות כללי הפעלה היררכית של שירותים. אחרי שמפעילים את Data Lineage API, אפשר לשלוט באופן גרנולרי על הטמעת שושלת הנתונים בכל שילוב שירותים בארגון, בפרויקטים או בתיקיות.

איך פועלת ההגדרה של העברת נתונים בשילובים של שירות יחיד

התרחיש הבא ממחיש איך קטלוג הידע פותר את בעיית ההגדרה של הטמעת שושלת עבור שירות יחיד בהיררכיית המשאבים.

נניח שיש ארגון test-org עם ההגדרות הבאות של שושלת נתונים של Managed Service for Apache Spark:

  • ארגון test-org: מופעל
    • תיקייה folder-a: מושבת
      • פרויקט project-a: לא הוגדרה הגדרה
    • תיקייה folder-b: מופעל
      • פרויקט project-b: מושבת

בתרחיש הזה, ההגדרות הבאות חלות:

  • ב-project-a, הטמעת נתוני השושלת מושבתת. Knowledge Catalog מתחיל להעריך מ-project-a, לא מוצא הגדרה, עובר ל-folder-a ומחיל את ההגדרה Disabled מ-folder-a.
  • ב-project-b, הטמעת נתוני השושלת מושבתת. החל מ-project-b, Knowledge Catalog מתחיל להעריך ומחיל את ההגדרה מושבת, וכך מבטל את ההגדרות ב-folder-b וב-test-org.

איך פועלת ההגדרה של הכנסת נתונים בשילובים של כמה שירותים

בתרחיש הבא מוצג איך Knowledge Catalog פותר באופן עצמאי הגדרות של כמה שירותים בהיררכיית המשאבים.

נניח שיש ארגון test-org עם הגדרות שושלת שונות בכמה שילובים של שירותים:

  • ארגון test-org
    • ‫Managed Service for Apache Spark: מופעל
    • תיקייה folder-a
      • ‫BigQuery: מופעל
      • פרויקט project-a
        • ‫BigQuery: מושבת
        • ‫Managed Service for Apache Airflow: מופעל
      • פרויקט project-b: לא הוגדרה הגדרה

בתרחיש הזה, Knowledge Catalog מעריך כל שילוב של שירות באופן עצמאי בהיררכיית המשאבים:

  • ב-project-a:
    • הטמעת שושלת הנתונים של Managed Service for Apache Spark מופעלת. Knowledge Catalog מתחיל להעריך מ-project-a, לא מוצא הגדרה ל-Managed Service for Apache Spark, עובר ל-folder-a (לא מוגדרת הגדרה) ומחיל את ההגדרה Enabled מ-test-org.
    • הטמעת שושלת הנתונים ב-BigQuery מושבתת. ב-Knowledge Catalog מוחלת ההגדרה המפורשת ברמת הפרויקט, שמחליפה את ההגדרה מופעל שנקבעה ב-folder-a.
    • הטמעת שושלת הנתונים ב-Managed Service for Apache Airflow מופעלת. ‫Knowledge Catalog מחיל את ההגדרה המפורשת ברמת הפרויקט.
  • ב-project-b:
    • הטמעת שושלת הנתונים של Managed Service for Apache Spark מופעלת (היא מועברת בירושה מ-test-org).
    • הטמעת שושלת הנתונים ב-BigQuery מופעלת (היא מועברת בירושה מ-folder-a).
    • הטמעת שושלת הנתונים ב-Managed Service for Apache Airflow מתבצעת באמצעות ברירת המחדל של המערכת (מופעלת כברירת מחדל אם Data Lineage API פעיל), כי לא מוגדרת הגדרה מפורשת באף רמה בהיררכיה.

המאמרים הבאים