ניהול צינורות עיבוד נתונים

במאמר הזה מוסבר איך לנהל צינורות נתונים של BigQuery, כולל איך לתזמן ולמחוק צינורות נתונים.

במסמך הזה מוסבר גם איך לצפות במטא-נתונים של פייפליינים בKnowledge Catalog ואיך לנהל אותם.

צינורות העיבוד מבוססים על Dataform.

לפני שמתחילים

  1. יצירת צינור עיבוד נתונים ב-BigQuery.
  2. כדי לנהל מטא-נתונים של צינורות ב-Knowledge Catalog, צריך לוודא ש-Dataplex API מופעל בפרויקט Google Cloud .

התפקידים הנדרשים

כדי לקבל את ההרשאות שדרושות לניהול צינורות, צריך לבקש מהאדמין להקצות לכם את תפקידי ה-IAM הבאים:

  • כדי להציג ולהריץ צינורות:
  • כדי להפעיל צינורות עם פרטי כניסה של משתמש לחשבון Google: BigQuery Data Editor (roles/bigquery.dataEditor) בפרויקט או במערכי נתונים ספציפיים של BigQuery
  • כדי למחוק צינורות: אדמין Dataform (roles/dataform.Admin) בצינור
  • כדי להציג ולנהל מטא-נתונים ב-Knowledge Catalog: Dataplex Catalog Editor (roles/dataplex.catalogEditor) בפרויקט או בקבוצת הרשומות @bigquery

להסבר על מתן תפקידים, ראו איך מנהלים את הגישה ברמת הפרויקט, התיקייה והארגון.

יכול להיות שאפשר לקבל את ההרשאות הנדרשות גם באמצעות תפקידים בהתאמה אישית או תפקידים מוגדרים מראש.

מידע נוסף על IAM ב-Dataform זמין במאמר בקרת גישה באמצעות IAM.

אם משתמשים בחשבון שירות בהתאמה אישית כדי להריץ צינורות, צריך להקצות לחשבון השירות הזה את התפקידים הבאים:

  • BigQuery Job User (שימוש במשימות BigQuery) (roles/bigquery.jobUser) בפרויקט
  • BigQuery Data Editor (roles/bigquery.dataEditor) בפרויקט או במערכי נתונים ספציפיים של BigQuery
  • Dataplex Catalog Editor (roles/dataplex.catalogEditor) בפרויקט או בקבוצת הרשומות @bigquery

הצגת כל צינורות המכירה

כדי לראות רשימה של כל צינורות העיבוד בפרויקט:

  1. במסוף Google Cloud , עוברים לדף BigQuery.

    כניסה ל-BigQuery

  2. בחלונית הימנית, לוחצים על כלי הניתוחים:

    כפתור מודגש לחלונית הסייר.

    אם החלונית הימנית לא מוצגת, לוחצים על הרחבת החלונית הימנית כדי לפתוח אותה.

  3. בחלונית Explorer מרחיבים את הפרויקט ולוחצים על Pipelines.

הצגת הפעלות ידניות קודמות

כדי לראות הפעלות ידניות קודמות של צינור נתונים שנבחר:

  1. במסוף Google Cloud , עוברים לדף BigQuery.

    כניסה ל-BigQuery

  2. בחלונית הימנית, לוחצים על כלי הניתוחים:

    כפתור מודגש לחלונית הסייר.

  3. בחלונית Explorer, מרחיבים את הפרויקט, לוחצים על Pipelines ובוחרים צינור.

  4. לוחצים על Executions (הרצות).

  5. אופציונלי: כדי לרענן את רשימת ההרצות הקודמות, לוחצים על רענון.

הגדרת התראות על הפעלות של צינורות עיבוד נתונים שנכשלו

לכל צינור יש מזהה מאגר תואם ב-Dataform. כל הרצה של צינור נתונים ב-BigQuery מתועדת ב-Cloud Logging באמצעות מזהה המאגר המתאים של Dataform. אתם יכולים להשתמש ב-Cloud Monitoring כדי לעקוב אחרי מגמות ביומנים של Cloud Logging לגבי הרצות של צינורות עיבוד נתונים ב-BigQuery, וכדי לקבל התראות כשמתרחשים תנאים שאתם מגדירים.

כדי לקבל התראות כשריצה של צינור BigQuery נכשלת, אפשר ליצור מדיניות התראות מבוססת-יומן עבור מזהה מאגר Dataform המתאים. הוראות מפורטות זמינות במאמר בנושא הגדרת התראות על הפעלות של תהליכי עבודה שנכשלו.

כדי למצוא את מזהה מאגר Dataform של הצינור:

  1. במסוף Google Cloud , עוברים לדף BigQuery.

    כניסה ל-BigQuery

  2. בחלונית הימנית, לוחצים על כלי הניתוחים:

    כפתור מודגש לחלונית הסייר.

  3. בחלונית Explorer, מרחיבים את הפרויקט, לוחצים על Pipelines ובוחרים צינור.

  4. לוחצים על הגדרות.

    מזהה מאגר Dataform של צינור העברת הנתונים מוצג בחלק התחתון של הכרטיסייה הגדרות.

מחיקת צינור עיבוד נתונים

כדי למחוק סופית צינור, פועלים לפי השלבים הבאים:

  1. במסוף Google Cloud , עוברים לדף BigQuery.

    כניסה ל-BigQuery

  2. בחלונית הימנית, לוחצים על כלי הניתוחים:

    כפתור מודגש לחלונית הסייר.

  3. בחלונית Explorer מרחיבים את הפרויקט ולוחצים על Pipelines.

  4. מאתרים את צינור הנתונים שרוצים למחוק.

  5. לצד הצינור, לוחצים על הצגת פעולות ואז על מחיקה.

  6. לוחצים על Delete.

ניהול מטא-נתונים ב-Knowledge Catalog

ב-Knowledge Catalog אפשר לאחסן ולנהל מטא-נתונים של צינורות. צינורות זמינים כברירת מחדל ב-Knowledge Catalog, ללא צורך בהגדרה נוספת.

אתם יכולים להשתמש ב-Knowledge Catalog כדי לנהל פייפליינים בכל המיקומים של הפייפליינים. השימוש בצינורות ב-Knowledge Catalog כפוף למכסות ולמגבלות של Knowledge Catalog ולתמחור של Knowledge Catalog.

‫Knowledge Catalog מאחזר אוטומטית את המטא-נתונים הבאים מצינורות:

  • שם נכס הנתונים
  • נכס הורה של נתוני נכס
  • מיקום נכס הנתונים
  • סוג נכס הנתונים
  • פרויקט Google Cloud מתאים

צינורות (pipelines) מתועדים ב-Knowledge Catalog כרשומות עם ערכי הרשומה הבאים:

קבוצת רשומות של מערכת
קבוצת רשומות המערכת של צינורות היא @dataform. כדי לראות את הפרטים של רשומות פייפליין ב-Knowledge Catalog, צריך לראות את dataform קבוצת רשומות המערכת. הוראות להצגת רשימה של כל הרשומות בקבוצת רשומות מופיעות במאמר הצגת פרטים של קבוצת רשומות במאמרי העזרה בנושא Knowledge Catalog.
סוג הרשומה במערכת
סוג רשומת המערכת לצינורות הוא dataform-code-asset. כדי לראות את הפרטים של צינורות, צריך להציג את dataform-code-asset סוג הרשומה של המערכת, לסנן את התוצאות באמצעות מסנן מבוסס-היבטים ולהגדיר את השדה type בתוך ההיבט dataform-code-asset לערך WORKFLOW. לאחר מכן, בוחרים רשומה של צינור המכירות שנבחר. הוראות להצגת פרטים של סוג רשומה נבחר מופיעות במאמר הצגת פרטים של סוג רשומה במסמכי Knowledge Catalog. הוראות להצגת פרטים של רשומה נבחרת מופיעות במאמר הצגת פרטים של רשומה במסמכי Knowledge Catalog.
סוג ההיבט של המערכת
סוג ההיבט של המערכת לצינורות הוא dataform-code-asset. כדי לספק הקשר נוסף לצינורות ב-Knowledge Catalog באמצעות הוספת הערות לרשומות של צינורות נתונים עם היבטים, אפשר להציג את סוג ההיבט dataform-code-asset, לסנן את התוצאות באמצעות מסנן מבוסס-היבטים ולהגדיר את השדה type בתוך ההיבט dataform-code-asset לערך WORKFLOW. הוראות להוספת הערות עם היבטים לרשומות מפורטות במאמר ניהול היבטים והעשרת מטא-נתונים במסמכי התיעוד של Knowledge Catalog.
סוג
הסוג של לוחות ציור של נתונים הוא WORKFLOW. הסוג הזה מאפשר לסנן צינורות בdataform-code-asset system entry type וב-dataform-code-asset aspect type באמצעות השאילתה בaspect-based filter.aspect:dataplex-types.global.dataform-code-asset.type=WORKFLOW

הוראות לחיפוש נכסים ב-Knowledge Catalog מופיעות במאמר חיפוש נכסי נתונים ב-Knowledge Catalog בתיעוד של Knowledge Catalog.

העשרה של מטא-נתונים ושילוב של כרטיס ניקוד לאיכות הנתונים

‫Dataform יכול לפרסם את המטא-נתונים הבאים ב-Knowledge Catalog:

  • סוג ההיבט בדף 'סקירה כללית'
  • סוג היבט גנרי
  • סוג ההיבט של כרטיס הניקוד של איכות הנתונים

הצהרות של Dataform משולבות באופן אוטומטי עם כרטיס הניקוד של איכות הנתונים ב-Knowledge Catalog. במהלך ההפעלה של פייפליין, התוצאות של כל טענות נכוֹנוּת (assertions) של Dataform מתפרסמות באופן אוטומטי ב-Knowledge Catalog. התוצאות האלה מאכלסות את כרטיס הניקוד של איכות הנתונים ב-Knowledge Catalog עם סטטוס של הצלחה או כישלון.

כדי לבדוק את הסטטוס של עדכון מטא-נתונים, פועלים לפי ההוראות במאמר בנושא הצגת הפעלות ידניות קודמות.

אחרי שהמטא-נתונים מסונכרנים, אפשר לחפש את הרשומה ב-Knowledge Catalog ולצפות בה. מידע נוסף זמין במאמר חיפוש משאבים.

המאמרים הבאים