ניהול צינורות עיבוד נתונים
במאמר הזה מוסבר איך לנהל צינורות נתונים של BigQuery, כולל איך להציג, לתזמן, לפרוס ולמחוק צינורות נתונים.
במסמך הזה מוסבר גם איך לצפות במטא-נתונים של פייפליינים בKnowledge Catalog ואיך לנהל אותם.
הצינורות מופעלים על ידי Dataform. אתם יכולים לארגן ולנהל צינורות נתונים שמאוחסנים בקבצים ותיקיות (תיקיות משתמשים ותיקיות צוות) או במאגרי Git של BigQuery Studio (תיקיות Git) (גרסת Preview).
לפני שמתחילים
- יצירת צינור עיבוד נתונים ב-BigQuery.
- כדי לנהל את המטא-נתונים של צינורות העברת נתונים ב-Knowledge Catalog, צריך לוודא ש-Dataplex API מופעל בפרויקט Google Cloud .
התפקידים הנדרשים
כדי לקבל את ההרשאות שדרושות לניהול צינורות, צריך לבקש מהאדמין להקצות לכם את תפקידי ה-IAM הבאים:
-
כדי להציג ולהריץ צינורות:
- Dataform Viewer (
roles/dataform.Viewer) on the project - BigQuery Job User (
roles/bigquery.jobUser) בפרויקט
- Dataform Viewer (
-
כדי להפעיל צינורות עם פרטי כניסה של משתמש לחשבון Google:
BigQuery Data Editor (
roles/bigquery.dataEditor) בפרויקט או במערכי נתונים ספציפיים של BigQuery -
כדי למחוק צינורות:
אדמין Dataform (
roles/dataform.Admin) בצינור -
כדי לנהל את הערוצים בתיקיות משתמשים:
- בעלים של הקוד (
roles/dataform.codeOwner) בתיקייה - Code Editor (
roles/dataform.codeEditor) בתיקייה - צפייה בקוד (
roles/dataform.codeViewer) בתיקייה
- בעלים של הקוד (
-
כדי לנהל צינורות בתיקיות צוות:
- בעלים של תיקיית צוות (
roles/dataform.teamFolderOwner) בתיקיית הצוות - משתמש עם הרשאת עריכה בתיקיית צוות (
roles/dataform.teamFolderContributor) בתיקיית הצוות - צפייה בתיקיית צוות (
roles/dataform.teamFolderViewer) בתיקיית הצוות
- בעלים של תיקיית צוות (
-
כדי לנהל צינורות בפרויקטים של Git:
משתמש OAuth של Developer Connect (
roles/developerconnect.oauthUser) בפרויקט -
כדי להציג ולנהל מטא-נתונים ב-Knowledge Catalog:
Dataplex Catalog Editor (
roles/dataplex.catalogEditor) בפרויקט או בקבוצת הרשומות@bigquery
להסבר על מתן תפקידים, ראו איך מנהלים את הגישה ברמת הפרויקט, התיקייה והארגון.
יכול להיות שאפשר לקבל את ההרשאות הנדרשות גם באמצעות תפקידים בהתאמה אישית או תפקידים מוגדרים מראש.
מידע נוסף על IAM ב-Dataform זמין במאמר בקרת גישה באמצעות IAM. מידע נוסף על תפקידים בתיקיות זמין במאמר יצירה וניהול של תיקיות. במאמר ניהול קוד באמצעות מאגרי Git ב-BigQuery Studio יש מידע נוסף על תפקידים במאגרי Git.
אם משתמשים בחשבון שירות בהתאמה אישית כדי להריץ צינורות, צריך להקצות לחשבון השירות הזה את התפקידים הבאים:
- BigQuery Job User (
roles/bigquery.jobUser) בפרויקט - BigQuery Data Editor
(
roles/bigquery.dataEditor) בפרויקט או במערכי נתונים ספציפיים של BigQuery - Dataplex Catalog Editor (
roles/dataplex.catalogEditor) בפרויקט או בקבוצת הרשומות@bigquery
הצגת צינורות עיבוד נתונים
אפשר לראות ולבדוק צינורות שמאוחסנים בתיקיות או בתיקיות Git בחלונית Files. אפשר לראות צינורות עצמאיים וצינורות שנשמרו בתיקיות בחלונית Explorer. צינורות (Pipelines) שמאוחסנים בתיקיות Git לא מוצגים בחלונית Explorer.
הצגת צינורות הנתונים בחלונית Files
צינורות שמאוחסנים בתיקיות או בתיקיות Git מופיעים ישירות בחלונית Files (קבצים).
כדי לראות צינור שמאוחסן בתיקייה או בתיקיית Git, פועלים לפי השלבים הבאים:
במסוף Google Cloud , עוברים לדף BigQuery.
בחלונית הימנית, לוחצים על קבצים כדי לפתוח את דפדפן הקבצים.
אם לא רואים את החלונית הימנית, לוחצים על הרחבת החלונית הימנית כדי לפתוח אותה.
מרחיבים את התיקייה User, את תיקיית הצוות או את התיקייה של מאגר Git המקושר.
צינורות מוצגים עם סמל צינור במקום סמל תיקייה רגיל.
לוחצים על תיקיית צינור כדי לפתוח את Pipeline Viewer.
Pipeline Viewer מציג את הגרף האציקלי המכוון (DAG) שעבר קומפילציה של משימות צינור עיבוד הנתונים, את סטטוס ההפעלה ואת כרטיסיות ההגדרות.
מרחיבים את ספריית הצינור בדפדפן הקבצים כדי לעיין בספריות מקוננות (כמו
definitions/) ובקבצים של משימות ספציפיות.
הצגת צינורות הנתונים בחלונית Explorer
כדי לראות רשימה של צינורות עצמאיים וצינורות שמאוחסנים בתיקיות:
במסוף Google Cloud , עוברים לדף BigQuery.
בחלונית הימנית, לוחצים על כלי הניתוחים:

אם לא רואים את החלונית הימנית, לוחצים על הרחבת החלונית הימנית כדי לפתוח אותה.
בחלונית Explorer מרחיבים את הפרויקט ולוחצים על Pipelines.
בוחרים צינור כדי לפתוח אותו בכלי לצפייה בצינורות.
איך רואים הפעלות ידניות קודמות
כדי לראות הפעלות ידניות קודמות של צינור נתונים נבחר:
במסוף Google Cloud , עוברים לדף BigQuery.
בחלונית הימנית, לוחצים על כלי הניתוחים:

בחלונית Explorer, מרחיבים את הפרויקט, לוחצים על Pipelines ובוחרים צינור.
לוחצים על Executions (הרצות).
אופציונלי: כדי לרענן את רשימת ההרצות הקודמות, לוחצים על רענון.
הגדרת התראות על הפעלות שנכשלו של צינורות עיבוד נתונים
לכל צינור יש מזהה מאגר תואם ב-Dataform. כל הרצה של צינור נתונים ב-BigQuery מתועדת ב-Cloud Logging באמצעות מזהה המאגר המתאים של Dataform. אתם יכולים להשתמש ב-Cloud Monitoring כדי לעקוב אחרי מגמות ביומנים של Cloud Logging לגבי הרצות של צינורות עיבוד נתונים ב-BigQuery, ולקבל התראה כשמתקיימים תנאים שאתם מגדירים.
כדי לקבל התראות כשריצת צינור ב-BigQuery נכשלת, אפשר ליצור מדיניות התראות מבוססת-יומן עבור מזהה מאגר Dataform המתאים. הוראות מפורטות זמינות במאמר בנושא הגדרת התראות על הפעלות של תהליכי עבודה שנכשלו.
כדי למצוא את מזהה מאגר Dataform של הצינור:
במסוף Google Cloud , עוברים לדף BigQuery.
בחלונית הימנית, לוחצים על כלי הניתוחים:

בחלונית Explorer, מרחיבים את הפרויקט, לוחצים על Pipelines ובוחרים צינור.
לוחצים על הגדרות.
מזהה מאגר Dataform של צינור העברת הנתונים מוצג בחלק התחתון של הכרטיסייה הגדרות.
מחיקת צינור עיבוד נתונים
כדי למחוק צינור באופן סופי:
- במסוף Google Cloud , עוברים לדף BigQuery. כניסה ל-BigQuery
כדי למחוק צינור שמאוחסן בתיקייה או בתיקיית Git, מבצעים את הפעולות הבאות:
בחלונית הימנית, לוחצים על קבצים.
בעץ הקבצים, מוצאים את תיקיית הצינור שרוצים למחוק.
לוחצים על הצגת פעולות לצד תיקיית הצינור, ואז לוחצים על מחיקה.
בתיבת הדו-שיח לאישור, לוחצים על מחיקה.
תיקיית הצינור וכל המשימות והקבצים שכלולים בה נמחקים ממרחב העבודה.
כדי למחוק צינור שמופיע בחלונית Explorer:
בחלונית הימנית, לוחצים על כלי הניתוחים:

בחלונית Explorer מרחיבים את הפרויקט ולוחצים על Pipelines.
מחפשים את צינור הנתונים שרוצים למחוק.
לוחצים על הצגת פעולות לצד הצינור, ואז לוחצים על מחיקה.
לוחצים על Delete.
ניהול מטא-נתונים ב-Knowledge Catalog
ב-Knowledge Catalog אפשר לאחסן ולנהל מטא-נתונים של צינורות. צינורות זמינים כברירת מחדל ב-Knowledge Catalog, ללא צורך בהגדרה נוספת.
אתם יכולים להשתמש ב-Knowledge Catalog כדי לנהל צינורות עיבוד נתונים בכל המיקומים של צינורות עיבוד הנתונים. ניהול צינורות ב-Knowledge Catalog כפוף למכסות ומגבלות של Knowledge Catalog ולתמחור של Knowledge Catalog.
Knowledge Catalog מאחזר באופן אוטומטי את המטא-נתונים הבאים מצינורות:
- שם נכס הנתונים
- נכס האב של נתוני הנכס
- מיקום נכס הנתונים
- סוג נכס הנתונים
- פרויקט Google Cloud מתאים
Knowledge Catalog מתעד צינורות כרשומות עם ערכי הרשומות הבאים:
- קבוצת רשומות במערכת
- קבוצת הכניסה למערכת של צינורות עיבוד הנתונים היא
@dataform. כדי לראות את הפרטים של רשומות בפייפליין ב-Knowledge Catalog, צריך להציג אתdataformקבוצת רשומות המערכת. הוראות לצפייה ברשימה של כל הרשומות בקבוצת רשומות מופיעות במאמר צפייה בפרטים של קבוצת רשומות במסמכי התיעוד של Knowledge Catalog. - סוג רשומת המערכת
- סוג הרשומה במערכת של צינורות הוא
dataform-code-asset. כדי לראות את הפרטים של צינורות, צריך להציג את סוג הרשומה במערכתdataform-code-asset, לסנן את התוצאות באמצעות מסנן מבוסס-היבטים ולהגדיר את השדהtypeבתוך ההיבטdataform-code-assetלערךWORKFLOW. לאחר מכן בוחרים רשומה של הצינור שנבחר. הוראות לצפייה בפרטים של סוג רשומה נבחר מופיעות במאמר צפייה בפרטים של סוג רשומה במסמכי התיעוד של Knowledge Catalog. הוראות להצגת פרטים של רשומה נבחרת מופיעות במאמר הצגת פרטים של רשומה במסמכי Knowledge Catalog. - סוג ההיבט של המערכת
- סוג ההיבט של המערכת של צינורות הוא
dataform-code-asset. כדי לספק הקשר נוסף לצינורות ב-Knowledge Catalog באמצעות הוספת הערות לרשומות של צינורות נתונים עם היבטים, צריך להציג את סוג ההיבטdataform-code-asset, לסנן את התוצאות באמצעות מסנן מבוסס-היבטים ולהגדיר את השדהtypeבתוך ההיבטdataform-code-assetלערךWORKFLOW. הוראות להוספת הערות עם היבטים לרשומות מפורטות במאמר ניהול היבטים והעשרת מטא-נתונים במסמכי התיעוד של Knowledge Catalog. - סוג
- הסוג של לוחות ציור של נתונים הוא
WORKFLOW. הסוג הזה מאפשר לסנן צינורות בdataform-code-assetסוג הרשומה של המערכת ובסוג ההיבטdataform-code-assetבאמצעות השאילתה בaspect:dataplex-types.global.dataform-code-asset.type=WORKFLOWמסנן מבוסס-היבטים.
הוראות לחיפוש נכסים ב-Knowledge Catalog מופיעות במאמר חיפוש נכסי נתונים ב-Knowledge Catalog בתיעוד של Knowledge Catalog.
העשרה של מטא-נתונים ושילוב של כרטיס ניקוד לאיכות הנתונים
Dataform יכול לפרסם את המטא-נתונים הבאים ב-Knowledge Catalog:
- סוג ההיבט בדף 'סקירה כללית'
- סוג היבט גנרי
- סוג ההיבט של כרטיס המידע לאיכות הנתונים
הצהרות של Dataform משולבות באופן אוטומטי עם כרטיס הניקוד של איכות הנתונים ב-Knowledge Catalog. במהלך הביצוע של צינור הנתונים, התוצאות של כל הצהרות (assertions) Dataform מתפרסמות באופן אוטומטי ב-Knowledge Catalog. התוצאות האלה מאכלסות את כרטיס הניקוד של איכות הנתונים ב-Knowledge Catalog עם סטטוס של הצלחה או כישלון.
כדי לבדוק את הסטטוס של עדכון מטא-נתונים, פועלים לפי ההוראות במאמר בנושא הצגת הפעלות ידניות קודמות.
אחרי שהמטא-נתונים מסונכרנים, אפשר לחפש את הרשומה ב-Knowledge Catalog ולצפות בה. מידע נוסף זמין במאמר בנושא חיפוש משאבים.
המאמרים הבאים
- מידע נוסף על צינורות נתונים של BigQuery
- איך יוצרים צינורות
- איך מתזמנים צינורות
- איך מנהלים קוד באמצעות מאגרי Git ב-BigQuery Studio
- איך מארגנים נכסי קוד באמצעות תיקיות
- מידע נוסף על פריסות של Dataform