סקירה כללית של ממשק המשתמש של כלי בניית המשרות

כלי בניית המשימות הוא ממשק משתמש ויזואלי לבנייה ולהרצה של צינורות Dataflow במסוף Google Cloud , בלי לכתוב קוד.

בתמונה הבאה מוצג פרט מממשק המשתמש של כלי יצירת המשרות. בתמונה הזו, המשתמש יוצר צינור להעברת נתונים מקריאה מ-Pub/Sub אל BigQuery:

צילום מסך של ממשק המשתמש של כלי ליצירת משימות

סקירה כללית

הכלי ליצירת משימות תומך בקריאה ובכתיבה של סוגי הנתונים הבאים:

  • הודעות Pub/Sub
  • נתונים בטבלה ב-BigQuery
  • קובצי CSV, קובצי JSON וקובצי טקסט ב-Cloud Storage
  • נתוני טבלה של PostgreSQL,‏ MySQL,‏ Oracle ו-SQL Server
  • נתונים מטבלה של Apache Iceberg
  • נתונים של טבלת Delta Lake

הוא תומך בטרנספורמציות של צינורות, כולל filter (סינון), map (מיפוי), SQL, ‏ group-by (קיבוץ לפי), join (צירוף) ו-explode (פירוק מערך).

בעזרת הכלי ליצירת משרות תוכלו:

  • סטרימינג מ-Pub/Sub ל-BigQuery עם טרנספורמציות וצבירה בחלון
  • כתיבת נתונים מ-Cloud Storage ל-BigQuery
  • שימוש בטיפול בשגיאות כדי לסנן נתונים שגויים (תור הודעות שלא ניתן למסור)
  • שינוי או צבירה של נתונים באמצעות SQL עם טרנספורמציית SQL
  • הוספה, שינוי או הסרה של שדות מנתונים באמצעות טרנספורמציות של מיפוי
  • תזמון של משימות חוזרות באצווה

הכלי ליצירת משימות יכול גם לשמור צינורות עיבוד נתונים כקובצי Apache Beam YAML ולטעון הגדרות של צינורות עיבוד נתונים מקובצי Beam YAML. באמצעות התכונה הזו, אתם יכולים לעצב את צינור העיבוד בבונה המשימות ואז לשמור את קובץ ה-YAML ב-Cloud Storage או במאגר של בקרת מקור לשימוש חוזר. אפשר להשתמש בהגדרות של משימות ב-YAML גם כדי להפעיל משימות באמצעות ה-CLI של gcloud.

כדאי להשתמש בכלי ליצירת משרות בתרחישים הבאים:

  • אתם רוצים לבנות צינור עיבוד נתונים במהירות בלי לכתוב קוד.
  • רוצים לשמור צינור בקובץ YAML כדי להשתמש בו שוב.
  • אפשר להגדיר את צינור הנתונים באמצעות המקורות, היעדים והטרנספורמציות הנתמכים.
  • אין תבנית ש-Google מספקת שמתאימה לתרחיש השימוש שלכם.

הפעלת משימה לדוגמה

הדוגמה של ספירת מילים היא צינור עיבוד באצווה שקורא טקסט מ-Cloud Storage, מבצע טוקניזציה של שורות הטקסט למילים בודדות ומבצע ספירת תדירות של כל אחת מהמילים.

אם קטגוריית Cloud Storage נמצאת מחוץ למתחם השירות, צריך ליצור כלל תעבורת נתונים יוצאת (egress) שמאפשר גישה לקטגוריה.

כדי להפעיל את צינור הנתונים של ספירת המילים:

  1. נכנסים לדף Jobs במסוף Google Cloud .

    מעבר לדף Jobs

  2. לוחצים על Create job from template.

  3. בחלונית הצדדית, לוחצים על Job builder (כלי ליצירת משרות).

  4. לוחצים על טעינת תוכניות.

  5. לוחצים על ספירת מילים. בונה המשימות מאוכלס בייצוג גרפי של צינור הנתונים.

    לכל שלב בצינור העיבוד, כלי בניית המשימות מציג כרטיס עם פרמטרי ההגדרה של השלב הזה. לדוגמה, בשלב הראשון קוראים קובצי טקסט מ-Cloud Storage. המיקום של נתוני המקור מאוכלס מראש בתיבה מיקום הטקסט.

צילום מסך של כלי בניית המשרות

  1. מחפשים את הכרטיס עם הכותרת New sink (כיור חדש). יכול להיות שתצטרכו לגלול.

  2. בתיבה Text location (מיקום הטקסט), מזינים את קידומת הנתיב של מיקום Cloud Storage לקובצי הטקסט של הפלט.

  3. לוחצים על הפעלת העבודה. כלי ליצירת משימות יוצר משימת Dataflow ואז עובר אל תרשים המשימה. כשהעבודה מתחילה, גרף העבודה מציג ייצוג גרפי של הצינור. הייצוג הגרפי הזה דומה לזה שמוצג בכלי ליצירת משרות. במהלך ההרצה של כל שלב בצינור, הסטטוס מתעדכן בתרשים המשימה.

בחלונית פרטי המשרה מוצג הסטטוס הכולל של המשרה. אם העבודה מסתיימת בהצלחה, השדה סטטוס העבודה מתעדכן לערך Succeeded.

המאמרים הבאים