מבוא ל-Cloud Data Fusion: Studio

בדף הזה מוצג Cloud Data Fusion: Studio, ממשק ויזואלי של 'גרור ושחרר' ליצירת צינורות נתונים מספרייה של תוספים מוכנים מראש, וממשק שבו אפשר להגדיר, להפעיל ולנהל את הצינורות. בדרך כלל, התהליך של בניית צינור עיבוד נתונים ב-Studio הוא כזה:

  1. מתחברים למקור נתונים מקומי או בענן.
  2. הכנה ושינוי של הנתונים.
  3. מתחברים ליעד.
  4. בודקים את הפייפליין.
  5. מפעילים את צינור עיבוד הנתונים.
  6. לתזמן ולהפעיל את צינורות עיבוד הנתונים.

אחרי שתעצבו ותפעילו את צינור עיבוד הנתונים, תוכלו לנהל את צינורות עיבוד הנתונים בדף Pipeline Studio ב-Cloud Data Fusion:

  • אפשר להשתמש מחדש בצינורות עיבוד נתונים על ידי הגדרת פרמטרים שלהם עם העדפות וארגומנטים של זמן ריצה.
  • ניהול של הפעלת צינור עיבוד נתונים על ידי התאמה אישית של פרופילי מחשוב, ניהול משאבים ושיפור הביצועים של צינור עיבוד הנתונים.
  • עריכת פייפליינים כדי לנהל את מחזור החיים שלהם.
  • ניהול בקרת המקור של צינור עיבוד הנתונים באמצעות שילוב עם Git.

מסלול המשתמש ב-Cloud Data Fusion Studio

לפני שמתחילים

Cloud Data Fusion: סקירה כללית של Studio

ה-Studio כולל את הרכיבים הבאים.

ניהול

ב-Cloud Data Fusion אפשר להשתמש בכמה מרחבי שמות בכל מכונה. ב-Studio, אדמינים יכולים לנהל את כל מרחבי השמות באופן מרכזי, או כל מרחב שמות בנפרד.

ב-Studio יש את אמצעי הבקרה הבאים לאדמינים:

ניהול מערכות
מודול System Admin ב-Studio מאפשר ליצור מרחבי שמות חדשים ולהגדיר את ההגדרות של פרופיל המחשוב המרכזי ברמת המערכת, שחלות על כל מרחב שמות באותו מופע. מידע נוסף זמין במאמר בנושא ניהול האדמיניסטרציה של Studio.
ניהול מרחבי שמות
במודול Namespace Admin ב-Studio אפשר לנהל את ההגדרות של מרחב השמות הספציפי. לכל מרחב שמות אפשר להגדיר פרופילים של מחשוב, העדפות של זמן ריצה, דרייברים, חשבונות שירות והגדרות של git. מידע נוסף זמין במאמר בנושא ניהול האדמיניסטרציה של Studio.

Pipeline Design Studio

אתם מעצבים ומריצים צינורות עיבוד נתונים ב-Pipeline Design Studio בממשק האינטרנט של Cloud Data Fusion. עיצוב והפעלה של צינורות נתונים כוללים את השלבים הבאים:

  • התחברות למקור: Cloud Data Fusion מאפשרת להתחבר למקורות נתונים מקומיים ולמקורות נתונים בענן. ממשק Studio כולל פלאגינים של מערכת ברירת המחדל, שמותקנים מראש ב-Studio. אפשר להוריד תוספים נוספים ממאגר תוספים שנקרא Hub. מידע נוסף מופיע בסקירה הכללית על תוספים.
  • הכנת נתונים: Cloud Data Fusion מאפשר לכם להכין את הנתונים באמצעות תוסף רב-עוצמה להכנת נתונים: Wrangler. ‫Wrangler עוזר לכם להציג, לחקור ולשנות דגימה קטנה של הנתונים במקום אחד לפני שמריצים את הלוגיקה על מערך הנתונים כולו ב-Studio. כך תוכלו להחיל טרנספורמציות במהירות כדי להבין איך הן משפיעות על מערך הנתונים כולו. אפשר ליצור כמה טרנספורמציות ולהוסיף אותן למתכון. מידע נוסף מופיע בסקירה הכללית על Wrangler.
  • טרנספורמציה: תוספי טרנספורמציה משנים את הנתונים אחרי שהם נטענים ממקור. לדוגמה, אפשר לשכפל רשומה, לשנות את פורמט הקובץ ל-JSON או להשתמש בתוסף Javascript כדי ליצור טרנספורמציה בהתאמה אישית. מידע נוסף זמין במאמר סקירה כללית על תוספים.
  • מתחברים ליעד: אחרי שמכינים את הנתונים ומחילים עליהם טרנספורמציות, אפשר להתחבר ליעד שאליו מתכננים לטעון את הנתונים. ‫Cloud Data Fusion תומך בחיבורים לכמה יעדים. מידע נוסף זמין במאמר סקירה כללית על פלאגינים.
  • תצוגה מקדימה: אחרי שתתכננו את צינור עיבוד הנתונים, כדי לנפות באגים לפני הפריסה וההפעלה של צינור עיבוד הנתונים, תפעילו תצוגה מקדימה של עבודת הצינור. אם נתקלתם בשגיאות, תוכלו לתקן אותן במצב טיוטה. ‫Studio משתמש ב-100 השורות הראשונות של מערך הנתונים של המקור כדי ליצור את התצוגה המקדימה. ב-Studio מוצגים הסטטוס והמשך של עבודת התצוגה המקדימה. אפשר להפסיק את העבודה בכל שלב. אפשר גם לעקוב אחרי אירועי היומן בזמן שהתצוגה המקדימה פועלת. מידע נוסף זמין במאמר תצוגה מקדימה של נתונים.
  • ניהול הגדרות של צינורות: אחרי שצופים בתצוגה מקדימה של הנתונים, אפשר לפרוס את הצינור ולנהל את ההגדרות הבאות של הצינור:

    • הגדרות מחשוב: אתם יכולים לשנות את פרופיל המחשוב שמריץ את צינור הנתונים. לדוגמה, אם אתם רוצים להריץ את צינור הנתונים מול אשכול מותאם אישית של Managed Service for Apache Spark ולא מול אשכול ברירת המחדל של Managed Service for Apache Spark.
    • הגדרת צינורות: לכל צינור אפשר להפעיל או להשבית מכשור, כמו מדדי תזמון. כברירת מחדל, המדידה מופעלת.
    • הגדרת המנוע: Spark הוא מנוע הביצוע שמוגדר כברירת מחדל. אפשר להעביר פרמטרים מותאמים אישית ל-Spark.
    • משאבים: אתם יכולים לציין את הזיכרון ואת מספר המעבדים (CPU) עבור מנהל ההתקן והמבצע של Spark. הדרייבר מתזמר את עבודת Spark. ה-executor מטפל בעיבוד הנתונים ב-Spark.
    • התראה על צינור עיבוד נתונים: אפשר להגדיר את צינור עיבוד הנתונים כך שישלח התראות ויתחיל משימות של עיבוד אחרי שהרצת צינור עיבוד הנתונים מסתיימת. יוצרים התראות של צינורות עיבוד נתונים כשמעצבים את צינור עיבוד הנתונים. אחרי שפורסים את צינור הנתונים, אפשר לראות את ההתראות. כדי לשנות את הגדרות ההתראות, אפשר לערוך את צינור הנתונים.
    • העברת טרנספורמציות (Transformation pushdown): אפשר להפעיל את האפשרות הזו אם רוצים שצינור יבצע טרנספורמציות מסוימות ב-BigQuery.

    מידע נוסף מופיע במאמר בנושא ניהול הגדרות של צינורות.

  • שימוש חוזר בצינורות עיבוד נתונים באמצעות פקודות מאקרו, העדפות וארגומנטים של זמן ריצה: מערכת Cloud Data Fusion מאפשרת לכם לעשות שימוש חוזר בצינורות עיבוד נתונים. צינורות עיבוד נתונים לשימוש חוזר מאפשרים להשתמש בצינור עיבוד נתונים יחיד שיכול להחיל דפוס שילוב נתונים על מגוון תרחישי שימוש ועל מערכי נתונים שונים. צינורות (pipelines) שאפשר להשתמש בהם שוב מאפשרים ניהול טוב יותר. הם מאפשרים להגדיר את רוב ההגדרות של צינור עיבוד הנתונים בזמן הריצה, במקום להגדיר אותן מראש בזמן התכנון. ב-Pipeline Design Studio, אפשר להשתמש בפקודות מאקרו כדי להוסיף משתנים להגדרות של תוספים, וכך לציין את החלפות המשתנים בזמן הריצה. מידע נוסף זמין במאמר בנושא ניהול פקודות מאקרו, העדפות וארגומנטים של זמן ריצה.

  • הפעלה: אחרי שבודקים את ההגדרות של צינור עיבוד הנתונים, אפשר להפעיל אותו. אפשר לראות את השינוי בסטטוס במהלך השלבים של הרצת צינור הנתונים – לדוגמה, הקצאת משאבים, התחלה, הרצה והצלחה.

  • תזמון ותיאום: אפשר להגדיר צינורות נתונים באצווה כך שיפעלו לפי תזמון ותדירות ספציפיים. אחרי שיוצרים ומפעילים צינור, אפשר ליצור תזמון. ב-Pipeline Design Studio, אתם יכולים לתזמן צינורות עיבוד נתונים על ידי יצירת טריגר בצינור עיבוד נתונים של אצווה, כדי שהוא יפעל כשריצה אחת או יותר של צינור עיבוד נתונים מסתיימת. הם נקראים צינורות להעברת נתונים במורד הזרם ובמעלה הזרם. יוצרים טריגר בצינור downstream כדי שהוא יפעל על סמך השלמת צינור אחד או יותר של upstream.

    מומלץ: אפשר גם להשתמש ב-Composer כדי לתזמן צינורות ב-Cloud Data Fusion. מידע נוסף זמין במאמרים בנושא תזמון צינורות נתונים וניהול צינורות נתונים.

  • עריכת צינורות: ב-Cloud Data Fusion אפשר לערוך צינורות שפרסתם. כשעורכים צינור שפרסו, נוצרת גרסה חדשה של הצינור עם אותו שם, והיא מסומנת כגרסה האחרונה. כך אפשר לפתח צינורות באופן איטרטיבי במקום לשכפל אותם, מה שיוצר צינור חדש עם שם שונה. מידע נוסף זמין במאמר בנושא עריכת צינורות.

  • ניהול בקרת מקורות: Cloud Data Fusion מאפשר לכם לנהל טוב יותר את צינורות הנתונים בין פיתוח לייצור באמצעות ניהול בקרת מקורות של צינורות הנתונים באמצעות GitHub.

  • רישום ביומן ומעקב: כדי לעקוב אחרי מדדים ויומנים של צינורות עיבוד נתונים, מומלץ להפעיל את שירות הרישום ביומן של Stackdriver כדי להשתמש ב-Cloud Logging עם צינורות עיבוד הנתונים של Cloud Data Fusion.

המאמרים הבאים