סקירה כללית על Wrangler

‫Wrangler הוא כלי ויזואלי להכנת נתונים בממשק של Cloud Data Fusion Studio. הוא מאפשר לכם לנקות ולבצע טרנספורמציה של נתונים לפני השימוש בהם בצינורות עיבוד נתונים מסוג Extract, Transform, Load (ETL). ‫Wrangler מחיל טרנספורמציות על מדגם של הנתונים במקום אחד (שנקרא תצוגה מקדימה) לפני הפעלת הלוגיקה על מערך הנתונים כולו. התצוגה המקדימה הזו עוזרת לכם להחיל טרנספורמציות ולהבין איך הן משפיעות על מערך הנתונים כולו.

הוראות של Wrangler

הוראה היא הוראה יחידה שמשמשת ב-Wrangler. הוראות מציינות איך לשנות את הנתונים, למשל להמיר, לסנן או לסובב רשומות ספציפיות.

המושגים הבאים קשורים להוראות:

מתכון
מתכון הוא קבוצה של הנחיות. הוא מורכב מהנחיה אחת או יותר.
שלב טרנספורמציה
שלב טרנספורמציה הוא הטמעה של הוראה לטרנספורמציה של נתונים, שפועלת על רשומה אחת או על קבוצת רשומות. שלב טרנספורמציה יכול ליצור אפס רשומות או יותר מהחלת הוראה. ‫Wrangler מחיל את שלבי השינוי לפי הסדר שמופיע במתכון.

רכיבי Wrangler

בקטעים הבאים מוסבר על הרכיבים של Wrangler ב-Cloud Data Fusion Studio.

סביבת העבודה של Wrangler

סביבת העבודה של Wrangler היא דף בממשק Cloud Data Fusion Studio שבו מנתחים, משלבים, מנקים ומשנים מערכי נתונים. בדף Workspace אפשר:

  • כדי להוסיף שלבי טרנספורמציה למתכון, משתמשים בתפריט הנפתח בכל עמודה.
  • כדי לראות או למחוק שלבים במתכון, בוחרים בכרטיסייה Transformation steps (שלבי השינוי).
  • כדי לגלות עמודות עם שדות ריקים ומידע אחר, בודקים את הסרגל איכות הנתונים.
  • כדי לראות את הסכימה של קבוצת הנתונים, לוחצים על עוד.
  • יוצרים צינור נתונים עם פלאגין מקור לערכת הנתונים, וטרנספורמציה של Wrangler עם המתכון שמכיל את שלבי הטרנספורמציה, שמופעלים כשצינור הנתונים פועל.

מצב מתקדם של Wrangler‏ (CLI)

כדי לציין הוראות באמצעות תחביר הצהרתי, משתמשים במצב מתקדם (CLI). הוא שימושי למשימות הבאות:

  • שימוש בהנחיות שלא זמינות בממשק של Studio
  • הוספת הוראות מוגדרות על ידי משתמש
  • החלת הוראה על כמה עמודות

כדי להשתמש במצב המתקדם של Wrangler, מזינים הנחיות בסרגל השחור בתחתית הכרטיסייה Data של Wrangler.

הכרטיסייה Insights ב-Wrangler

אפשר להשתמש בכרטיסייה תובנות בדף Wrangler כדי לגלות נתונים במערך נתונים.

מגבלות

  • ‫Wrangler נתמך רק בצינורות ETL של אצווה.
  • Wrangler מבצע טרנספורמציה רק על נתוני המדגם. הנתונים לדוגמה מוגבלים ל-1,000 הרשומות הראשונות.
  • כדי להשתמש ב-Wrangler, צריך ליצור חיבורים למקור. מידע נוסף זמין במאמר בנושא יצירה וניהול של חיבורים.
  • תמיד צריך לפתוח לפחות סביבת עבודה אחת ב-Wrangler.
  • אין תמיכה בלחיצה על הלחצן Wrangle בטרנספורמציה של Wrangler.

יש שתי דרכים לגשת ל-Wrangler מממשק Cloud Data Fusion Studio:

  • כדי לפתוח את סביבת העבודה של Cloud Data Fusion Wrangler, עוברים אל Cloud Data Fusion Studio ולוחצים על Wrangler.
  • כדי להגדיר את המאפיינים של Wrangler, עוברים אל Cloud Data Fusion Studio ולוחצים על Studio > Transformations > Wrangler.

התחברות למקור נתונים

‫Wrangler תומך במקורות נתונים שונים, כמו BigQuery,‏ Cloud Storage ומסדי נתונים חיצוניים (עם הגדרה נוספת). כדי להשתמש ב-Wrangler, צריך ליצור חיבור למקור.

כדי ליצור את החיבור, עוברים לרשימה Connections ובוחרים את החיבור למקור הנתונים. מידע נוסף מופיע במאמר בנושא יצירה וניהול של חיבורים.

עיון בנתונים ותצוגה מקדימה שלהם

ב-Wrangler מוצגת דגימה של הנתונים (בדרך כלל 1,000 שורות) לבדיקה. אתם יכולים לקבל סקירה כללית של סכימת הנתונים, כולל סוגי הנתונים ונתונים סטטיסטיים בסיסיים.

החלת הוראות

ב-Wrangler יש מגוון של הנחיות מובנות למשימות נפוצות של data wrangling.

  • גוררים את ההנחיה שנבחרה לעמודה ספציפית או לחלון התצוגה המקדימה של הנתונים.
  • לכל הנחיה יש אפשרויות הגדרה להתאמה אישית של ההתנהגות שלה.

מידע נוסף זמין במאמר בנושא הוראות בשורת הפקודה של Wrangler.

תצוגה מקדימה של תוצאות הטרנספורמציה

כשמחילים הנחיות, חלון התצוגה המקדימה של הנתונים מתעדכן באופן דינמי כדי לשקף את השינויים. כך תוכלו לראות את ההשפעה המיידית של כל טרנספורמציה על הנתונים.

שיפור ואיטרציה

כדי לשפר את תהליך ה-data wrangling, ממשיכים להוסיף הנחיות, לשנות את ההגדרות ולבדוק את התצוגה המקדימה.

הממשק החזותי של Wrangler עוזר לכם לבצע ניסויים ולוודא שהטרנספורמציות מניבות את התוצאה הרצויה.

הוספת טרנספורמציות לצינור עיבוד נתונים

למרות ש-Wrangler עצמו הוא לא פתרון אחסון מתמיד, Cloud Data Fusion מציע דרכים לתעד את הלוגיקה של הטיפול בנתונים:

  • יצירת צינור עיבוד נתונים בסביבת העבודה של Wrangler, ממירים את הטרנספורמציות של Wrangler לצינור של Cloud Data Fusion. לשם כך, פועלים לפי השלבים הבאים:

    1. לוחצים על יצירת צינור.
    2. בוחרים באפשרות Batch pipeline (צינור להעברת נתונים בכמויות גדולות). הדף Pipeline Studio נפתח עם צינור שכולל מקור וטרנספורמציה של Wrangler.
  • החלת טרנספורמציות. אם אתם משתמשים בתוסף Wrangler בדף Studio, אתם יכולים להמיר את הטרנספורמציות של Wrangler לצינור עיבוד נתונים של Cloud Data Fusion בלחיצה על Apply (החלה).

עריכת מתכונים

כשמשתמשים בסביבת העבודה של Wrangler כדי ליצור טרנספורמציה של Wrangler, אחרי שמוסיפים את הטרנספורמציה של Wrangler לצינור, מומלץ להשתמש בממשק של Wrangler כדי להוסיף או לערוך מתכונים.

אם עורכים ידנית את המתכון או מוסיפים לו שלבים חדשים בטרנספורמציה של Wrangler, והשינויים משפיעים על סכימת הפלט, צריך לעדכן ידנית את סכימת הפלט בטרנספורמציה של Wrangler כך שתתאים לשינויים במתכון. רק מתכונים שנוצרו או נערכו בסביבת העבודה של Wrangler ייצרו ויעדכנו באופן אוטומטי את סכימת הפלט בטרנספורמציה של Wrangler.

כדי לערוך מתכון בטרנספורמציה של Wrangler שנוצרה בממשק האינטרנט של Wrangler, פועלים לפי השלבים הבאים:

  1. עוברים לצומת Wrangler בצינור הנתונים ולוחצים על Properties (מאפיינים).
  2. לוחצים על Wrangle.
  3. עורכים או מוסיפים מתכון חדש.
  4. לוחצים על אישור.

המאמרים הבאים