בדף הזה מוסבר איך להפריד נתונים משדה (תא) לכמה שורות כשמכינים נתונים בסביבת העבודה של Wrangler ב-Cloud Data Fusion Studio.
הפרדת טקסט מופרד
אפשר להפריד את הערכים מתא לשורות חדשות אם הערכים מופרדים באמצעות התווים הבאים:
- פסיק
- Tab
- צינור
- רווח לבן
- מפריד מותאם אישית
אם תא לא מכיל את התו המפריד שנבחר, לא תתווסף שורה חדשה.
כדי לפצל ערכים על סמך תו מפריד, פועלים לפי השלבים הבאים:
- עוברים לסביבת העבודה של Wrangler ב-Cloud Data Fusion.
- בכרטיסייה נתונים, עוברים לשם של עמודה ולוחצים על החץ להרחבה arrow_drop_down.
- לוחצים על פירוק > טקסט מופרד.
- בוחרים תו מפריד – לדוגמה Pipe.
לוחצים על חילוץ.
הכלי Wrangler מפצל את השדות על סמך התו המפריד שנבחר ומוסיף את ההנחיה split-to-row למתכון. כשמפעילים את צינור הנתונים, Cloud Data Fusion מחיל את השינוי על כל הערכים בעמודה.
בדוגמה הזו, למערך נתונים יש עמודה של ערכי מחרוזת שמכילה את התו המפריד פסיק:
| מזהה | שם |
|---|---|
| 1 | Lee,Lucian,Luka |
| 2 | מאהן,נועם |
כדי לחלק את הערך לשורות נפרדות, Wrangler מוחק את העמודה המקורית ויוצר עמודה חדשה עם שורה אחת לכל ערך. הערכים של העמודות האחרות מהשורה המקורית מועתקים לשורות החדשות:
| מזהה | Name_1 |
|---|---|
| 1 | Lee |
| 1 | לוסיאן |
| 1 | לוקה |
| 2 | Mahan |
| 2 | נועם |
מערכים נפרדים
ההוראה flatten מפרידה בין פריטים במערכים, כמו ["ELEMENT_1",
"ELEMENT_2", "ELEMENT_3"], לשורות חדשות. ערכי העמודות האחרים מהרשומה המקורית מועתקים לרשומות החדשות.