בדף הזה מוסבר איך לחלץ ולשנות נתונים משדה (תא) כשמכינים נתונים בסביבת העבודה של Wrangler ב-Cloud Data Fusion Studio.
כדי לבצע טרנספורמציות בנתונים האלה, צריך לפצל אותם לעמודות נפרדות. ב-Wrangler, אפשר לחלץ נתונים מעמודה וליצור עמודות חדשות לנתונים שחולצו. אפשר לחלץ ערכים על סמך תבניות, תווי הפרדה או מיקומים.
חילוץ נתונים באמצעות תבניות
אפשר לחלץ נתונים משדות בעמודות של סוג הנתונים string באמצעות התבניות הבאות:
- כרטיסי אשראי
- תאריך
- תאריך ושעה
- אימייל
- כתובות URL מקישורי עוגן ב-HTML
- כתובת IPv4
- קודי ISBN
- כתובת MAC
- מספר עם N ספרות
- ת"ז
- דפוס התחלה וסיום
- שעה
כדי לחלץ נתונים על סמך תבנית, פועלים לפי השלבים הבאים:
- עוברים לסביבת העבודה של Wrangler ב-Cloud Data Fusion.
- בכרטיסייה נתונים, עוברים לשם של עמודה ולוחצים על החץ להרחבה arrow_drop_down.
- בוחרים באפשרות Extract fields > Using patterns (חילוץ שדות > באמצעות תבניות) ובוחרים באפשרות מסוימת, למשל URL (כתובת URL).
- אופציונלי: לוחצים על הצגת התבנית כדי לראות את הביטוי הרגולרי של התבנית.
- לוחצים על חילוץ.
Wrangler מחלץ את השדות על סמך התבנית שנבחרה ומוסיף את ההנחיה extract-regex-groups למתכון. כשמריצים את צינור הנתונים, Cloud Data Fusion מחיל את השינוי על כל השורות בעמודה.
בדוגמה הבאה, עמודה מכילה מספר ואחריו כתובת אימייל:
| אימיילים |
|---|
| 1 222larabrown@gmail.com |
| 2 cloudysanfrancisco@gmail.com |
כדי לחלץ את כתובת האימייל, בוחרים בתבנית אימייל. כשלוחצים על Extract, Wrangler שומר את העמודה המקורית ויוצר עמודה חדשה שמכילה רק את כתובות האימייל:
| אימיילים | Emails_1 |
|---|---|
| 1 222larabrown@gmail.com | 222larabrown@gmail.com |
| 2 cloudysanfrancisco@gmail.com | cloudysanfrancisco@gmail.com |
חילוץ נתונים באמצעות תווי הפרדה
אפשר לחלץ נתונים לשתי עמודות או יותר על סמך התווים הבאים להפרדה בין נתונים:
- פסיק
- Tab
- צינור
- רווח לבן
- מפריד מותאם אישית
אם ערך מסוים לא כולל את התו להפרדה, לא יתווסף ערך לשדה המתאים בעמודה החדשה.
כדי לחלץ ערכים על סמך תו מפריד:
- עוברים לסביבת העבודה של Wrangler ב-Cloud Data Fusion.
- בכרטיסייה נתונים, עוברים לשם של עמודה ולוחצים על החץ להרחבה arrow_drop_down.
- בוחרים באפשרות Extract fields > Using delimiters (חילוץ שדות > באמצעות תווי הפרדה) ובוחרים באפשרות – לדוגמה, Comma (פסיק).
- לוחצים על חילוץ.
Wrangler מחלץ את השדות על סמך התו המפריד שנבחר ומוסיף את ההנחיה split-to-columns למתכון. כשמריצים את צינור הנתונים, Cloud Data Fusion משנה את כל הערכים בעמודה.
בדוגמה הבאה, עמודה מכילה כמה שמות שמופרדים בפסיקים:
| מזהה | שם |
|---|---|
| 1 | Lee,Lucian,Luka |
| 2 | Mahan,Noam,Nur |
בדוגמה הזו, השימוש בתבנית של מפרידים בפסיקים מחלץ את הערכים בעמודה המקורית Name לשלוש עמודות חדשות:
| מזהה | שם | Name_1 | Name_2 | Name_3 |
|---|---|---|---|---|
| 1 | Lee,Lucian,Luka | Lee | לוסיאן | לוקה |
| 2 | Mahan,Noam,Nur | Mahan | נועם | Nur |
חילוץ נתונים לפי מיקום
אפשר לחלץ חלק ממחרוזת על סמך המיקום שלה במחרוזת.
כדי לחלץ נתונים על סמך המיקום שלהם:
- עוברים לסביבת העבודה של Wrangler ב-Cloud Data Fusion.
- בכרטיסייה נתונים, עוברים לשם של עמודה ולוחצים על החץ להרחבה arrow_drop_down.
- בוחרים באפשרות Extract fields > Using positions (חילוץ שדות > לפי מיקום). ערכי העמודות שאפשר לחלץ מופיעים על רקע כחול.
- בתא כלשהו בעמודה, בוחרים את התווים שרוצים לחלץ.
- בשדה Name of destination column (שם עמודת היעד), מזינים שם.
- לוחצים על אישור.
החלק שנבחר של הערך מחולץ מכל שורה בעמודה.
Wrangler מחלץ את השדות על סמך התבנית שנבחרה ומוסיף את ההנחיה cut-character למתכון. כשמפעילים את צינור הנתונים, Cloud Data Fusion מחיל את השינוי על כל הערכים בעמודה.