יצירת צינור של קמפיינים לטירגוט
במאמר הזה מוסבר איך להשתמש ב-Cloud Data Fusion כדי לנקות, לבצע טרנספורמציה ולעבד נתוני לקוחות, במטרה לבחור מועמדים לקמפיין יעד.
לחצו על תראו לי איך כדי לקרוא הסבר מפורט על המשימה ישירות במסוף Google Cloud :
תרחיש
אתם רוצים ליצור חומרי שיווק בהתאמה אישית לקידום קמפיין מתמשך, ואתם רוצים להפיץ את החומרים ישירות לתיבות הדואר של הלקוחות.
יש בקמפיין שתי מגבלות:
- מיקום: אתם מבצעים משלוחים רק ללקוחות בקליפורניה, בוושינגטון ובאורגון.
- עלות: כדי לחסוך בדלק, אתם מספקים משלוחים ללקוחות שקל להגיע אליהם. אתם מבצעים משלוחים רק ללקוחות שגרים בשדרות.
במדריך הזה מוסבר איך ליצור את רשימת כתובות הלקוחות לקמפיין. במדריך הזה תלמדו:
- ניקוי נתוני הלקוחות: סינון לקוחות שגרים בשדרה בקליפורניה, בוושינגטון או באורגון.
יוצרים צינור שמעביר את הנתונים באופן הבא:
- מצטרף לנתוני הלקוחות המסוננים עם מערך נתונים ציבורי שמכיל קיצורים של שמות מדינות.
- הנתונים המצורפים והנקיים נשמרים בטבלה ב-BigQuery שאפשר להריץ עליה שאילתות (באמצעות ממשק האינטרנט של BigQuery) או לנתח אותה (באמצעות Data Studio).
מטרות
- חיבור של Cloud Data Fusion לשני מקורות נתונים
- החלת טרנספורמציות בסיסיות
- צירוף שני מקורות הנתונים
- כתיבת נתוני הפלט ליעד
לפני שמתחילים
- נכנסים לחשבון Google Cloud . אם אתם משתמשים חדשים ב- Google Cloud, צרו חשבון כדי שתוכלו להעריך את הביצועים של המוצרים שלנו בתרחישים מהעולם האמיתי. לקוחות חדשים מקבלים בחינם גם קרדיט בשווי 300$ להרצה, לבדיקה ולפריסה של עומסי העבודה.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
מפעילים את ממשקי ה-API של Cloud Data Fusion, BigQuery, Cloud Storage ו-Dataproc.
תפקידים שנדרשים להפעלת ממשקי API
כדי להפעיל ממשקי API, נדרשת ההרשאה
serviceusage.services.enable. אם יצרתם את הפרויקט, סביר להניח שכבר יש לכם את ההרשאה הזו דרך התפקיד 'בעלים' (roles/owner). אחרת, תוכלו לקבל את ההרשאה הזו דרך התפקיד 'אדמין בממשק 'שימוש בשירות'' (roles/serviceusage.serviceUsageAdmin). איך מקצים תפקידים-
יצירת מכונת Cloud Data Fusion
במדריך הזה מניחים שאתם משתמשים בחשבון השירות שמוגדר כברירת מחדל ב-Compute Engine.
ניהול הרשאות
ליצור ולהקצות את התפקידים וההרשאות הנדרשים בהתאמה אישית.
יצירת תפקיד בהתאמה אישית והוספת הרשאות
נכנסים לדף Roles במסוף Google Cloud :
לוחצים על יצירת תפקיד.
בשדה Title, מזינים
Custom Role-Tutorial.לוחצים על הוספת הרשאות.
בחלון Add permissions, בוחרים את ההרשאות הבאות ולוחצים על Add:
bigquery.datasets.createbigquery.jobs.createstorage.buckets.create
לוחצים על יצירה.
הקצאת תפקיד בהתאמה אישית לחשבון השירות של Compute Engine שמוגדר כברירת מחדל
עוברים לדף Instances ב-Cloud Data Fusion:
לוחצים על השם של המופע.
רושמים את חשבון השירות שמוגדר כברירת מחדל ב-Dataproc. המידע הזה מופיע בדף הפרטים של המופע.
הפורמט של שם חשבון השירות של Managed Service for Apache Spark הוא:
CUSTOMER_PROJECT_NUMBER-compute@developer.gserviceaccount.com.מידע נוסף על חשבונות שירות של Managed Service for Apache Spark
נכנסים לדף IAM:
בסרגל Filter, מזינים את השם של חשבון השירות שמוגדר כברירת מחדל בשירות המנוהל ל-Apache Spark.
בחשבון השירות של Compute Engine שמוגדר כברירת מחדל, לוחצים על עריכה.
לוחצים על הוספת תפקיד נוסף.
בשדה Select a role (בחירת תפקיד), בוחרים באפשרות Custom Role-Tutorial (תפקיד בהתאמה אישית – הדרכה).
לוחצים על Save.
מוודאים שלחשבון השירות כבר הוקצה התפקיד Cloud Data Fusion Runner.
הכנת נתוני הלקוחות
המדריך הזה דורש את שני מערכי הנתונים הבאים, ששניהם מסופקים עם מופע Cloud Data Fusion שלכם:
- נתוני לקוחות לדוגמה: קובץ CSV בשם
customers.csv. - קיצורים של שמות מדינות: טבלה ב-BigQuery בשם
state_abbreviations.
טעינת נתוני הלקוחות
עוברים לדף Instances ב-Cloud Data Fusion:
במכונת Cloud Data Fusion שבה אתם משתמשים, לוחצים על הצגת המכונה. ממשק האינטרנט של Cloud Data Fusion ייפתח בכרטיסייה חדשה.
לוחצים על Wrangler. ייפתח הדף Wrangler.
בחלונית Connections (קישורים), לוחצים על GCS > Sample Buckets (מאגרי דוגמאות).
לוחצים על campaign-tutorial.
לוחצים על customers.csv.
בחלון Parsing options (אפשרויות ניתוח), מציינים את הפרטים הבאים:
- פורמט:
csv - הפעלת ערך מצוטט:
False - שימוש בשורה הראשונה ככותרת:
False - קידוד קובץ:
UTF-8
- פורמט:
לוחצים על אישור. נתוני הלקוחות נטענים בכרטיסייה חדשה ב-Wrangler.
ניקוי נתוני הלקוחות
היא כוללת שתי משימות משנה:
- הגדרת הסכימה
- סינון נתוני הלקוחות כדי להציג רק את קהל היעד שאתם צריכים
הגדרת הסכימה
מגדירים את הסכימה של הנתונים על ידי הקצאת שמות מתאימים לעמודות בטבלה. כדי לתת לעמודות, כמו body_1 ו-body_2, שמות אינפורמטיביים יותר, פועלים לפי השלבים הבאים:.
- בחלונית השמאלית, לוחצים על הכרטיסייה עמודות.
- לוחצים על התפריט הנפתח שמות העמודות ובוחרים באפשרות הגדרת הכל.
בתיבת הדו-שיח Bulk set column names (הגדרת שמות עמודות בכמות גדולה), מזינים את שמות העמודות הבאים, מופרדים בפסיקים:
Name,StreetAddress,City,State,Countryלוחצים על אישור.
סינון הנתונים
מסננים את הנתונים כדי להציג רק לקוחות שגרים בקליפורניה, באורגון או בוושינגטון.
מסירים את כל השורות שמכילות ערכים שאינם המדינות האלה:
- לוחצים על התפריט הנפתח של העמודה מצב ובוחרים באפשרות סינון.
בחלון הסינון, מבצעים את הפעולות הבאות:
- לוחצים על שמירת השורות.
- לוחצים על התפריט הנפתח If ובוחרים באפשרות value matches regex.
מזינים את הביטוי הרגולרי הבא:
^(California|Oregon|Washington)$לוחצים על אישור.
הערכים בעמודה State הם California, Oregon או Washington.
מסננים את הנתונים כדי להציג רק לקוחות שגרים בשדרות. משאירים רק את הכתובות שמכילות את המחרוזת Avenue:
- לוחצים על התפריט הנפתח בעמודה StreetAddress ובוחרים באפשרות Filter (סינון).
- בחלון המסנן, מבצעים את הפעולות הבאות:
- לוחצים על שמירת השורות.
- לוחצים על התפריט הנפתח If (אם), בוחרים באפשרות value contains (הערך מכיל) ומזינים
Avenue. - בוחרים באפשרות לא תלוי רישיות.
- לוחצים על אישור.
לפני שמבצעים עבודות עיבוד מקבילי על מערך הנתונים כולו, ב-Wrangler מוצגים רק 1,000 הערכים הראשונים של מערך הנתונים. סיננתם חלק מהנתונים, ולכן רק כמה לקוחות נשארו בתצוגה של Wrangler.
יצירת צינור עיבוד נתונים של אצווה
ניקיתם את הנתונים והפעלתם טרנספורמציות על קבוצת משנה של הנתונים. עכשיו אפשר ליצור צינור להעברת נתונים (pipeline) של אצווה כדי להריץ טרנספורמציות על מערך הנתונים כולו.
Cloud Data Fusion מתרגם את צינור הנתונים שאתם יוצרים ב-Studio לתוכנית Apache Spark שמבצעת טרנספורמציות במקביל באשכול זמני של Managed Service for Apache Spark. התהליך הזה מאפשר לבצע טרנספורמציות מורכבות על כמויות גדולות של נתונים בצורה ניתנת להרחבה ואמינה, בלי צורך לנהל את התשתית.
- בדף של Wrangler, לוחצים על Create a pipeline (יצירת צינור).
- בוחרים באפשרות Batch pipeline (צינור להעברת נתונים בכמויות גדולות). ייפתח הדף של סטודיו YouTube.
בדף Studio, צומת המקור GCSFile מחובר לצומת Wrangler.
הטרנספורמציות שהחלתם בדף Wrangler מופיעות בצומת Wrangler בדף Studio.
כדי לראות את הטרנספורמציות שהחלתם, מעבירים את מצביע העכבר מעל הצומת Wrangler ולוחצים על Properties (מאפיינים).
הטרנספורמציות שהחלתם מופיעות בהנחיות.
לוחצים על אימות.
לוחצים על סגירה.
לדוגמה, אם אתם מבינים שהעמודה Country לא נחוצה כי הערך שלה הוא תמיד USA. כדי למחוק את העמודה, פועלים לפי השלבים הבאים:
- לוחצים על Wrangle.
- לוחצים על החץ למטה לצד מדינה ובוחרים באפשרות מחיקת העמודה.
- לוחצים על אישור. הדף Wrangler נסגר והחלון Wrangler Properties נפתח בדף Studio. בקטע Directives (הוראות), מופיע
drop Country. - לוחצים על סגירה.
קיצור שמות המדינות
מערכת הניווט ברכב המסירה מזהה רק כתובות שמכילות שמות מדינות מקוצרים (CA ולא California), ובנתוני הלקוחות שלכם מופיעים שמות מדינות מלאים.
הטבלה הציבורית state_abbreviations ב-BigQuery מכילה שתי עמודות: אחת עם השמות המלאים של המדינות ואחת עם השמות המקוצרים של המדינות.
אפשר להשתמש בטבלה הזו כדי לעדכן את שמות המדינות בנתוני הלקוחות.
צפייה בנתונים של שמות המדינות ב-BigQuery
בכרטיסייה נפרדת, עוברים לדף BigQuery Studio:
לוחצים על Create SQL query ומזינים את שאילתת ה-SQL הבאה בעורך השאילתות:
SELECT * FROM `dis-user-guide.campaign_tutorial.state_abbreviations`לוחצים על Run.
ב-BigQuery מוצגת רשימה של שמות מדינות והקיצורים שלהם.
גישה לטבלה ב-BigQuery
מוסיפים מקור לצנרת שיקבל גישה לטבלת BigQuery state_abbreviations.
- עוברים לדף Cloud Data Fusion Studio ומרחיבים את התפריט מקור.
לוחצים על BigQuery.
בקנבס מופיע צומת מקור של BigQuery, לצד שני הצמתים האחרים.
מעבירים את מצביע העכבר מעל צומת המקור BigQuery ולוחצים על מאפיינים.
- בשדה Dataset Project ID (מזהה פרויקט של מערך נתונים), מזינים
dis-user-guide. - בשדה שם הפניה מזינים
state_abbreviations. - בשדה Dataset, מזינים
campaign_tutorial. - בשדה Table, מזינים
state_abbreviations.
- בשדה Dataset Project ID (מזהה פרויקט של מערך נתונים), מזינים
כדי לאכלס את הסכימה של הטבלה מ-BigQuery, לוחצים על קבלת סכימה.
לוחצים על סגירה.
צירוף שני מקורות הנתונים
כדי ליצור פלט שמכיל נתוני לקוחות עם שמות מדינות מקוצרים, צריך לצרף את שני מקורות הנתונים: נתוני הלקוחות וקיצורי שמות המדינות.
- עוברים לדף Cloud Data Fusion Studio ומרחיבים את התפריט Analytics.
לוחצים על הצטרפות.
במרחב העבודה מופיע צומת Joiner שמייצג פעולה שדומה ל-SQL Join.
מחברים את הצומת Wrangler ואת הצומת BigQuery לצומת Joiner: גוררים חץ חיבור בקצה הימני של צומת המקור ומשחררים אותו על צומת היעד.
מציבים את הסמן מעל הצומת Joiner (צירוף) ולוחצים על Properties (מאפיינים).
בקטע Fields, מרחיבים את האפשרויות Wrangler ו-BigQuery.
- מבטלים את הסימון של תיבת הסימון state של Wrangler.
- מבטלים את הסימון של תיבת הסימון name ב-BigQuery כי רוצים רק את השם המקוצר של המדינה ולא את השם המלא.
משאירים את הסימון בתיבת הסימון קיצור של BigQuery ומשנים את הכינוי ל-
State.
בשדה סוג הצטרפות, משאירים את הערך חיצוני. בקטע Required inputs (קלט נדרש), מסמנים את התיבה Wrangler.
בקטע Join condition, בוחרים באפשרות State עבור Wrangler. ב-BigQuery, בוחרים באפשרות name (שם).
יצירת הסכימה של הצירוף שמתקבל. לוחצים על קבלת סכימה.
לוחצים על אימות.
לוחצים על סגירה.
אחסון הפלט ב-BigQuery
אחסון התוצאה של הצינור בטבלה ב-BigQuery. המקום שבו מאחסנים את הנתונים נקרא יעד.
- עוברים לדף Cloud Data Fusion Studio ומרחיבים את Sink.
- לוחצים על BigQuery.
מחברים את הצומת Joiner לצומת BigQuery.
מעבירים את מצביע העכבר מעל הצומת BigQuery ולוחצים על Properties (מאפיינים).
- בשדה Dataset, מזינים
dis_user_guide. - בשדה Table, בוחרים באפשרות
customer_data_abbreviated_states. - לוחצים על סגירה.
- בשדה Dataset, מזינים
פריסה והפעלה של צינור עיבוד הנתונים
- בדף Studio, לוחצים על Name your pipeline (מתן שם לצינור) ומזינים את הערך
CampaignPipeline. - לוחצים על Save.
- בפינה השמאלית העליונה, לוחצים על פריסה.
- אחרי שהפריסה מסתיימת, לוחצים על Run (הפעלה).
הפעלת צינור הנתונים יכולה להימשך כמה דקות. בזמן ההמתנה, אפשר לעקוב אחרי הסטטוס של המעבר בצינור, מהקצאת הרשאות > התחלה > פועל > ביטול הקצאת הרשאות > הושלם.
צפייה בתוצאות
במסוף Google Cloud , עוברים לדף BigQuery:
לוחצים על יצירת שאילתת SQL.
מריצים שאילתה על הטבלה
customer_data_abbreviated_states:SELECT * FROM dis_user_guide.customer_data_abbreviated_states LIMIT 1000
יצרתם בהצלחה פייפליין נתונים.
הסרת המשאבים
כדי לא לצבור חיובים לחשבון Google Cloud על המשאבים שבהם השתמשתם בדף הזה, פועלים לפי השלבים הבאים:
מחיקת מערך הנתונים ב-BigQuery
כדי למחוק את מערך הנתונים ב-BigQuery שיצרתם במדריך הזה:
- במסוף Google Cloud , עוברים לדף BigQuery.
- בוחרים את מערך הנתונים
dis_user_guide. - לוחצים על delete מחיקת מערך נתונים.
מחיקת מופע Cloud Data Fusion
פועלים לפי ההוראות כדי למחוק את מופע Cloud Data Fusion.
מחיקת הפרויקט
הדרך הקלה ביותר לבטל את החיוב היא למחוק את הפרויקט שיצרתם בשביל המדריך הזה.
כדי למחוק את הפרויקט:
- במסוף Google Cloud , נכנסים לדף Manage resources.
- ברשימת הפרויקטים, בוחרים את הפרויקט שרוצים למחוק ולוחצים על Delete.
- כדי למחוק את הפרויקט, כותבים את מזהה הפרויקט בתיבת הדו-שיח ולוחצים על Shut down.