יצירת צינור של קמפיינים לטירגוט

במאמר הזה מוסבר איך להשתמש ב-Cloud Data Fusion כדי לנקות, לבצע טרנספורמציה ולעבד נתוני לקוחות, במטרה לבחור מועמדים לקמפיין יעד.


לחצו על תראו לי איך כדי לקרוא הסבר מפורט על המשימה ישירות במסוף Google Cloud :

תראו לי איך


תרחיש

אתם רוצים ליצור חומרי שיווק בהתאמה אישית לקידום קמפיין מתמשך, ואתם רוצים להפיץ את החומרים ישירות לתיבות הדואר של הלקוחות.

יש בקמפיין שתי מגבלות:

  • מיקום: אתם מבצעים משלוחים רק ללקוחות בקליפורניה, בוושינגטון ובאורגון.
  • עלות: כדי לחסוך בדלק, אתם מספקים משלוחים ללקוחות שקל להגיע אליהם. אתם מבצעים משלוחים רק ללקוחות שגרים בשדרות.

במדריך הזה מוסבר איך ליצור את רשימת כתובות הלקוחות לקמפיין. במדריך הזה תלמדו:

  1. ניקוי נתוני הלקוחות: סינון לקוחות שגרים בשדרה בקליפורניה, בוושינגטון או באורגון.
  2. יוצרים צינור שמעביר את הנתונים באופן הבא:

    • מצטרף לנתוני הלקוחות המסוננים עם מערך נתונים ציבורי שמכיל קיצורים של שמות מדינות.
    • הנתונים המצורפים והנקיים נשמרים בטבלה ב-BigQuery שאפשר להריץ עליה שאילתות (באמצעות ממשק האינטרנט של BigQuery) או לנתח אותה (באמצעות Data Studio).

מטרות

  • חיבור של Cloud Data Fusion לשני מקורות נתונים
  • החלת טרנספורמציות בסיסיות
  • צירוף שני מקורות הנתונים
  • כתיבת נתוני הפלט ליעד

לפני שמתחילים

  1. נכנסים לחשבון Google Cloud . אם אתם משתמשים חדשים ב- Google Cloud, צרו חשבון כדי שתוכלו להעריך את הביצועים של המוצרים שלנו בתרחישים מהעולם האמיתי. לקוחות חדשים מקבלים בחינם גם קרדיט בשווי 300$ להרצה, לבדיקה ולפריסה של עומסי העבודה.
  2. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  3. Verify that billing is enabled for your Google Cloud project.

  4. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  5. Verify that billing is enabled for your Google Cloud project.

  6. מפעילים את ממשקי ה-API של Cloud Data Fusion,‏ BigQuery,‏ Cloud Storage ו-Dataproc.

    תפקידים שנדרשים להפעלת ממשקי API

    כדי להפעיל ממשקי API, נדרשת ההרשאה serviceusage.services.enable. אם יצרתם את הפרויקט, סביר להניח שכבר יש לכם את ההרשאה הזו דרך התפקיד 'בעלים' (roles/owner). אחרת, תוכלו לקבל את ההרשאה הזו דרך התפקיד 'אדמין בממשק 'שימוש בשירות'' (roles/serviceusage.serviceUsageAdmin). איך מקצים תפקידים

    הפעלת ממשקי ה-API

  7. יצירת מכונת Cloud Data Fusion
    במדריך הזה מניחים שאתם משתמשים בחשבון השירות שמוגדר כברירת מחדל ב-Compute Engine.

ניהול הרשאות

ליצור ולהקצות את התפקידים וההרשאות הנדרשים בהתאמה אישית.

יצירת תפקיד בהתאמה אישית והוספת הרשאות

  1. נכנסים לדף Roles במסוף Google Cloud :

    לדף Roles

  2. לוחצים על יצירת תפקיד.

  3. בשדה Title, מזינים Custom Role-Tutorial.

  4. לוחצים על הוספת הרשאות.

  5. בחלון Add permissions, בוחרים את ההרשאות הבאות ולוחצים על Add:

    • bigquery.datasets.create
    • bigquery.jobs.create
    • storage.buckets.create
  6. לוחצים על יצירה.

הקצאת תפקיד בהתאמה אישית לחשבון השירות של Compute Engine שמוגדר כברירת מחדל

  1. עוברים לדף Instances ב-Cloud Data Fusion:

    יצירת מופע

  2. לוחצים על השם של המופע.

  3. רושמים את חשבון השירות שמוגדר כברירת מחדל ב-Dataproc. המידע הזה מופיע בדף הפרטים של המופע.

    הפורמט של שם חשבון השירות של Managed Service for Apache Spark הוא:

    CUSTOMER_PROJECT_NUMBER-compute@developer.gserviceaccount.com.

    מידע נוסף על חשבונות שירות של Managed Service for Apache Spark

  4. נכנסים לדף IAM:

    לדף Roles

  5. בסרגל Filter, מזינים את השם של חשבון השירות שמוגדר כברירת מחדל בשירות המנוהל ל-Apache Spark.

  6. בחשבון השירות של Compute Engine שמוגדר כברירת מחדל, לוחצים על עריכה.

  7. לוחצים על הוספת תפקיד נוסף.

  8. בשדה Select a role (בחירת תפקיד), בוחרים באפשרות Custom Role-Tutorial (תפקיד בהתאמה אישית – הדרכה).

  9. לוחצים על Save.

  10. מוודאים שלחשבון השירות כבר הוקצה התפקיד Cloud Data Fusion Runner.

הכנת נתוני הלקוחות

המדריך הזה דורש את שני מערכי הנתונים הבאים, ששניהם מסופקים עם מופע Cloud Data Fusion שלכם:

  • נתוני לקוחות לדוגמה: קובץ CSV בשם customers.csv.
  • קיצורים של שמות מדינות: טבלה ב-BigQuery בשם state_abbreviations.

טעינת נתוני הלקוחות

  1. עוברים לדף Instances ב-Cloud Data Fusion:

    כניסה לדף Instances

  2. במכונת Cloud Data Fusion שבה אתם משתמשים, לוחצים על הצגת המכונה. ממשק האינטרנט של Cloud Data Fusion ייפתח בכרטיסייה חדשה.

  3. לוחצים על Wrangler. ייפתח הדף Wrangler.

  4. בחלונית Connections (קישורים), לוחצים על GCS > Sample Buckets (מאגרי דוגמאות).

  5. לוחצים על campaign-tutorial.

  6. לוחצים על customers.csv.

  7. בחלון Parsing options (אפשרויות ניתוח), מציינים את הפרטים הבאים:

    • פורמט: csv
    • הפעלת ערך מצוטט: False
    • שימוש בשורה הראשונה ככותרת: False
    • קידוד קובץ: UTF-8
  8. לוחצים על אישור. נתוני הלקוחות נטענים בכרטיסייה חדשה ב-Wrangler.

    נתוני לקוחות שנטענו

ניקוי נתוני הלקוחות

היא כוללת שתי משימות משנה:

  • הגדרת הסכימה
  • סינון נתוני הלקוחות כדי להציג רק את קהל היעד שאתם צריכים

הגדרת הסכימה

מגדירים את הסכימה של הנתונים על ידי הקצאת שמות מתאימים לעמודות בטבלה. כדי לתת לעמודות, כמו body_1 ו-body_2, שמות אינפורמטיביים יותר, פועלים לפי השלבים הבאים:.

  1. בחלונית השמאלית, לוחצים על הכרטיסייה עמודות.
  2. לוחצים על התפריט הנפתח שמות העמודות ובוחרים באפשרות הגדרת הכל.
  3. בתיבת הדו-שיח Bulk set column names (הגדרת שמות עמודות בכמות גדולה), מזינים את שמות העמודות הבאים, מופרדים בפסיקים:

    Name,StreetAddress,City,State,Country
    
  4. לוחצים על אישור.

סינון הנתונים

מסננים את הנתונים כדי להציג רק לקוחות שגרים בקליפורניה, באורגון או בוושינגטון.

מסירים את כל השורות שמכילות ערכים שאינם המדינות האלה:

  1. לוחצים על התפריט הנפתח של העמודה מצב ובוחרים באפשרות סינון.
  2. בחלון הסינון, מבצעים את הפעולות הבאות:

    1. לוחצים על שמירת השורות.
    2. לוחצים על התפריט הנפתח If ובוחרים באפשרות value matches regex.
    3. מזינים את הביטוי הרגולרי הבא:

      ^(California|Oregon|Washington)$
      
    4. לוחצים על אישור.

    הערכים בעמודה State הם California,‏ Oregon או Washington.

מסננים את הנתונים כדי להציג רק לקוחות שגרים בשדרות. משאירים רק את הכתובות שמכילות את המחרוזת Avenue:

  1. לוחצים על התפריט הנפתח בעמודה StreetAddress ובוחרים באפשרות Filter (סינון).
  2. בחלון המסנן, מבצעים את הפעולות הבאות:
    1. לוחצים על שמירת השורות.
    2. לוחצים על התפריט הנפתח If (אם), בוחרים באפשרות value contains (הערך מכיל) ומזינים Avenue.
    3. בוחרים באפשרות לא תלוי רישיות.
    4. לוחצים על אישור.

לפני שמבצעים עבודות עיבוד מקבילי על מערך הנתונים כולו, ב-Wrangler מוצגים רק 1,000 הערכים הראשונים של מערך הנתונים. סיננתם חלק מהנתונים, ולכן רק כמה לקוחות נשארו בתצוגה של Wrangler.

יצירת צינור עיבוד נתונים של אצווה

ניקיתם את הנתונים והפעלתם טרנספורמציות על קבוצת משנה של הנתונים. עכשיו אפשר ליצור צינור להעברת נתונים (pipeline) של אצווה כדי להריץ טרנספורמציות על מערך הנתונים כולו.

‫Cloud Data Fusion מתרגם את צינור הנתונים שאתם יוצרים ב-Studio לתוכנית Apache Spark שמבצעת טרנספורמציות במקביל באשכול זמני של Managed Service for Apache Spark. התהליך הזה מאפשר לבצע טרנספורמציות מורכבות על כמויות גדולות של נתונים בצורה ניתנת להרחבה ואמינה, בלי צורך לנהל את התשתית.

  1. בדף של Wrangler, לוחצים על Create a pipeline (יצירת צינור).
  2. בוחרים באפשרות Batch pipeline (צינור להעברת נתונים בכמויות גדולות). ייפתח הדף של סטודיו YouTube.
  3. בדף Studio, צומת המקור GCSFile מחובר לצומת Wrangler.

    צומת GCSFile שמחובר לצומת Wrangler

    הטרנספורמציות שהחלתם בדף Wrangler מופיעות בצומת Wrangler בדף Studio.

  4. כדי לראות את הטרנספורמציות שהחלתם, מעבירים את מצביע העכבר מעל הצומת Wrangler ולוחצים על Properties (מאפיינים).

    הטרנספורמציות שהחלתם מופיעות בהנחיות.

    הצגת הטרנספורמציות שהוחלו

  5. לוחצים על אימות.

  6. לוחצים על סגירה.

כדי להחיל עוד טרנספורמציות, לוחצים על Wrangle וחוזרים לדף Wrangler. הטרנספורמציה שהוספתם מופיעה בדף Studio.

לדוגמה, אם אתם מבינים שהעמודה Country לא נחוצה כי הערך שלה הוא תמיד USA. כדי למחוק את העמודה, פועלים לפי השלבים הבאים:

  1. לוחצים על Wrangle.
  2. לוחצים על החץ למטה לצד מדינה ובוחרים באפשרות מחיקת העמודה.
  3. לוחצים על אישור. הדף Wrangler נסגר והחלון Wrangler Properties נפתח בדף Studio. בקטע Directives (הוראות), מופיע drop Country.
  4. לוחצים על סגירה.

קיצור שמות המדינות

מערכת הניווט ברכב המסירה מזהה רק כתובות שמכילות שמות מדינות מקוצרים (CA ולא California), ובנתוני הלקוחות שלכם מופיעים שמות מדינות מלאים.

הטבלה הציבורית state_abbreviations ב-BigQuery מכילה שתי עמודות: אחת עם השמות המלאים של המדינות ואחת עם השמות המקוצרים של המדינות. אפשר להשתמש בטבלה הזו כדי לעדכן את שמות המדינות בנתוני הלקוחות.

צפייה בנתונים של שמות המדינות ב-BigQuery

  1. בכרטיסייה נפרדת, עוברים לדף BigQuery Studio:

    כניסה לדף BigQuery

  2. לוחצים על Create SQL query ומזינים את שאילתת ה-SQL הבאה בעורך השאילתות:

    SELECT * FROM `dis-user-guide.campaign_tutorial.state_abbreviations`
    
  3. לוחצים על Run.

    ב-BigQuery מוצגת רשימה של שמות מדינות והקיצורים שלהם.

גישה לטבלה ב-BigQuery

מוסיפים מקור לצנרת שיקבל גישה לטבלת BigQuery‏ state_abbreviations.

  1. עוברים לדף Cloud Data Fusion Studio ומרחיבים את התפריט מקור.
  2. לוחצים על BigQuery.

    בקנבס מופיע צומת מקור של BigQuery, לצד שני הצמתים האחרים.

  3. מעבירים את מצביע העכבר מעל צומת המקור BigQuery ולוחצים על מאפיינים.

    1. בשדה Dataset Project ID (מזהה פרויקט של מערך נתונים), מזינים dis-user-guide.
    2. בשדה שם הפניה מזינים state_abbreviations.
    3. בשדה Dataset, מזינים campaign_tutorial.
    4. בשדה Table, מזינים state_abbreviations.
  4. כדי לאכלס את הסכימה של הטבלה מ-BigQuery, לוחצים על קבלת סכימה.

  5. לוחצים על סגירה.

צירוף שני מקורות הנתונים

כדי ליצור פלט שמכיל נתוני לקוחות עם שמות מדינות מקוצרים, צריך לצרף את שני מקורות הנתונים: נתוני הלקוחות וקיצורי שמות המדינות.

  1. עוברים לדף Cloud Data Fusion Studio ומרחיבים את התפריט Analytics.
  2. לוחצים על הצטרפות.

    במרחב העבודה מופיע צומת Joiner שמייצג פעולה שדומה ל-SQL Join.

  3. מחברים את הצומת Wrangler ואת הצומת BigQuery לצומת Joiner: גוררים חץ חיבור בקצה הימני של צומת המקור ומשחררים אותו על צומת היעד.

    צירוף צמתי Wrangler ו-BigQuery לצומת Joiner

  4. מציבים את הסמן מעל הצומת Joiner (צירוף) ולוחצים על Properties (מאפיינים).

    1. בקטע Fields, מרחיבים את האפשרויות Wrangler ו-BigQuery.

      1. מבטלים את הסימון של תיבת הסימון state של Wrangler.
      2. מבטלים את הסימון של תיבת הסימון name ב-BigQuery כי רוצים רק את השם המקוצר של המדינה ולא את השם המלא.
      3. משאירים את הסימון בתיבת הסימון קיצור של BigQuery ומשנים את הכינוי ל-State.

        מאפיינים של צומת Joiner

    2. בשדה סוג הצטרפות, משאירים את הערך חיצוני. בקטע Required inputs (קלט נדרש), מסמנים את התיבה Wrangler.

    3. בקטע Join condition, בוחרים באפשרות State עבור Wrangler. ב-BigQuery, בוחרים באפשרות name (שם).

    4. יצירת הסכימה של הצירוף שמתקבל. לוחצים על קבלת סכימה.

    5. לוחצים על אימות.

    6. לוחצים על סגירה.

אחסון הפלט ב-BigQuery

אחסון התוצאה של הצינור בטבלה ב-BigQuery. המקום שבו מאחסנים את הנתונים נקרא יעד.

  1. עוברים לדף Cloud Data Fusion Studio ומרחיבים את Sink.
  2. לוחצים על BigQuery.
  3. מחברים את הצומת Joiner לצומת BigQuery.

    חיבור של צומת Joiner וצומת BigQuery

  4. מעבירים את מצביע העכבר מעל הצומת BigQuery ולוחצים על Properties (מאפיינים).

    1. בשדה Dataset, מזינים dis_user_guide.
    2. בשדה Table, בוחרים באפשרות customer_data_abbreviated_states.
    3. לוחצים על סגירה.

פריסה והפעלה של צינור עיבוד הנתונים

  1. בדף Studio, לוחצים על Name your pipeline (מתן שם לצינור) ומזינים את הערך CampaignPipeline.
  2. לוחצים על Save.
  3. בפינה השמאלית העליונה, לוחצים על פריסה.
  4. אחרי שהפריסה מסתיימת, לוחצים על Run (הפעלה).

הפעלת צינור הנתונים יכולה להימשך כמה דקות. בזמן ההמתנה, אפשר לעקוב אחרי הסטטוס של המעבר בצינור, מהקצאת הרשאות > התחלה > פועל > ביטול הקצאת הרשאות > הושלם.

צפייה בתוצאות

  1. במסוף Google Cloud , עוברים לדף BigQuery:

    כניסה ל-BigQuery

  2. לוחצים על יצירת שאילתת SQL.

  3. מריצים שאילתה על הטבלה customer_data_abbreviated_states:

    SELECT * FROM dis_user_guide.customer_data_abbreviated_states LIMIT 1000
    

    צפייה בתוצאות

יצרתם בהצלחה פייפליין נתונים.

הסרת המשאבים

כדי לא לצבור חיובים לחשבון Google Cloud על המשאבים שבהם השתמשתם בדף הזה, פועלים לפי השלבים הבאים:

מחיקת מערך הנתונים ב-BigQuery

כדי למחוק את מערך הנתונים ב-BigQuery שיצרתם במדריך הזה:

  1. במסוף Google Cloud , עוברים לדף BigQuery.

    כניסה ל-BigQuery

  2. בוחרים את מערך הנתונים dis_user_guide.
  3. לוחצים על מחיקת מערך נתונים.

מחיקת מופע Cloud Data Fusion

פועלים לפי ההוראות כדי למחוק את מופע Cloud Data Fusion.

מחיקת הפרויקט

הדרך הקלה ביותר לבטל את החיוב היא למחוק את הפרויקט שיצרתם בשביל המדריך הזה.

כדי למחוק את הפרויקט:

  1. במסוף Google Cloud , נכנסים לדף Manage resources.

    כניסה לדף Manage resources

  2. ברשימת הפרויקטים, בוחרים את הפרויקט שרוצים למחוק ולוחצים על Delete.
  3. כדי למחוק את הפרויקט, כותבים את מזהה הפרויקט בתיבת הדו-שיח ולוחצים על Shut down.

המאמרים הבאים