יצירת צינור של קמפיינים לטירגוט

במאמר הזה נסביר איך להשתמש ב-Cloud Data Fusion כדי לנקות, לבצע טרנספורמציה ולעבד נתוני לקוחות, במטרה לבחור מועמדים לקמפיין יעד.


לחצו על תראו לי איך כדי לקרוא הסבר מפורט על המשימה ישירות במסוף Google Cloud :

תראו לי איך


תרחיש

אתם רוצים ליצור חומרי שיווק בהתאמה אישית לקידום קמפיין מתמשך, ואתם רוצים להפיץ את החומרים ישירות לתיבות הדואר הביתיות של הלקוחות שלכם.

יש בקמפיין שתי מגבלות:

  • מיקום: אתם מבצעים משלוחים רק ללקוחות בקליפורניה, בוושינגטון ובאורגון.
  • עלות: כדי לחסוך בדלק, אתם מספקים משלוחים ללקוחות שגרים במקומות שאפשר להגיע אליהם במהירות. אתם מבצעים משלוחים רק ללקוחות שגרים בשדרות.

במדריך הזה מוסבר איך ליצור את רשימת כתובות הלקוחות לקמפיין. במדריך הזה תלמדו:

  1. ניקוי נתוני הלקוחות: סינון לקוחות שגרים בשדרה בקליפורניה, בוושינגטון או באורגון.
  2. יוצרים פייפליין שמבצע את הפעולות הבאות:

    • מצטרף לנתוני הלקוחות המסוננים עם מערך נתונים ציבורי שמכיל קיצורים של שמות מדינות.
    • הנתונים המצורפים והנקיים נשמרים בטבלה ב-BigQuery שאפשר להריץ עליה שאילתות (באמצעות ממשק האינטרנט של BigQuery) או לנתח אותה (באמצעות Data Studio).

מטרות

  • חיבור של Cloud Data Fusion לשני מקורות נתונים
  • החלת טרנספורמציות בסיסיות
  • צירוף של שני מקורות הנתונים
  • כתיבת נתוני הפלט ליעד

לפני שמתחילים

  1. נכנסים לחשבון Google Cloud . אם אתם משתמשים חדשים ב- Google Cloud, צרו חשבון כדי שתוכלו להעריך את הביצועים של המוצרים שלנו בתרחישים מהעולם האמיתי. לקוחות חדשים מקבלים בחינם גם קרדיט בשווי 300$ להרצה, לבדיקה ולפריסה של עומסי העבודה.
  2. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  3. Verify that billing is enabled for your Google Cloud project.

  4. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  5. Verify that billing is enabled for your Google Cloud project.

  6. מפעילים את ממשקי ה-API של Cloud Data Fusion,‏ BigQuery,‏ Cloud Storage ו-Dataproc, אם הם עדיין לא מופעלים.

    תפקידים שנדרשים להפעלת ממשקי API

    כדי להפעיל ממשקי API, נדרשת ההרשאה serviceusage.services.enable. אם יצרתם את הפרויקט, סביר להניח שכבר יש לכם את ההרשאה הזו דרך התפקיד 'בעלים' (roles/owner). אחרת, תוכלו לקבל את ההרשאה הזו דרך התפקיד 'אדמין בממשק Service Usage' (roles/serviceusage.serviceUsageAdmin). איך מקצים תפקידים

    הפעלת ממשקי ה-API

  7. יצירת מכונת Cloud Data Fusion
    במדריך הזה מניחים שאתם משתמשים בחשבון השירות שמוגדר כברירת מחדל ב-Compute Engine.

ניהול הרשאות

ליצור ולהקצות את התפקידים וההרשאות הנדרשים בהתאמה אישית.

יצירת תפקיד בהתאמה אישית והוספת הרשאות

  1. נכנסים לדף Roles במסוף Google Cloud :

    לדף Roles

  2. לוחצים על יצירת תפקיד.

  3. בשדה Title (שם), מזינים Custom Role-Tutorial.

  4. לוחצים על הוספת הרשאות.

  5. בחלון Add permissions, בוחרים את ההרשאות הבאות ולוחצים על Add:

    • bigquery.datasets.create
    • bigquery.jobs.create
    • storage.buckets.create
  6. לוחצים על יצירה.

הקצאת תפקיד בהתאמה אישית לחשבון השירות של Compute Engine שמוגדר כברירת מחדל

  1. עוברים לדף Instances ב-Cloud Data Fusion:

    יצירת מופע

  2. לוחצים על השם של המופע.

  3. רושמים את חשבון השירות שמוגדר כברירת מחדל ב-Dataproc. המידע הזה מופיע בדף הפרטים של המופע.

    הפורמט של שם חשבון השירות של Managed Service for Apache Spark הוא:

    CUSTOMER_PROJECT_NUMBER-compute@developer.gserviceaccount.com.

    מידע נוסף על חשבונות שירות של Managed Service for Apache Spark

  4. נכנסים לדף IAM:

    לדף Roles

  5. בסרגל Filter, מזינים את השם של חשבון השירות שמוגדר כברירת מחדל בשירות המנוהל ל-Apache Spark.

  6. בחשבון השירות של Compute Engine שמוגדר כברירת מחדל, לוחצים על עריכה.

  7. לוחצים על הוספת תפקיד נוסף.

  8. בשדה Select a role (בחירת תפקיד), בוחרים באפשרות Custom Role-Tutorial (תפקיד בהתאמה אישית – הדרכה).

  9. לוחצים על Save.

  10. מוודאים שלחשבון השירות כבר הוקצה התפקיד Cloud Data Fusion Runner.

הכנת נתוני הלקוחות

במדריך הזה נדרשים שני מערכי נתונים של קלט, שניהם מסופקים עם מכונת Cloud Data Fusion:

  • נתוני לקוחות לדוגמה: קובץ CSV בשם customers.csv.
  • קיצורים של שמות מדינות: טבלה ב-BigQuery בשם state_abbreviations.

טעינת נתוני הלקוחות

  1. עוברים לדף Instances ב-Cloud Data Fusion:

    כניסה לדף Instances

  2. במכונת Cloud Data Fusion שבה אתם משתמשים, לוחצים על הצגת המכונה. ממשק האינטרנט של Cloud Data Fusion ייפתח בכרטיסייה חדשה.

  3. לוחצים על Wrangler. הדף Wrangler ייפתח.

  4. בחלונית Connections (קישורים), לוחצים על GCS > Sample Buckets (מאגרי דוגמאות של GCS).

  5. לוחצים על campaign-tutorial.

  6. לוחצים על customers.csv.

  7. בחלון Parsing options (אפשרויות ניתוח), מציינים את הפרטים הבאים:

    • פורמט: csv
    • הפעלת ערך מוצע: False
    • שימוש בשורה הראשונה ככותרת: False
    • File-encoding: UTF-8
  8. לוחצים על אישור. נתוני הלקוחות נטענים בכרטיסייה חדשה ב-Wrangler.

    נטענו נתוני לקוחות

ניקוי נתוני הלקוחות

היא מכילה שתי משימות משנה:

  • הגדרת הסכימה
  • סינון נתוני הלקוחות כדי להציג רק את קהל היעד שאתם צריכים

הגדרת הסכימה

מגדירים את הסכימה של הנתונים על ידי הקצאת שמות מתאימים לעמודות בטבלה. כדי לתת לעמודות, כמו body_1 ו-body_2, שמות אינפורמטיביים יותר, פועלים לפי השלבים הבאים:.

  1. בחלונית השמאלית, לוחצים על הכרטיסייה עמודות.
  2. לוחצים על התפריט הנפתח שמות העמודות ובוחרים באפשרות הגדרת הכל.
  3. בתיבת הדו-שיח Bulk set column names (הגדרת שמות עמודות בכמות גדולה), מזינים את שמות העמודות הבאים, מופרדים באמצעות פסיקים:

    Name,StreetAddress,City,State,Country
    
  4. לוחצים על אישור.

סינון הנתונים

מסננים את הנתונים כך שיוצגו רק לקוחות שגרים בקליפורניה, באורגון או בוושינגטון.

מסירים את כל השורות שמכילות ערכים שונים מאלה של המדינות האלה:

  1. לוחצים על התפריט הנפתח של העמודה מדינה ובוחרים באפשרות סינון.
  2. בחלון המסנן, מבצעים את הפעולות הבאות:

    1. לוחצים על שמירת השורות.
    2. לוחצים על התפריט הנפתח If (אם) ובוחרים באפשרות value matches regex (הערך תואם לביטוי רגולרי).
    3. מזינים את הביטוי הרגולרי הבא:

      ^(California|Oregon|Washington)$
      
    4. לוחצים על אישור.

    הערכים בעמודה State הם California,‏ Oregon או Washington.

מסננים את הנתונים כך שיוצגו רק לקוחות שגרים בשדרות. משאירים רק את הכתובות שמכילות את המחרוזת Avenue:

  1. לוחצים על התפריט הנפתח של העמודה StreetAddress ובוחרים באפשרות Filter (סינון).
  2. בחלון המסנן, מבצעים את הפעולות הבאות:
    1. לוחצים על שמירת השורות.
    2. לוחצים על התפריט הנפתח If (אם), בוחרים באפשרות value contains (הערך מכיל) ומזינים Avenue.
    3. בוחרים באפשרות לא תלוי רישיות.
    4. לוחצים על אישור.

לפני שמבצעים עבודות עיבוד מקבילי על מערך הנתונים כולו, ב-Wrangler מוצגים רק 1,000 הערכים הראשונים של מערך הנתונים. סיננתם חלק מהנתונים, ולכן נשארו רק כמה לקוחות בתצוגה של Wrangler.

יצירת צינור עיבוד נתונים של אצווה

ניקיתם את הנתונים והפעלתם טרנספורמציות על קבוצת משנה של הנתונים. עכשיו אפשר ליצור צינור להעברת נתונים (pipeline) של אצווה כדי להריץ טרנספורמציות על מערך הנתונים כולו.

‫Cloud Data Fusion מתרגם את צינור הנתונים שאתם יוצרים ב-Studio לתוכנית Apache Spark שמבצעת טרנספורמציות במקביל באשכול זמני של Managed Service for Apache Spark. התהליך הזה מאפשר לכם לבצע טרנספורמציות מורכבות על כמויות גדולות של נתונים בצורה ניתנת להרחבה ואמינה, בלי שתצטרכו לטפל בתשתית.

  1. בדף Wrangler, לוחצים על Create a pipeline (יצירת צינור).
  2. בוחרים באפשרות Batch pipeline (צינור עיבוד של נתונים בכמויות גדולות). ייפתח הדף של Studio.
  3. בדף Studio, צומת המקור GCSFile מחובר לצומת Wrangler.

    צומת GCSFile שמחובר לצומת Wrangler

    הטרנספורמציות שהחלתם בדף Wrangler מופיעות בצומת Wrangler בדף Studio.

  4. כדי לראות את הטרנספורמציות שהחלתם, מעבירים את מצביע העכבר מעל הצומת Wrangler ולוחצים על מאפיינים.

    הטרנספורמציות שהחלתם מופיעות בהנחיות.

    הצגת הטרנספורמציות שהוחלו

  5. לוחצים על אימות.

  6. לוחצים על סגירה.

כדי להחיל עוד טרנספורמציות, לוחצים על Wrangle וחוזרים לדף Wrangler. הטרנספורמציה שהוספתם מופיעה בדף Studio.

לדוגמה, אם מבינים שאין צורך בעמודה Country כי הערך הוא תמיד USA. כדי למחוק את העמודה, פועלים לפי השלבים הבאים:

  1. לוחצים על Wrangle.
  2. לוחצים על החץ למטה לצד מדינה ובוחרים באפשרות מחיקת העמודה.
  3. לוחצים על אישור. הדף Wrangler נסגר והחלון Wrangler Properties נפתח בדף Studio. בקטע Directives (הוראות), מופיע drop Country.
  4. לוחצים על סגירה.

קיצור שמות המדינות

מערכת הניווט ברכב המשלוחים שלך מזהה רק כתובות שמכילות שמות מדינות מקוצרים (CA ולא California), אבל נתוני הלקוחות שלך מכילים שמות מדינות מלאים.

הטבלה הציבורית state_abbreviations ב-BigQuery מכילה שתי עמודות: אחת עם השמות המלאים של המדינות ואחת עם השמות המקוצרים של המדינות. אתם יכולים להשתמש בטבלה הזו כדי לעדכן את שמות המדינות בנתוני הלקוחות.

הצגת הנתונים של שמות המדינות ב-BigQuery

  1. בכרטיסייה נפרדת, עוברים לדף BigQuery Studio:

    כניסה לדף BigQuery

  2. לוחצים על Create SQL query ומזינים את שאילתת ה-SQL הבאה בעורך השאילתות:

    SELECT * FROM `dis-user-guide.campaign_tutorial.state_abbreviations`
    
  3. לוחצים על Run.

    ב-BigQuery מוצגת רשימה של שמות המדינות והקיצורים שלהם.

גישה לטבלה ב-BigQuery

מוסיפים מקור לצנרת שיגש לטבלת BigQuery state_abbreviations.

  1. עוברים לדף Cloud Data Fusion Studio ומרחיבים את התפריט מקור.
  2. לוחצים על BigQuery.

    בקנבס מופיע צומת מקור של BigQuery, לצד שני הצמתים האחרים.

  3. מעבירים את מצביע העכבר מעל צומת המקור BigQuery ולוחצים על מאפיינים.

    1. בשדה Dataset Project ID (מזהה פרויקט של מערך נתונים), מזינים את הערך dis-user-guide.
    2. בשדה שם הפניה, מזינים state_abbreviations.
    3. בשדה Dataset, מזינים campaign_tutorial.
    4. בשדה Table, מזינים state_abbreviations.
  4. כדי לאכלס את הסכימה של הטבלה מ-BigQuery, לוחצים על קבלת סכימה.

  5. לוחצים על סגירה.

צירוף של שני מקורות הנתונים

כדי ליצור פלט שמכיל נתוני לקוחות עם שמות מדינות מקוצרים, צריך לצרף את שני מקורות הנתונים: נתוני הלקוחות וקיצורי שמות המדינות.

  1. עוברים לדף Cloud Data Fusion Studio ומרחיבים את התפריט Analytics.
  2. לוחצים על הצטרפות.

    בבד הציור מופיע צומת Joiner שמייצג פעולה שדומה לאיחוד (Join) ב-SQL.

  3. מחברים את הצומת Wrangler ואת הצומת BigQuery לצומת Joiner: גוררים חץ חיבור בקצה הימני של צומת המקור ומשחררים אותו בצומת היעד.

    צירוף צמתי Wrangler ו-BigQuery לצומת Joiner

  4. מעבירים את הסמן מעל הצומת Joiner ולוחצים על Properties (מאפיינים).

    1. בקטע Fields, מרחיבים את האפשרויות Wrangler ו-BigQuery.

      1. מבטלים את הסימון של תיבת הסימון state (מצב) של Wrangler.
      2. מבטלים את הסימון של תיבת הסימון name ב-BigQuery כי רוצים רק את השם המקוצר של המדינה ולא את השם המלא.
      3. משאירים את תיבת הסימון abbreviation (קיצור) של BigQuery מסומנת, ומשנים את הכינוי ל-State.

        מאפיינים של צומת Joiner

    2. בשדה סוג הצטרפות, משאירים את הערך חיצוני. בקטע Required inputs (קלט נדרש), מסמנים את התיבה Wrangler.

    3. בקטע Join condition, בוחרים באפשרות State עבור Wrangler. ב-BigQuery, בוחרים באפשרות name.

    4. יצירת הסכימה של הצירוף שמתקבל. לוחצים על קבלת סכימה.

    5. לוחצים על אימות.

    6. לוחצים על סגירה.

אחסון הפלט ב-BigQuery

מאחסנים את התוצאה של צינור העיבוד בטבלה ב-BigQuery. המקום שבו מאחסנים את הנתונים נקרא יעד.

  1. עוברים לדף Cloud Data Fusion Studio ומרחיבים את Sink.
  2. לוחצים על BigQuery.
  3. מחברים את הצומת Joiner לצומת BigQuery.

    חיבור של צומת Joiner וצומת BigQuery

  4. מעבירים את מצביע העכבר מעל הצומת BigQuery ולוחצים על Properties (מאפיינים).

    1. בשדה Dataset, מזינים dis_user_guide.
    2. בשדה Table, בוחרים באפשרות customer_data_abbreviated_states.
    3. לוחצים על סגירה.

פריסה והפעלה של צינור עיבוד הנתונים

  1. בדף Studio, לוחצים על Name your pipeline (מתן שם לצינור) ומזינים את הערך CampaignPipeline.
  2. לוחצים על Save.
  3. בפינה השמאלית העליונה, לוחצים על פריסה.
  4. אחרי שהפריסה מסתיימת, לוחצים על Run (הפעלה).

הפעלת צינור הנתונים יכולה להימשך כמה דקות. בזמן ההמתנה, אפשר לעקוב אחרי הסטטוס של המעבר בצינור, מהקצאת הרשאות > התחלה > פועל > ביטול הקצאת הרשאות > הושלם.

צפייה בתוצאות

  1. במסוף Google Cloud , עוברים לדף BigQuery:

    כניסה ל-BigQuery

  2. לוחצים על יצירת שאילתת SQL.

  3. מריצים שאילתה על הטבלה customer_data_abbreviated_states:

    SELECT * FROM dis_user_guide.customer_data_abbreviated_states LIMIT 1000
    

    צפייה בתוצאות

יצרתם פייפליין נתונים.

הסרת המשאבים

כדי לא לצבור חיובים לחשבון Google Cloud על המשאבים שבהם השתמשתם בדף הזה, פועלים לפי השלבים הבאים:

מחיקת מערך הנתונים ב-BigQuery

כדי למחוק את מערך הנתונים ב-BigQuery שיצרתם במדריך הזה:

  1. במסוף Google Cloud , עוברים לדף BigQuery.

    כניסה ל-BigQuery

  2. בוחרים את מערך הנתונים dis_user_guide.
  3. לוחצים על מחיקת מערך נתונים.

מחיקת מכונת Cloud Data Fusion

כדי למחוק את מכונת Cloud Data Fusion, פועלים לפי ההוראות הבאות.

מחיקת הפרויקט

הדרך הקלה ביותר לבטל את החיוב היא למחוק את הפרויקט שיצרתם בשביל המדריך הזה.

כדי למחוק את הפרויקט:

  1. במסוף Google Cloud , נכנסים לדף Manage resources.

    כניסה לדף Manage resources

  2. ברשימת הפרויקטים, בוחרים את הפרויקט שרוצים למחוק ולוחצים על Delete.
  3. כדי למחוק את הפרויקט, כותבים את מזהה הפרויקט בתיבת הדו-שיח ולוחצים על Shut down.

המאמרים הבאים