טיפים ומושגים מתקדמים בנושא מיזוג

במאמר הזה אנחנו מספקים עצות ומידע מעמיק על מיזוג נתונים, כדי לעזור לכם להבין איך המיזוג עובד ולפתור תרחישי שימוש מורכבים. כדי להפיק את המרב מהמאמר הזה, כדאי להכיר את היסודות של מיזוג נתונים, שמוסברים במאמרים האחרים בנושא הזה.

השילובים צריכים להכיל רק קבוצת משנה של הנתונים הזמינים

מומלץ לכלול רק את השדות הספציפיים שרוצים להציג בתרשימים שמבוססים על מיזוג. למה זה חשוב:

  • מיזוג יכול ליצור מערכי נתונים גדולים מאוד, מה שעלול להוביל לביצועים איטיים ולעלויות גבוהות יותר של שאילתות בשירותים בתשלום כמו BigQuery.
  • בתרשימים שמבוססים על מיזוגים, המערכת מחשבת את כל השורות במיזוג גם אם לא נעשה בהן שימוש בתרשים.
    • לדוגמה, נניח שאתם יוצרים מיזוג שמכיל 10 שדות. לאחר מכן מגדירים תרשים שמשתמש רק באחד מהשדות האלה. ‫Data Studio מחשב את המיזוג של 10 השדות ואז שולח שאילתה לגבי השדה האחד הזה בפלט של המיזוג כדי ליצור את התרשים.
    • הצבירה מחדש מתבצעת רק אם המיזוג מכיל קבוצת משנה של נתוני הבסיס.

שימוש במיזוג כדי לצבור מחדש מדדים

מדדים שאתם כוללים ממקור הנתונים הבסיסי הופכים למספרים לא מצטברים במיזוג. אם המיזוג כולל פחות מהמערך המלא של השדות ממקור הנתונים הבסיסי, המספרים האלה עוברים צבירה מחדש על סמך הנתונים החדשים. שימוש במיזוג באופן הזה יכול להיות שימושי אם אתם צריכים להחיל צבירה שונה על שדה שכבר עבר צבירה, למשל חישוב של ממוצע של ממוצעים.

מידע נוסף זמין במאמר בנושא שימוש במיזוג כדי לצבור מחדש נתונים.

יצירת מיזוגים ממקור נתונים יחיד

לא חייבים להשתמש במקורות נתונים שונים במיזוגים. יכול להיות שיהיה לכם שימושי גם לצבור מחדש נתונים על ידי מיזוג של כמה טבלאות מאותו מקור נתונים.

לדוגמה, נניח שיש לכם מערך נתונים שמכיל נתוני אוכלוסייה לגבי שלושת המחוזות המובילים במדינות הכי מאוכלסות בארה"ב, כמו שמוצג בטבלה הבאה:

מדינה

מחוז

אוכלוסייה (אומדן לשנת 2023)

קליפורניה

מחוז לוס אנג'לס

10,014,009

קליפורניה

מחוז סן דייגו

3,298,634

קליפורניה

מחוז אורנג'

3,186,989

טקסס

מחוז האריס

4,731,145

טקסס

מחוז דאלאס

2,613,539

טקסס

מחוז טארנט

2,110,640

ניו-יורק

מחוז קינגס (ברוקלין)

2,736,074

ניו-יורק

מחוז קווינס

2,405,464

ניו-יורק

מחוז ברונקס

1,418,890

אתם רוצים לחשב את אחוז האוכלוסייה בכל מחוז במדינה, אבל כדי לעשות את זה, אתם צריכים שיהיה לכם שדה נפרד עם סך האוכלוסייה בכל מדינה. המדד הזה לא זמין במערך הנתונים, אבל אפשר לקבל אותו על ידי מיזוג של מקור נתוני האוכלוסייה עם עצמו. כדי לעשות את זה, פועלים לפי השלבים הבאים:

  1. יוצרים מקור נתונים באמצעות מערך הנתונים הבסיסי.
  2. מוסיפים לדוח תרשים שמתבסס על מקור הנתונים הזה.
  3. ליצור מיזוג עם שתי טבלאות. כל טבלה תשתמש באותו מקור נתונים שיצרתם בשלב 1.
    1. בטבלה 1, כוללים את השדות הבאים:
      1. מדינה, מחוז, אוכלוסייה.
      2. משנים את השם של Population ל-CountyPopulation.
    2. בטבלה 2, כוללים רק את השדה Population ומשנים את השם שלו ל-StatePopulation.
  4. בתנאי הצירוף, משתמשים בצירוף Left Outer כדי לקשר בין State בטבלה 1 לבין State בטבלה 2.
  5. לוחצים על Save.
  6. כדי לחזור לכלי הדוחות, לוחצים על X.

לאחר מכן, מוסיפים תרשים חדש (לדוגמה, טבלה) לדוח ובוחרים את המיזוג כמקור הנתונים של התרשים. לשם כך, מבצעים את השלבים הבאים:

  1. מוסיפים לתרשים את השדות מדינה, מחוז, אוכלוסיית המחוז ואוכלוסיית המדינה.
  2. כדי לחשב את אחוז האוכלוסייה במדינה בכל מחוז, מוסיפים לתרשים שדה מחושב שמשתמש בנתונים החדשים אחרי הצבירה מחדש:
    1. בחלונית המאפיינים, לוחצים על הוספת מדד ואז על הוספת שדה.
    2. נותנים שם לשדה (לדוגמה) Percent of State Population (אחוז האוכלוסייה במדינה).
    3. בתיבה נוסחה, מזינים (CountyPopulation / StatePopulation)*100.
    4. (אופציונלי) מגדירים את תבנית התצוגה כדי להציג את ערכי האחוזים ברמה ספציפית (לדוגמה, אחוז (2) לשתי ספרות אחרי הנקודה העשרונית).

בסיום, הטבלה אמורה להיראות בערך כך:

מדינה

מחוז

CountyPopulation

StatePopulation

אחוז מהאוכלוסייה במדינה

קליפורניה

מחוז לוס אנג'לס

10014009

16499632

60.69

טקסס

מחוז האריס

4731145

9455324

‫50.04

קליפורניה

מחוז סן דייגו

3298634

16499632

19.99

קליפורניה

מחוז אורנג'

3186989

16499632

19.32

ניו-יורק

מחוז קינגס (ברוקלין)

2736074

6560428

41.71

טקסס

מחוז דאלאס

2613539

9455324

27.64

ניו-יורק

מחוז קווינס

2405464

6560428

36.67

טקסס

מחוז טארנט

2110640

9455324

‫22.32

ניו-יורק

מחוז ברונקס

1418890

6560428

21.63

סדר הטבלה במיזוג

‫Data Studio בודק את הגדרות הצירוף בתערובת לפי הסדר, החל מההגדרה הימנית ביותר. התוצאות של כל הצטרפות מוחלות על ההצטרפות הבאה משמאל. לדוגמה, במיזוג של שלוש טבלאות, המערכת מעריכה את הגדרת הצירוף בין טבלה 1 (השמאלית ביותר) לטבלה 2 (האמצעית), ואז משתמשת בתוצאות האלה בהגדרת הצירוף בין טבלה 2 לטבלה 3 (הימנית ביותר).

סדר הטבלאות במיזוגים שנוצרו באופן אוטומטי

כשממזגים מבחר של תרשימים, Data Studio יוצר טבלה לכל תרשים ואז מוסיף את השדות בתרשים לטבלה המתאימה. סדר הטבלאות במיזוג תואם לסדר שבו בוחרים את התרשימים: התרשים הראשון שנבחר הופך לטבלה הראשונה (הימנית ביותר), התרשים השני שנבחר הופך לטבלה השנייה וכן הלאה.

בנוסף, Data Studio יוצר באופן אוטומטי הגדרת צירוף לכל טבלה ומשתמש בסוג הצירוף החיצוני השמאלי.

אם הגדרת ברירת המחדל לא מתאימה לכם, או אם אין קשר ברור בין הטבלאות, אתם יכולים לערוך את השילוב כדי להתאים אותו ליעדים שלכם.

הטבלאות נוצרות לפני המיזוג

הנתונים של כל טבלה במיזוג נשאלים לפני שהנתונים האלה מצטרפים למיזוג הסופי. טווח התאריכים, המסננים והשדות המחושבים בטבלה מוחלים על השאילתה שיוצרת את הטבלה לפני שמבצעים הצטרפות. הגורמים האלה יכולים להשפיע על הנתונים שנכללים בטבלאות המיזוג ולשנות את הפלט של המיזוג.

יכול להיות שמיזוגים יכילו פחות שורות מחיבורי SQL

הנתונים של כל טבלה במיזוג מקובצים ומצטברים על סמך המאפיינים שכוללים בטבלה לפני שהנתונים מצורפים למיזוג הסופי. אם המאפיינים שבוחרים לא כוללים מזהה ייחודי לכל רשומה, שורות זהות מכווצות במהלך שלב הטרום-קיבוץ הזה לפני שהטבלאות מצורפות. הצמצום הזה יכול להוביל למספר שורות נמוך יותר ממה שאפשר לקבל מהרצת שאילתת SQL join ישירות על אותם נתונים, כי שאילתות SQL join מעריכות שורות באופן עצמאי לפני הצבירה.

כדי למנוע את כיווץ השורות לפני הזמן וכדי לוודא שהמיזוג ב-Data Studio יפיק ספירות שורות שדומות לאלה שמופקות על ידי הצטרפות SQL, מוסיפים שדה מזהה ייחודי (כמו מפתח ראשי או מזהה שורה ייחודי) לרשימת המאפיינים של כל טבלה בכלי לעריכת מיזוגים. לא צריך להציג את שדה המזהה בתרשימים, אבל הכללתו בהגדרות המיזוג מבטיחה שכל רשומה תטופל כשורה נפרדת במהלך שלב הצבירה מראש.

יכול להיות שמיזוגים יכילו יותר שורות מהנתונים המקוריים

יכול להיות שבתרשים משולב יוצגו יותר נתונים מאשר בתרשימים שמבוססים על מקורות הנתונים הנפרדים שמהם נוצר השילוב. התוצאה יכולה להיות תלויה בנתונים שלכם ובהגדרת הצירוף שנבחרה למיזוג. לדוגמה, צירוף חיצוני שמאלי כולל את כל הרשומות מהטבלה הימנית, וגם את כל הרשומות מהטבלאות שמשמאל שכוללות את אותם ערכים בתנאי הצירוף. אם יש כמה התאמות לתנאי הצירוף, יכול להיות שיופיעו בנתונים המשולבים יותר שורות מאשר במקור הנתונים הימני ביותר.

שילובים ומסננים וטווחי תאריכים מפורשים

יש שתי דרכים להגביל את מספר השורות במיזוגים: שימוש בטווח תאריכים או החלת מסנן. אפשר להגביל את השורות בתרשימים שמבוססים על מיזוג או בטבלאות שמרכיבות את המיזוג. כדאי לחשוב על התהליך כעל תהליך של 'לפני המיזוג' או 'אחרי המיזוג'.

כשמחילים טווח תאריכים או מסנן על טבלה במיזוג, הם חלים לפני שהנתונים מצורפים לטבלאות האחרות במיזוג. השורות שנמצאות מחוץ לטווח התאריכים או שהוחרגו על ידי המסנן לא זמינות לשאילתת הצירוף.

כשמחילים טווח תאריכים או מסנן על תרשים שמבוסס על מיזוג, הם חלים על הנתונים אחרי שהמיזוג נוצר (post-blend).

להבדל הזה יכולה להיות השפעה גדולה על התוצאות שמוצגות בתרשימים, בהתאם לנתונים ולהגדרות של המיזוג.

מיזוגים ומסננים שעוברים בירושה

המיזוגים מקבלים בירושה מסננים ברמת הדוח, הדף או הקבוצה, כל עוד המסנן תואם לנתונים לפני או אחרי המיזוג. אם המסנן תואם למקורות הנתונים הבסיסיים שמשמשים למיזוג, המסנן יפעל על הנתונים לפני המיזוג. אחרת, המסנן פועל על הנתונים אחרי המיזוג. אם המסנן לא תואם לנתונים לפני או אחרי המיזוג, המערכת מתעלמת ממנו.

מידע נוסף על העברת מסננים בירושה

כשמחילים על תרשים שמבוסס על מיזוג נתונים מסנן שעובר בירושה, מערכת Data Studio מעבדת את הנתונים בחמישה שלבים:

(Pre-blend):

  • שלב 1: הנתונים מקובצים ונצברים על סמך המאפיינים שצוינו בחלונית שילוב נתונים.
  • שלב 2: מסנני מאפיינים שעברו בירושה ומסנני מדדים תואמים מוחלים על מקורות הנתונים שנכללים בחלונית שילוב נתונים.

(Blend):

  • שלב 3: הנתונים ממוזגים באמצעות הגדרת האיחוד שצוינה.

(Post-blend):

  • שלב 4: הנתונים מקובצים ונצברים על סמך המאפיינים בתרשים.
  • שלב 5: אם המסננים של המדדים תואמים לנתונים המשולבים, הם יחולו על התרשים.