בתרחיש הזה, אתם מנהלים מסד נתונים שבו נשמרים רשומות לגבי השימוש בשירותים שונים שספק שירותים רפואיים מספק. כדי להקל על השימוש בנתונים, אפשר לעיין בטבלאות כדי לזהות שינויים פוטנציאליים. לפני שמטמיעים את השינויים, צריך לבדוק אם שיפורים כלשהם משפיעים על תהליכי עבודה קיימים, ואם יש צורך בהתאמות נוספות.
במדריך הזה תשתמשו בתיעוד מקורות הנתונים כדי לזהות איך שינויים בנתונים משפיעים על משאבים במורד הזרם ועל תהליכי העבודה שהמשאבים הם חלק מהם.
קדימה, מתחילים
כדי להשלים את תרחיש השימוש, צריך קודם להגדיר את הסביבה ולהריץ את המרות הנתונים. משתמשים בדף דרישות מוקדמות והגדרה כדי לחבר מאגר מרוחק ל-Dataform. המאגר הזה מכיל את הקוד שנדרש להגדרת מערך הנתונים ולשינוי הנתונים.
אחרי שמסיימים את הגדרת הסביבה, אפשר להשתמש ב-BigQuery ובכלי לניתוח מקורות נתונים כדי לעקוב אחרי שינויים בנתונים וההשפעה שלהם על תהליכי העבודה.
ניתוח טרנספורמציות של נתונים באמצעות Lineage Explorer
אחרי שמכינים את מערך הנתונים, אפשר לנתח את ההשפעה של שינוי הנתונים באמצעות הכרטיסייה Lineage ב-BigQuery.
אימות של תקינות הנתונים בעמודות באמצעות תרשימי שושלת
בדוגמה הזו, בודקים את העמודה medicare_participation_indicator שבה מצוין אם רופא או ספק מסכימים לספק שירותים במסגרת Medicare. בתרשים של שרשרת המקורות מוצגות טרנספורמציות של נתונים בין טבלאות נגזרות, שגורמות לשינויים בסוג הנתונים של העמודות:
- במסוף Google Cloud , עוברים לדף BigQuery.
- משתמשים בשדה החיפוש כדי למצוא את הטבלה
physicians_and_other_supplier_2012_original. - לוחצים על הכרטיסייה Lineage (מקורות נתונים).
- בחלונית Lineage Explorer:
- בקטע Column Level Lineage, בוחרים את שם העמודה
medicare_participation_indicatorמהרשימה. - בקטע Direction, בוחרים בכיוון Downstream.
- לוחצים על אישור.
- בקטע Column Level Lineage, בוחרים את שם העמודה
- מרחיבים את נתיב שושלת הנתונים עד שמגיעים אל
vertex_ai_model_final_features. מנתחים את השינויים בנתיב בין הטבלה
supplier_stg3לטבלהsupplier_transform1:
תרשים של מעקב אחר מקורות נתונים בעמודה medicare_participation_indicator- סימון הנתיב Exact Copy מציין שהעמודה עוברת ללא שינוי.
- סימון הנתיב אחר מציין טרנספורמציה. בנתיב הזה, סוג הנתונים
Stringמטופל כמוBoolean.
הנתיב מראה שסוגי הנתונים בעמודה משתנים, ולכן יכול להיות שיהיה צורך לבצע התאמות בתהליכי העבודה שמשתמשים בטבלאות האלה.
זיהוי עמודות מיותרות במורד הזרם
בדוגמה הזו בודקים את העמודה nppes_credentials שבה מפורטים מספרי הזיהוי הלאומיים של הספקים שמופיעים במערכת הלאומית למספור תוכניות וספקים (NPPES):
- במסוף Google Cloud , עוברים לדף BigQuery.
- משתמשים בשדה החיפוש כדי למצוא את הטבלה
physicians_and_other_supplier_2012_original. - לוחצים על הכרטיסייה Lineage (מקורות נתונים).
- בחלונית Lineage Explorer:
- בקטע Column Level Lineage, בוחרים את שם העמודה
nppes_credentialsמהרשימה. - בקטע Direction, בוחרים בכיוון Downstream.
- לוחצים על אישור.
- בקטע Column Level Lineage, בוחרים את שם העמודה
- מרחיבים את הנתיב כדי לבדוק אם יש שושלת במורד הזרם שמובילה אל
vertex_ai_model_final_features.
אם אין שושלת נתונים, יכול להיות שהעמודה הזו לא רלוונטית בתהליך העבודה הספציפי הזה, ואפשר אפילו למחוק אותה.
מידע נוסף על המחשת נתונים באמצעות גרף שושלת הנתונים זמין במאמר בנושא תצוגת גרף שושלת הנתונים.