סקירה כללית על משימות שקשורות לאיכות הנתונים

משימות של איכות נתונים ב-Knowledge Catalog מאפשרות להגדיר ולהריץ בדיקות של איכות נתונים בטבלאות ב-BigQuery וב-Cloud Storage. בנוסף, משימות של איכות נתונים ב-Knowledge Catalog מאפשרות לכם להחיל אמצעי בקרה רגילים על נתונים בסביבות BigQuery.

מתי כדאי ליצור משימות של איכות נתונים ב-Knowledge Catalog

משימות של איכות נתונים ב-Knowledge Catalog יכולות לעזור לכם:

  • אימות נתונים כחלק מצינור לייצור נתונים.
  • חשוב לעקוב באופן שוטף אחרי איכות מערכי הנתונים בהשוואה לציפיות שלכם.
  • יצירת דוחות על איכות הנתונים לצורך עמידה בדרישות רגולטוריות.

יתרונות

  • מפרטים שאפשר להתאים אישית. אתם יכולים להשתמש בתחביר YAML הגמיש מאוד כדי להגדיר את הכללים לאיכות הנתונים.
  • הטמעה ללא שרת. לא צריך להגדיר תשתית כדי להשתמש ב-Knowledge Catalog.
  • העתקה אפסית והעברה אוטומטית. בדיקות YAML מומרות ל-SQL ומועברות ל-BigQuery, כך שלא מתבצעת העתקה של נתונים.
  • בדיקות איכות נתונים שאפשר לתזמן. אפשר לתזמן בדיקות של איכות הנתונים באמצעות מתזמן ללא שרת ב-Knowledge Catalog, או להשתמש ב-Dataplex API דרך מתזמנים חיצוניים כמו Managed Airflow לשילוב צינורות.
  • חוויית שימוש מנוהלת. ב-Knowledge Catalog נעשה שימוש במנוע קוד פתוח לבדיקת איכות הנתונים, CloudDQ, כדי להריץ בדיקות של איכות הנתונים. עם זאת, Knowledge Catalog מספק חוויה מנוהלת חלקה לביצוע בדיקות איכות הנתונים.

איך עובדים עם משימות שקשורות לאיכות הנתונים

הדיאגרמה הבאה מציגה איך פועלות משימות של איכות נתונים ב-Knowledge Catalog:

תמונה

  • קלט ממשתמשים
    • מפרט YAML: קבוצה של קובץ YAML אחד או יותר שמגדירים כללים לאיכות הנתונים על סמך תחביר המפרט. מאחסנים את קובצי ה-YAML בקטגוריה של Cloud Storage בפרויקט. משתמשים יכולים להריץ כמה כללים בו-זמנית, והכללים האלה יכולים לחול על טבלאות שונות ב-BigQuery, כולל טבלאות במערכי נתונים שונים או בפרויקטים שונים של Google Cloud. התקן תומך בהרצות מצטברות רק לצורך אימות נתונים חדשים. כדי ליצור מפרט YAML, אפשר לעיין במאמר בנושא יצירת קובץ מפרט.
    • טבלת תוצאות ב-BigQuery: טבלה שהמשתמש מציין לאחסון התוצאות של אימות איכות הנתונים. הפרויקט שבו נמצאת הטבלה הזו יכול להיות פרויקט שונה מהפרויקט שבו משתמשים במשימת איכות הנתונים של Knowledge Catalog. Google Cloud
  • טבלאות לאימות
    • במפרט YAML, צריך לציין אילו טבלאות רוצים לאמת לפי אילו כללים. זה נקרא גם rule binding. הטבלאות יכולות להיות טבלאות מקוריות של BigQuery או טבלאות חיצוניות של BigQuery ב-Cloud Storage. במפרט YAML אפשר לציין טבלאות בתוך אזור של Knowledge Catalog או מחוצה לו.
    • טבלאות ב-BigQuery וב-Cloud Storage שעוברות אימות בהרצה אחת יכולות להיות שייכות לפרויקטים שונים.
  • משימת איכות נתונים ב-Knowledge Catalog: משימת איכות נתונים ב-Knowledge Catalog מוגדרת באמצעות קובץ בינארי מוכן מראש של CloudDQ PySpark, שמתוחזק, ומקבל כקלט את מפרט ה-YAML ואת טבלת התוצאות ב-BigQuery. בדומה למשימות אחרות ב-Knowledge Catalog, משימת איכות הנתונים ב-Knowledge Catalog פועלת בסביבת Spark ללא שרת, ממירה את מפרט ה-YAML לשאילתות BigQuery ואז מריצה את השאילתות האלה בטבלאות שמוגדרות בקובץ המפרט.

תמחור

כשמריצים משימות של איכות נתונים ב-Knowledge Catalog, מחויבים על השימוש ב-BigQuery וב-Managed Service for Apache Spark (Batches).

  • המשימה של איכות הנתונים ב-Knowledge Catalog ממירה את קובץ המפרט לשאילתות BigQuery ומריצה אותן בפרויקט של המשתמש. מחירון BigQuery

  • ב-Knowledge Catalog נעשה שימוש ב-Spark כדי להריץ את תוכנת מנהל ההתקן CloudDQ בקוד פתוח, שנוצרה על ידי Google, כדי להמיר את המפרט של המשתמש לשאילתות ב-BigQuery. ראו מחירים של Managed Service for Apache Spark.

אין חיובים על שימוש ב-Knowledge Catalog לארגון נתונים או על שימוש בכלי לתזמון ללא שרת ב-Knowledge Catalog לתזמון בדיקות של איכות הנתונים. מחירון Knowledge Catalog

המאמרים הבאים