מבוא לצינורות עיבוד נתונים ב-BigQuery

אתם יכולים להשתמש בצינורות של BigQuery כדי לבצע אוטומציה ולייעל את תהליכי הנתונים של BigQuery. בעזרת צינורות עיבוד נתונים, אתם יכולים לתזמן ולהריץ נכסי קוד ברצף כדי לשפר את היעילות ולצמצם את המאמץ הידני.

סקירה כללית

הצינורות מופעלים על ידי Dataform. בנוסף להרצת נכסי קוד, Dataform מעדכן אוטומטית את המטא-נתונים ב-Knowledge Catalog לגבי טבלאות שנוצרו בצינור עיבוד נתונים.

צינור מכיל נכסי קוד אחד או יותר מהסוגים הבאים:

אתם יכולים להשתמש בצינורות עיבוד נתונים כדי לתזמן את ההפעלה של נכסי קוד. לדוגמה, אפשר לתזמן שאילתת SQL שתפעל מדי יום ותעדכן טבלה עם נתוני המקור העדכניים ביותר, שיוכלו לשמש ליצירת לוח בקרה.

בצינור עם כמה נכסי קוד, מגדירים את רצף ההפעלה. לדוגמה, כדי לאמן מודל של למידת מכונה, אפשר ליצור תהליך עבודה שבו שאילתת SQL מכינה את הנתונים, ואז מחברת מחברת עוקבת מאמנת את המודל באמצעות הנתונים האלה.

כשמפעילים הרצה של צינור, BigQuery מבצע את הפעולות לפי הסדר שמוגדר בתלות שלהן. לכל פעולה, BigQuery מבצע את השלבים הבאים:

  1. מריץ את ה-SQL שעבר קומפילציה ב-BigQuery.
  2. עדכון סטטוס הפעולה ביומן הביצוע.
  3. אחרי השלמת פעולה, Dataform מתחיל אוטומטית סנכרון של מטא-נתונים עם Knowledge Catalog. תהליך ההעשרה הזה מעדכן את Knowledge Catalog עם מטא נתונים סמנטיים שמוגדרים בהגדרות SQLX. הסנכרון מתבצע באופן אסינכרוני ומשתמש במנגנון ניסיון חוזר, כדי להבטיח שעדכוני המטא-נתונים לא ישפיעו על זמן האחזור של צינור הנתונים או יובילו לכשלים בתהליך העבודה אם ה-API של Dataplex לא יהיה זמין באופן זמני.

יכולות

אפשר לבצע את הפעולות הבאות בצינור:

מגבלות

הגבלות על צינורות:

  • צינורות זמינים רק במסוף Google Cloud .
  • אחרי שיוצרים צינור, אי אפשר לשנות את האזור שבו הוא מאוחסן.
  • אתם יכולים להעניק למשתמשים או לקבוצות גישה לצינור נתונים נבחר, אבל לא תוכלו להעניק להם גישה למשימות ספציפיות בצינור הנתונים.
  • אם הפעלת צינור מתוזמנת לא מסתיימת לפני תחילת ההפעלה המתוזמנת הבאה, ההפעלה המתוזמנת הבאה מדלגת ומסומנת בשגיאה.

הגדרת אזור ברירת המחדל לנכסי קוד

כל נכסי הקוד החדשים בפרויקט Google Cloud משתמשים באזור ברירת מחדל. אחרי שיוצרים את הנכס, אי אפשר לשנות את האזור שלו.

כדי להגדיר את אזור ברירת המחדל לנכסי קוד חדשים:

  1. עוברים לדף BigQuery.

    כניסה ל-BigQuery

  2. בחלונית הימנית, לוחצים על קבצים כדי לפתוח את דפדפן הקבצים:

    לוחצים על **קבצים** כדי לפתוח את דפדפן הקבצים.

  3. לצד שם הפרויקט, לוחצים על View files panel actions (הצגת פעולות בחלונית הקבצים) > Switch code region (החלפת אזור קוד).

  4. בוחרים את אזור הקוד שרוצים להשתמש בו כברירת מחדל.

  5. לוחצים על Save.

רשימת האזורים הנתמכים מופיעה במאמר בנושא מיקומים ב-BigQuery Studio.

כל נכסי הקוד מאוחסנים באזור ברירת המחדל לנכסי קוד. עדכון האזור שמוגדר כברירת מחדל משנה את האזור של כל נכסי הקוד שנוצרו אחרי העדכון.

מכסות ומגבלות

צינורות נתונים ב-BigQuery כפופים למכסות ולמגבלות של Dataform.

תמחור

הפעלת משימות של צינורות נתונים ב-BigQuery כרוכה בחיובים על מחשוב ואחסון ב-BigQuery. מידע נוסף על התמחור ב-BigQuery

על צינורות שמכילים קובצי notebook חלים חיובים על זמן הריצה ב-Colab Enterprise, בהתאם לסוג המכונה שמוגדר כברירת מחדל. פרטים על התמחור מופיעים במאמר תמחור של Colab Enterprise.

כל הפעלה של צינור נתונים ב-BigQuery מתועדת באמצעות Cloud Logging. רישום ביומן מופעל באופן אוטומטי להפעלות של צינורות נתונים ב-BigQuery, ויכול להיות שתחויבו על כך בחיובים של Cloud Logging. מידע נוסף זמין במאמר בנושא תמחור של Cloud Logging.

המאמרים הבאים