Managed Airflow (דור 3) | Managed Airflow (דור 2) | Managed Airflow (דור 1 מדור קודם)
בדף הזה נסביר את הקשר בין Orchestration Pipelines לבין Managed Airflow.
מידע על Orchestration Pipelines
Orchestration Pipelines הוא מסגרת מאוחדת ודקלרטיבית לאורקסטרציה ולפריסה אוטומטית, שעברה אופטימיזציה לניהול חלק של צינורות עיבוד נתונים ו-AI ב- Google Cloud.
באמצעות Orchestration Pipelines, אתם יכולים להגדיר את צינורות עיבוד הנתונים ואת הגדרות הפריסה שלהם באמצעות שפה ספציפית לדומיין (DSL) מבוססת-YAML. המסגרת הזו מבצעת הפשטה של התשתית הבסיסית, ומאפשרת לכם להתמקד בלוגיקה של זרימות העבודה של הנתונים וה-AI, בזמן ש-Orchestration Pipelines מטפל בפריסה, בניהול הגרסאות ובתיאום.
מידע על סביבות Managed Airflow ב-Orchestration Pipelines
Managed Airflow הוא מנוע התזמור שמריץ את צינורות הנתונים אחרי שהם נפרסים. אתם מקצים סביבת Managed Airflow כחלק מהגדרת צינור עיבוד נתונים. הסביבה הזו נקראת סביבת הפעלה ב-Orchestration Pipelines.
היתרונות של Orchestration Pipelines:
אתם יכולים לאפשר לצוותים בארגון שאין להם מומחיות ב-Airflow ליצור ולהפעיל את תהליכי העבודה שלהם בלי לכתוב DAG או להגדיר את Airflow. לדוגמה, אתם יכולים להריץ מחברת באשכול זמני של Managed Service for Apache Spark ולציין את כל הפרמטרים של התזמון, המשאבים וההגדרה להרצה ב-YAML בלי לכתוב קוד DAG.
כל ההגדרות והפריסות ב-Orchestration Pipelines מבוססות על YAML ופקודות ה-CLI של gcloud. כל ה-DAG-ים של Airflow נוצרים באופן אוטומטי, ולא נדרשת אינטראקציה עם Airflow, עם סביבות Managed Airflow או עם דליים של סביבות. אתם יכולים לפתח ולפרוס את תהליכי העבודה שלכם במאגר Git רגיל שבו נמצאים קובצי הנכסים.
הגדרות ה-YAML פועלות בכל הגרסאות של Airflow. אין צורך לשנות את הקוד כדי להתאים לשינויים בין גרסאות Airflow או להבדלים בחבילות המותקנות. לדוגמה, לא צריך להעביר את צינורות הנתונים אם עוברים מ-Airflow 2 ל-Airflow 3.
צינורות עיבוד נתונים לניהול תהליכים משולבים עם התוסף של ערכת הסוכנים של Google Cloud, כך שאפשר להשתמש בכתיבה ובפתרון בעיות באמצעות סוכנים. אתם יכולים להשתמש בסוכן כדי לכתוב את צינורות עיבוד הנתונים, לפשט את הפריסה ולעקוב אחרי הסטטוס של צינורות עיבוד הנתונים באמצעות אותו תוסף.
איך פועל Orchestration Pipelines
צינורות Orchestration תומכים במגוון פעולות ושירותים, כמו:Google Cloud
- הרצת סקריפטים של PySpark ב-Managed Service for Apache Spark.
- הרצת קובצי מחברת ב-Managed Service for Apache Spark.
- הפעלת שאילתות SQL ב-BigQuery או ב-Managed Service for Apache Spark.
- הפעלת צינורות לעיבוד נתונים ב-Dataform או במסגרת dbt.
- הרצת סקריפטים של Python.
תהליך עבודה אופייני ל-Orchestration Pipelines:
- אתם מגדירים את הצינור כרצף של פעולות שצריך לבצע באמצעות אחד משירותי Google Cloud .
- אתם מגדירים את תצורות המשאבים לפעולות בצינור. לדוגמה, אפשר לציין שפעולה מסוימת צריכה להתבצע באשכול זמני של Managed Service for Apache Spark עם הגדרה ספציפית.
- (אופציונלי) אתם מגדירים משאבים שצריך להקצות להם הרשאות באופן אוטומטי אם הם עדיין לא קיימים, באמצעות המנגנון provisioned resources. לדוגמה, אתם יכולים לציין שצריך ליצור אשכול סטטי של Managed Service for Apache Spark בהגדרה ספציפית.
- מוסיפים למאגר Git את קובץ ההגדרה של צינור הנתונים עם הפעולות שרוצים לבצע.
- מוסיפים נכסים לפעולות נפרדות בצינור (כמו קובצי סקריפט או מחברות) למאגר Git.
מבצעים פריסה של פייפליינים בסביבת Managed Airflow המנוהלת באמצעות פקודה ב-CLI של gcloud. Orchestration Pipelines יוצרת באופן אוטומטי כמה קובצי DAG שמריצים את צינור הנתונים.
בהשוואה ל-DAGs עצמאיים של Airflow, ה-DAGs האלה נוצרים באופן אוטומטי ואין צורך לנהל אותם בשום צורה. אפשר לבדוק את הסטטוס של הרצת הפייפליין ולנהל פייפליינים באמצעות פקודות של ה-CLI של gcloud.
הסביבה שלכם מריצה את צינור עיבוד הנתונים לפי תזמון.
המאמרים הבאים
- יצירת צינורות להנדסת נתונים באמצעות התוסף Google Cloud Data Agent Kit ל-VS Code
- פריסת צינורות עיבוד נתונים לניהול תהליכים
- הקצאת משאבים ב-Orchestration Pipelines