Managed Airflow (דור 3) | Managed Airflow (דור 2) | Managed Airflow (דור 1 מדור קודם)
בדף הזה נסביר את הקשר בין Orchestration Pipelines לבין Managed Airflow.
מידע על Orchestration Pipelines
Orchestration Pipelines הוא מסגרת מאוחדת ודקלרטיבית לאורקסטרציה ולפריסה אוטומטית, שעברה אופטימיזציה לניהול חלק של צינורות עיבוד נתונים ו-AI ב- Google Cloud.
באמצעות Orchestration Pipelines, אתם יכולים להגדיר את צינורות עיבוד הנתונים ואת הגדרות הפריסה שלהם באמצעות שפה ספציפית לדומיין (DSL) מבוססת-YAML. המסגרת הזו מבצעת הפשטה של התשתית הבסיסית, ומאפשרת לכם להתמקד בלוגיקה של זרימות העבודה של הנתונים וה-AI, בזמן ש-Orchestration Pipelines מטפל בפריסה, בניהול הגרסאות ובתיאום.
מידע על סביבות Managed Airflow ב-Orchestration Pipelines
Managed Airflow הוא מנוע התזמור שמריץ את צינורות הנתונים אחרי שהם נפרסים. אתם מקצים סביבת Managed Airflow כחלק מהגדרת צינור עיבוד נתונים. הסביבה הזו נקראת סביבת הפעלה ב-Orchestration Pipelines.
היתרונות של Orchestration Pipelines:
אתם יכולים לאפשר לצוותים בארגון שאין להם מומחיות ב-Airflow ליצור ולהפעיל את תהליכי העבודה שלהם בלי לכתוב DAG או להגדיר את Airflow. לדוגמה, אתם יכולים להריץ Notebook באשכול זמני של Managed Service for Apache Spark ולציין את כל הפרמטרים של התזמון, המשאבים וההגדרה להרצה ב-YAML, בלי לכתוב קוד DAG.
כל ההגדרות והפריסות ב-Orchestration Pipelines מבוססות על YAML ופקודות ה-CLI של gcloud. כל ה-DAG-ים של Airflow נוצרים אוטומטית, ולא נדרשת אינטראקציה עם Airflow, עם סביבות Managed Airflow או עם דליים של סביבות. אתם יכולים לפתח ולפרוס את תהליכי העבודה שלכם במאגר Git רגיל שבו נמצאים קובצי הנכסים.
הגדרות ה-YAML פועלות בכל הגרסאות של Airflow. אין צורך לשנות את הקוד כדי להתאים לשינויים בין גרסאות Airflow או להבדלים בחבילות המותקנות. לדוגמה, לא צריך להעביר את צינורות הנתונים אם עוברים מ-Airflow 2 ל-Airflow 3.
צינורות תזמור משולבים עם ערכת הסוכנים של Google Cloud, כך שאתם יכולים להשתמש בכתיבה ובפתרון בעיות באמצעות סוכנים. אתם יכולים להשתמש בסוכן כדי לכתוב את צינורות העברת הנתונים, לפשט את הפריסה ולעקוב אחרי הסטטוס של צינורות העברת הנתונים באמצעות סביבת הפיתוח המשולבת (IDE) או ממשק שורת הפקודה (CLI) המועדפים עליכם.
איך פועל Orchestration Pipelines
צינורות Orchestration תומכים במגוון פעולות ושירותים Google Cloud , כמו:
- הרצת סקריפטים של PySpark ב-Managed Service for Apache Spark.
- הרצת קובצי מחברת ב-Managed Service for Apache Spark.
- הפעלת שאילתות SQL ב-BigQuery או ב-Managed Service for Apache Spark.
- הפעלת צינורות לעיבוד נתונים ב-Dataform או במסגרת dbt.
- הרצת סקריפטים של Python.
תהליך עבודה אופייני ל-Orchestration Pipelines:
- אתם מגדירים את הצינור כרצף של פעולות שצריך לבצע באמצעות אחד משירותי Google Cloud .
- אתם מגדירים את תצורות המשאבים לפעולות בצינור. לדוגמה, אפשר לציין שפעולה מסוימת צריכה להתבצע באשכול זמני של Managed Service for Apache Spark עם הגדרה ספציפית.
- (אופציונלי) אתם מגדירים משאבים שצריך להקצות להם הרשאות באופן אוטומטי אם הם עדיין לא קיימים, באמצעות המנגנון provisioned resources. לדוגמה, אפשר לציין שצריך ליצור אשכול סטטי של Managed Service for Apache Spark בהגדרה ספציפית.
- מוסיפים למאגר Git את קובץ ההגדרה של צינור הנתונים עם הפעולות שרוצים לבצע.
- מוסיפים נכסים לפעולות ספציפיות בצינור (כמו קובצי סקריפט או מחברות) למאגר Git.
מבצעים פריסה של פייפליינים בסביבת Managed Airflow המנוהלת באמצעות פקודה ב-CLI של gcloud. Orchestration Pipelines יוצרת באופן אוטומטי כמה קובצי DAG שמריצים את צינור הנתונים.
בהשוואה ל-DAGs עצמאיים של Airflow, ה-DAGs האלה נוצרים באופן אוטומטי ואין צורך לנהל אותם בשום צורה. אפשר לבדוק את הסטטוס של הרצת הפייפליין ולנהל פייפליינים באמצעות פקודות של ה-CLI של gcloud.
הסביבה שלכם מריצה את צינור עיבוד הנתונים לפי תזמון.
מעקב אחרי סטטוס הפייפליין
אפשר לראות את הסטטוס של כל צינורות הנתונים שפועלים בסביבה שלכם ואת היסטוריית ההרצה של צינורות הנתונים ב- Google Cloud console וב-Google Cloud CLI. מידע נוסף מופיע במאמר בנושא ניהול צינורות של תזמור.
המאמרים הבאים
- יצירת צינורות להנדסת נתונים באמצעות התוסף Google Cloud Data Agent Kit ל-VS Code
- פריסת צינורות עיבוד נתונים לניהול תהליכים
- הקצאת משאבים ב-Orchestration Pipelines