מושגים מרכזיים ב-Managed Service for Apache Spark

במסמך הזה מוסברים המושגים המרכזיים, אבני הבניין הבסיסיות, התכונות העיקריות והיתרונות של Managed Service for Apache Spark. הבנת העקרונות האלה תעזור לכם להשתמש ביעילות ב-Managed Service for Apache Spark למשימות עיבוד הנתונים שלכם.

המודל ללא שרת

Managed Service for Apache Spark serverless הוא מודל מודרני של שירות מנוהל ל-Apache Spark עם הפעלה אוטומטית. הוא מאפשר להריץ משימות בלי להקצות, לנהל או לשנות את גודל התשתית הבסיסית: Managed Service for Apache Spark מטפל בפרטים בשבילכם.

  • אצוות: אצווה (נקראת גם עומס עבודה באצווה) היא המקבילה ללא שרת של משימה ב-Managed Service for Apache Spark. שולחים את הקוד, כמו משימת Spark, לשירות. ‫Managed Service for Apache Spark מספק את המשאבים הנדרשים לפי דרישה, מפעיל את העבודה ואז מפרק אותם. אתם לא יוצרים או מנהלים משאבים של אשכולות או משימות, השירות עושה את העבודה בשבילכם.
  • סשנים אינטראקטיביים: סשנים אינטראקטיביים מספקים סביבה חיה על פי דרישה לניתוח נתונים גישושי, בדרך כלל בתוך מחברת Jupyter. סשנים אינטראקטיביים מספקים נוחות של סביבת עבודה זמנית ללא שרת (serverless), שבה אפשר להריץ שאילתות ולפתח קוד בלי להקצות ולנהל משאבים של אשכולות ומחברות.
  • תבניות של סשנים: תבנית של סשן היא הגדרה לשימוש חוזר שאפשר להשתמש בה כדי להגדיר סשנים אינטראקטיביים. התבנית מכילה הגדרות של סשן, כמו מאפייני Spark ותלות בספריות. משתמשים בתבנית כדי ליצור סביבות אינטראקטיביות לסשנים של פיתוח, בדרך כלל בתוך מחברת Jupyter.

המודל מבוסס-האשכולות

Managed Service for Apache Spark on clusters (שירות מנוהל ל-Apache Spark באשכולות) הוא הדרך הרגילה והממוקדת בתשתית לשימוש ב-Managed Service for Apache Spark. הוא מאפשר לכם שליטה מלאה על קבוצה ייעודית של מכונות וירטואליות למשימות עיבוד הנתונים.

  • אשכולות: אשכול הוא מנוע לעיבוד מידע אישי, שמורכב ממכונות וירטואליות. Google Cloud אתם יוצרים אשכול כדי להריץ מסגרות קוד פתוח כמו Apache Spark ו-Apache Hadoop. יש לכם שליטה מלאה על גודל האשכול, סוגי המכונות וההגדרה.
  • משימות: משימה היא פעולה ספציפית, כמו סקריפט PySpark או שאילתת Hadoop. במקום להריץ משימה ישירות באשכול, שולחים את המשימה אל Managed Service for Apache Spark, שמנהל את ביצוע המשימה בשבילכם. אפשר לשלוח כמה משימות לאשכול.
  • תבניות של תהליכי עבודה: תבנית של תהליך עבודה היא הגדרה לשימוש חוזר שמתזמרת סדרה של משימות (תהליך עבודה). אפשר להגדיר תלות בין משימות, למשל להפעיל משימת למידת מכונה רק אחרי שמשימת ניקוי נתונים מסתיימת בהצלחה. אפשר להפעיל את תהליך העבודה מבוסס התבנית באשכול קיים או באשכול זמני (חולף) שנוצר כדי להפעיל את תהליך העבודה, ואז נמחק אחרי שתהליך העבודה מסתיים. אפשר להשתמש בתבנית כדי להפעיל את תהליך העבודה המוגדר בכל פעם שצריך.
  • מדיניות של שינוי גודל אוטומטי: מדיניות של שינוי גודל אוטומטי מכילה כללים שאתם מגדירים כדי להוסיף או להסיר מכונות עובד מאשכול, על סמך עומס העבודה של האשכול, במטרה לבצע אופטימיזציה דינמית של העלות והביצועים של האשכול.

התאמה אישית של הסביבה

‫Managed Service for Apache Spark on clusters מציע תכונות של אשכולות ורכיבים שאפשר להשתמש בהם כדי להתאים אישית את סביבת האפליקציה.

סביבות פיתוח ונוטבוקים

מסמכי Notebook וסביבות פיתוח משולבות (IDE) של Managed Service for Apache Spark serverless מקושרים לסביבות פיתוח משולבות שבהן אפשר לכתוב ולהריץ את הקוד.

  • BigQuery Studio ו-Workbench: אלה סביבות מאוחדות לניתוח נתונים ול-Notebook. הם מאפשרים לכם לכתוב קוד (לדוגמה, ב-Jupyter notebook) ולהשתמש באשכול של שירות מנוהל ל-Apache Spark או בסשן ללא שרת (serverless) כמנוע קצה עורפי (backend) רב-עוצמה להרצת הקוד במערכי נתונים גדולים.
  • Managed Service for Apache Spark JupyterLab Plugin: התוסף הרשמי הזה של JupyterLabextension משמש כלוח בקרה ל-Managed Service for Apache Spark serverless בסביבת המחברת. הוא מפשט את תהליך העבודה בכך שהוא מאפשר לכם לעיין באשכולות, ליצור ולנהל אותם ולהגיש משימות בלי לצאת מהממשק של Jupyter.
  • ערכת Google Cloud Data Agent ל-VS Code: התוסף הרשמי הזה ל-VS Code מאפשר למדעני נתונים, למהנדסים ולמפתחים לנהל את כל מחזור החיים של עומסי העבודה של הנתונים בסביבת הפיתוח המשולבת שלהם. ערכת Data Agent מספקת תמיכה ב-Data Cloud בשירות המנוהל ל-Apache Spark, ומאפשרת לכם לפתח קוד, ליצור סשנים אינטראקטיביים ולבנות צינורות עיבוד נתונים ישירות מ-VS Code.
  • Managed Service for Apache Spark Connect Python Connector: ספריית Python הזו מייעלת את תהליך השימוש ב-Spark Connect עם Managed Service for Apache Spark. הוא מטפל באימות ובהגדרת נקודות קצה, ולכן הרבה יותר פשוט לחבר את סביבת Python המקומית, כמו מחברת או IDE, לאשכול מרוחק של Managed Service for Apache Spark לפיתוח אינטראקטיבי.

מודל המאגר

‫Managed Service for Apache Spark ב-Google Kubernetes Engine פורס אשכולות וירטואליים של Managed Service for Apache Spark באשכול GKE. בניגוד לאשכולות של Managed Service for Apache Spark, באשכולות וירטואליים של Managed Service for Apache Spark לא מוקצים מכונות וירטואליות נפרדות של master ו-worker. במקום זאת, הם מקצים מאגרי צמתים באשכול GKE. משימות של Managed Service for Apache Spark on GKE מופעלות כ-pods במאגרי הצמתים האלה. מאגרי הצמתים ותזמון הפודים במאגרי הצמתים מנוהלים על ידי Managed Service for Apache Spark ב-GKE.