כלי ההקצאה של השירות המנוהל ל-Apache Spark ב-Cloud Data Fusion קורא ל-Dataproc API כדי ליצור ולמחוק אשכולות בפרויקטים שלכם ב- Google Cloud. אפשר להגדיר את האשכולות בהגדרות של כלי ההקצאה.
מידע נוסף על תאימות בין גרסאות של Cloud Data Fusion וגרסאות של Managed Service for Apache Spark זמין במאמר תאימות גרסאות.
מאפיינים
| מאפיין (property) | תיאור |
|---|---|
| מזהה הפרויקט | Google Cloud הפרויקט שבו נוצר אשכול Managed Service for Apache Spark. צריך להפעיל בפרויקט את Dataproc API. |
| מפתח לחשבון השירות של היוצר | למפתח חשבון השירות שמועבר למנהל ההקצאות (provisioner) צריכה להיות הרשאה לגשת לממשקי Managed Service for Apache Spark ו-Compute Engine API. מכיוון שמפתח החשבון רגיש, מומלץ לספק אותו באמצעות אחסון מאובטח. אחרי שיוצרים את המפתח המאובטח, אפשר להוסיף אותו למרחב שמות או לפרופיל חישוב של המערכת. בפרופיל מחשוב של מרחב שמות, לוחצים על סמל המגן ובוחרים את המפתח המאובטח. בפרופיל חישוב של המערכת, מזינים את שם המפתח בשדה Secure Account Key. |
| אזור | מיקום גיאוגרפי שבו אפשר לארח את המשאבים, כמו צמתי החישוב של אשכול Managed Service for Apache Spark. |
| תחום (zone) | אזור פריסה מבודד בתוך אזור. |
| רשת | רשת ה-VPC בפרויקט Google Cloud שתשמש ליצירת אשכול של Managed Service for Apache Spark. |
| מזהה פרויקט של מארח רשת | אם הרשת נמצאת בפרויקט אחר, מזינים את המזהה של הפרויקט הזה. Google Cloud ב-VPC משותף, מזינים את מזהה הפרויקט המארח שבו נמצאת הרשת. |
| תת-רשת | רשת המשנה שבה רוצים להשתמש כשיוצרים אשכולות. היא צריכה להיות בתוך הרשת הנתונה ובאזור שבו נמצא האזור. אם השדה הזה יישאר ריק, המערכת תבחר רשת משנה על סמך הרשת והאזור. |
| חשבון שירות של Runner | שם חשבון השירות של המכונות הווירטואליות (VM) של Managed Service for Apache Spark שמשמשות להפעלת תוכניות. אם לא מציינים חשבון שירות, המערכת משתמשת בחשבון השירות שמוגדר כברירת מחדל של Compute Engine. |
| מספר המאסטרים | מספר הצמתים הראשיים באשכול. הצמתים האלה מכילים את YARN Resource Manager, HDFS NameNode וכל מנהלי ההתקנים. הערך חייב להיות 1 או 3. ברירת המחדל היא 1. |
| סוג מכונת מאסטר | סוג המכונה הראשית שבה ייעשה שימוש. בוחרים אחד מסוגי המכונות הבאים:
ב-Cloud Data Fusion בגרסה 6.7.2 ואילך, הגדרת ברירת המחדל היא e2. בגרסה 6.7.1, ברירת המחדל היא n2. בגרסה 6.7.0 ובגרסאות קודמות, ברירת המחדל היא n1. |
| ליבות ראשיות | מספר הליבות הווירטואליות שהוקצו לצומת הראשי. ברירת המחדל היא 2. |
| זיכרון ראשי (GB) | נפח הזיכרון (בג'יגה-בייט) שהוקצה לצומת הראשי. ברירת המחדל היא 8GB. |
| גודל דיסק המאסטר (GB) | גודל הדיסק, בגיגה-בייט, שהוקצה לצומת הראשי. ברירת המחדל היא 1,000GB. |
| סוג דיסק ראשי | סוג דיסק אתחול של צומת ראשי:
ברירת המחדל היא דיסק מתמיד סטנדרטי. |
| סוג מכונת Worker | סוג מכונת העובד שבה ייעשה שימוש. בוחרים אחד מסוגי המכונות הבאים:
ב-Cloud Data Fusion בגרסה 6.7.2 ואילך, הגדרת ברירת המחדל היא e2. בגרסה 6.7.1, ברירת המחדל היא n2. בגרסה 6.7.0 ובגרסאות קודמות, ברירת המחדל היא n1. |
| ליבות של עובדים | מספר הליבות הווירטואליות שהוקצו לצומת עובד. ברירת המחדל היא 2. |
| זיכרון של תהליך Worker (GB) | נפח הזיכרון, בגיגה-בייט, שהוקצה לצומת עובד. ברירת המחדל היא 8GB. |
| גודל הדיסק של העובד (GB) | גודל הדיסק, בגיגה-בייט, שהוקצה לצומת עובד. ברירת המחדל היא 1,000GB. |
| סוג הדיסק של ה-worker | סוג דיסק האתחול של צומת עובד:
ברירת המחדל היא דיסק מתמיד סטנדרטי. |
| שימוש בהתאמה אוטומטית לעומס שהוגדרה מראש | הפעלת השימוש בקנה מידה אוטומטי מוגדר מראש של Managed Service for Apache Spark. |
| מספר העובדים הראשיים | צמתי העובדים מכילים YARN NodeManager ו-HDFS DataNode. ברירת המחדל היא 2. |
| מספר העובדים המשניים | צמתי עובדים משניים מכילים YARN NodeManager, אבל לא HDFS DataNode. הערך הזה מוגדר בדרך כלל לאפס, אלא אם מדיניות של התאמה אוטומטית לעומס מחייבת ערך גבוה יותר. |
| מדיניות התאמה אוטומטית לעומס | הנתיב למזהה מדיניות ההתאמה לעומס או ל-URI של המשאב. למידע על הגדרה ושימוש בהתאמת גודל אוטומטית של Managed Service for Apache Spark כדי לשנות את הגודל של אשכולות באופן אוטומטי ודינמי בהתאם לדרישות של עומסי העבודה, אפשר לעיין במאמרים מתי כדאי להשתמש בהתאמת גודל אוטומטית והתאמת גודל אוטומטית של אשכולות ב-Managed Service for Apache Spark. |
| מטא-נתונים | מטא-נתונים נוספים של מופעים שפועלים באשכול. בדרך כלל אפשר להשתמש בו למעקב אחרי חיובים וביטולי חיובים. מידע נוסף זמין במאמר מטא-נתונים של אשכולות. |
| תגים של רשתות | מקצים תגי רשת כדי להחיל כללי חומת אש על הצמתים הספציפיים של אשכול. תגי רשת חייבים להתחיל באות קטנה באנגלית ויכולים להכיל אותיות קטנות, מספרים ומקפים. תגיות חייבות להסתיים באות קטנה או במספר. |
| הפעלת הפעלה מאובטחת | הגדרה שמאפשרת אתחול מאובטח במכונות וירטואליות של Managed Service for Apache Spark. ברירת המחדל היא False. |
| הפעלת vTPM | ההגדרה הזו מפעילה מודול פלטפורמה מהימנה וירטואלי (vTPM) במכונות הווירטואליות של Managed Service for Apache Spark. ברירת המחדל היא False. |
| הפעלת מעקב אחר תקינות | ההגדרה הזו מפעילה ניטור של תקינות וירטואלית במכונות וירטואליות של Managed Service for Apache Spark. ברירת המחדל היא False. |
| גרסת התמונה | גרסת התמונה של Managed Service for Apache Spark. אם לא מציינים כלום, המערכת בוחרת אחת מהן באופן אוטומטי. אם המאפיין Custom image URI לא מוגדר, המערכת מתעלמת מהמאפיין הזה. |
| URI של תמונה בהתאמה אישית | כתובת ה-URI של תמונת Managed Service for Apache Spark. אם השדה נשאר ריק, המערכת מסיקה את הערך שלו ממאפיין גרסת התמונה. |
| Staging bucket | קטגוריה של Cloud Storage שמשמשת להעברת קבצים זמניים של יחסי תלות במשימות וקבצי תצורה להרצת פייפליינים ב-Managed Service for Apache Spark. |
| Temp bucket | קטגוריה ב-Cloud Storage שמשמשת לאחסון נתונים של אשכולות ומשימות זמניים, כמו קובצי היסטוריה של Spark ב-Managed Service for Apache Spark. המאפיין הזה הוצג ב-Cloud Data Fusion בגרסה 6.9.2. |
| שם מפתח ההצפנה | מפתח ההצפנה בניהול הלקוח (CMEK) שבו נעשה שימוש ב-Managed Service for Apache Spark. |
| היקפי הרשאות OAuth | היקפי ההרשאות של OAuth 2.0 שאולי תצטרכו לבקש כדי לגשת אל ממשקי Google APIs, בהתאם לרמת הגישה שאתם צריכים. Google Cloud היקף הפלטפורמה תמיד נכלל. המאפיין הזה הוצג ב-Cloud Data Fusion בגרסה 6.9.2. |
| פעולות אתחול | רשימה של סקריפטים שיבוצעו במהלך האתחול של האשכול. פעולות ההגדרה הראשונית צריכות להיות ב-Cloud Storage. |
| מאפייני אשכול | מאפייני האשכול מבטלים את מאפייני ברירת המחדל של שירותי Hadoop. מידע נוסף על צמדי מפתח/ערך רלוונטיים זמין במאמר מאפייני אשכול. |
| תוויות נפוצות | תוויות לארגון האשכולות והמשימות של Managed Service for Apache Spark שנוצרים. אפשר להוסיף תוויות לכל משאב ואז לסנן את המשאבים לפי התוויות. המידע על התוויות מועבר למערכת החיוב, כך שהלקוחות יכולים לפרק את החיובים לפי התוויות. |
| זמן ההמתנה המקסימלי | הגדרת Managed Service for Apache Spark למחיקת אשכול אם הוא לא פעיל יותר ממספר הדקות שצוין. בדרך כלל, אשכולות נמחקים מיד אחרי סיום ההרצה, אבל במקרים נדירים המחיקה עלולה להיכשל. מידע נוסף מופיע במאמר פתרון בעיות במחיקת אשכולות. ברירת המחדל היא 30 דקות. |
| דילוג על מחיקת האשכול | האם לדלג על מחיקת האשכול בסיום ההרצה. חובה למחוק את האשכולות באופן ידני. צריך להשתמש באפשרות הזו רק כשמנפים באגים בהרצה שנכשלה. ברירת המחדל היא False. |
| הפעלת השילוב עם Stackdriver Logging | מפעילים את השילוב עם Stackdriver Logging. ברירת המחדל היא True. |
| הפעלת השילוב של Stackdriver Monitoring | מפעילים את השילוב של Stackdriver Monitoring. ברירת המחדל היא True. |
| הפעלת שער רכיבים | מפעילים את שער הרכיבים כדי לגשת לממשקים של האשכול, כמו YARN ResourceManager ו-Spark HistoryServer. ברירת המחדל היא False. |
| העדפה של כתובת IP חיצונית | כשהמערכת פועלת Google Cloud באותה רשת כמו האשכול, היא בדרך כלל משתמשת בכתובת ה-IP הפנימית כשהיא מתקשרת עם האשכול. כדי להשתמש תמיד בכתובת ה-IP החיצונית, מגדירים את הערך הזה ל-True. ברירת המחדל היא False. |
| יצירת השהיה בסקר | מספר השניות להמתנה אחרי יצירת אשכול כדי להתחיל לבצע בדיקות חוזרות כדי לראות אם האשכול נוצר. ברירת המחדל היא 60 שניות. הגדרות הסקר קובעות את התדירות שבה מתבצע סקר של סטטוס האשכולות כשיוצרים ומוחקים אשכולות. אם יש לכם הרבה צינורות שתוזמנו להפעלה באותו הזמן, כדאי לשנות את ההגדרות האלה. |
| יצירת תנודות בסקר | הכמות המקסימלית של תנודות אקראיות, בשניות, שצריך להוסיף לעיכוב כשיוצרים אשכול. אתם יכולים להשתמש במאפיין הזה כדי למנוע הרבה קריאות ל-API בו-זמנית ב- Google Cloud אם יש לכם הרבה צינורות שנקבע להם מועד להפעלה בדיוק באותו זמן. ברירת המחדל היא 20 שניות. |
| מחיקת ההשהיה של הסקר | מספר השניות להמתנה אחרי מחיקת אשכול לפני שמתחילים לבצע בדיקות כדי לראות אם האשכול נמחק. ברירת המחדל היא 30 שניות. |
| מרווח בין סקרים | מספר השניות להמתנה בין בדיקות סטטוס האשכול. ברירת המחדל היא 2. |
מאפיינים של ממשק האינטרנט של פרופיל Managed Service for Apache Spark שמופים למאפייני JSON
| שם המאפיין בממשק המשתמש של פרופיל Managed Service for Apache Spark | שם מאפיין JSON של פרופיל Managed Service for Apache Spark |
|---|---|
| תווית הפרופיל | name |
| שם הפרופיל | label |
| תיאור | description |
| מזהה הפרויקט | projectId |
| מפתח לחשבון השירות של היוצר | accountKey |
| אזור | region |
| תחום (zone) | zone |
| רשת | network |
| מזהה פרויקט של מארח רשת | networkHostProjectId |
| תת-רשת | subnet |
| חשבון שירות של Runner | serviceAccount |
| מספר המאסטרים | masterNumNodes |
| סוג מכונת מאסטר | masterMachineType |
| ליבות ראשיות | masterCPUs |
| זיכרון ראשי (GB) | masterMemoryMB |
| גודל דיסק המאסטר (GB) | masterDiskGB |
| סוג דיסק ראשי | masterDiskType |
| מספר העובדים הראשיים | workerNumNodes |
| מספר העובדים המשניים | secondaryWorkerNumNodes |
| סוג מכונת Worker | workerMachineType |
| ליבות של עובדים | workerCPUs |
| זיכרון של תהליך Worker (GB) | workerMemoryMB |
| גודל הדיסק של העובד (GB) | workerDiskGB |
| סוג הדיסק של ה-worker | workerDiskType |
| מטא-נתונים | clusterMetaData |
| תגים של רשתות | networkTags |
| הפעלת הפעלה מאובטחת | secureBootEnabled |
| הפעלת vTPM | vTpmEnabled |
| הפעלת מעקב אחר תקינות | integrityMonitoringEnabled |
| גרסת התמונה | imageVersion |
| URI של תמונה בהתאמה אישית | customImageUri |
| קטגוריה של Cloud Storage | gcsBucket |
| שם מפתח ההצפנה | encryptionKeyName |
| מדיניות התאמה אוטומטית לעומס | autoScalingPolicy |
| פעולות אתחול | initActions |
| מאפייני אשכול | clusterProperties |
| תוויות | clusterLabels |
| זמן ההמתנה המקסימלי | idleTTL |
| דילוג על מחיקת האשכול | skipDelete |
| הפעלת השילוב עם Stackdriver Logging | stackdriverLoggingEnabled |
| הפעלת השילוב של Stackdriver Monitoring | stackdriverMonitoringEnabled |
| הפעלת שער רכיבים | componentGatewayEnabled |
| העדפה של כתובת IP חיצונית | preferExternalIP |
| יצירת השהיה בסקר | pollCreateDelay |
| יצירת תנודות בסקר | pollCreateJitter |
| מחיקת ההשהיה של הסקר | pollDeleteDelay |
| מרווח בין סקרים | pollInterval |
שיטות מומלצות
כשיוצרים אשכול סטטי לצינורות עיבוד הנתונים, מומלץ לעיין בשיטות המומלצות להגדרת אשכולות.