Managed Service for Apache Spark local SSDs

כדי להשלים את דיסק האתחול, אפשר לצרף כונני SSD מקומיים לצמתים הראשיים, לצמתים של העובדים הראשיים ולצמתים של העובדים המשניים באשכול. כשמספקים ל-cluster כונני SSD מקומיים, גם נתוני HDFS וגם נתוני scratch, כמו פלט של shuffle, משתמשים בכונני ה-SSD המקומיים במקום בדיסק המתמיד של האתחול.

  • אחסוני SSD מקומיים יכולים לספק זמני קריאה וכתיבה מהירים יותר מאשר דיסקים מתמידים (ראו ביצועים של אחסוני SSD מקומיים).
  • הגודל של כל כונן SSD מקומי הוא 375GB, אבל אפשר לצרף כמה כונני SSD מקומיים כדי להגדיל את נפח האחסון של ה-SSD (ראו מידע על כונני SSD מקומיים).
  • כל SSD מקומי מותקן ב-/mnt/<id> בצמתים של אשכול Managed Service for Apache Spark.
  • ב-SSD מקומי נעשה שימוש ב-ext4 כמערכת הקבצים שמוגדרת כברירת מחדל.

שימוש ב-SSD מקומי

מסוףGoogle Cloud

יוצרים אשכול ומצרפים כונני SSD מקומיים לצמתים:

  1. פותחים את הדף Managed Service for Apache Spark Create cluster.
  2. לוחצים על הגדרה נוספת כדי להרחיב את הקטע.
  3. עורכים את ההגדרות של עובדים ראשיים ועובדים משניים כדי להגדיר את הגדרות ה-SSD המקומי.
  4. כברירת מחדל, ההגדרות של צומת ה-driver (הראשי) זהות להגדרות של העובד הראשי. בקטע הגדרה נוספת, אפשר ללחוץ על צומת של מנהל התקן כדי לבטל את הסימון של התיבה צומת ברירת המחדל של מנהל ההתקן זהה לצומת העובד הראשי, ואז לציין את ההגדרות של צומת מנהל ההתקן.

פקודה ב-CLI של gcloud

משתמשים בפקודה gcloud dataproc clusters create עם הדגלים --num-master-local-ssds, --num-workers-local-ssds ו---num-secondary-worker-local-ssds כדי לצרף כונני SSD מקומיים לצמתי העובדים הראשיים, הראשוניים והמשניים של האשכול.

אפשר לצרף כונני SSD מקומיים למכונות וירטואליות של Managed Service for Apache Spark באמצעות ממשק SCSI (Small Computer System Interface) או NVME (Non-Volatile Memory Express) (ראו ביצועים של כונני SSD מקומיים). ממשק ברירת המחדל של ה-SSD המקומי במכונת ה-VM באשכול Managed Service for Apache Spark הוא ממשק SCSI. משתמשים בפקודה gcloud dataproc clusters create עם הדגלים --master-local-ssd-interface,‏ --worker-local-ssd-interface ו---secondary-worker-local-ssd-interface כדי לציין את הממשק של ה-SSD המקומי לצמתים הראשיים, לצמתים הראשיים המשניים ולצמתים של העובדים.

לדוגמה:

gcloud dataproc clusters create cluster-name \
    --region=region \
    --num-master-local-ssds=1 \
    --num-worker-local-ssds=1 \
    --num-secondary-worker-local-ssds=1 \
    --master-local-ssd-interface=NVME \
    --worker-local-ssd-interface=NVME \
    --secondary-worker-local-ssd-interface=NVME \
    ... other args ...

‫API בארכיטקטורת REST

מגדירים את השדה numLocalSsds ב-masterConfig,‏ workerConfig וב-secondaryWorkerConfig InstanceGroupConfig בבקשת API של cluster.create כדי לצרף כונני SSD מקומיים לצמתים הראשיים, לצמתים של העובדים הראשיים ולצמתים של העובדים המשניים באשכול.

אפשר לצרף כונני SSD מקומיים למכונות וירטואליות של Managed Service for Apache Spark באמצעות ממשק SCSI (Small Computer System Interface) או NVME (Non-Volatile Memory Express) (ראו ביצועים של כונני SSD מקומיים). ממשק ברירת המחדל של ה-SSD המקומי במכונת ה-VM באשכול Managed Service for Apache Spark הוא ממשק SCSI. מגדירים את השדה localSsdInterface ב-masterConfig,‏ workerConfig ו-secondaryWorkerConfig InstanceGroupConfig בבקשת API של cluster.create כדי לציין את הממשק SCSI או NVME לצירוף כונני SSD מקומיים לצמתים הראשיים, לצמתים של העובדים הראשיים ולצמתים של העובדים המשניים באשכול.