יצירת מכונה עם Advanced Compute Images

אתם יכולים ליצור מכונה שמשתמשת ב-Advanced Compute Images כדי לספק סביבה אופטימלית לעומסי עבודה של בינה מלאכותית (AI), למידת מכונה (ML) ומחשוב עתיר ביצועים (HPC). אפשר להשתמש בממשקים הבאים:

מידע נוסף על Advanced Compute Images זמין במאמר סקירה כללית של Advanced Compute Images.

לפני שמתחילים

  • אם עדיין לא עשיתם את זה, תצטרכו להגדיר אימות. אימות הוא תהליך שבו מאמתים את הזהות שלכם כדי לקבל גישה לממשקי API ולשירותים של Google Cloud . כדי להריץ קוד או דוגמאות מסביבת פיתוח מקומית, אפשר לבצע אימות ל-Compute Engine באחת מהדרכים הבאות:

    צריך לבחור את הכרטיסייה הרלוונטית לאופן שבו תכננתם להשתמש בדוגמאות בדף הזה:

    המסוף

    כשמשתמשים במסוף Google Cloud כדי לגשת לשירותים Google Cloud ולממשקי ה-API, לא צריך להגדיר אימות.

    gcloud

    1. התקינו את ה-CLI של Google Cloud. אחר כך, מאתחלים את ה-CLI של Google Cloud באמצעות הפקודה הבאה:

      gcloud init

      אם אתם משתמשים בספק זהויות חיצוני (IdP), קודם אתם צריכים להיכנס ל-CLI של gcloud באמצעות המאגר המאוחד לניהול זהויות.

  • הגדרת אזור ותחום כברירת מחדל

התפקידים הנדרשים

כדי לקבל את ההרשאות שנדרשות ליצירת מכונות, צריך לבקש מהאדמין להקצות לכם ב-IAM את התפקיד אדמין מכונות של Compute ‏ (v1) (roles/compute.instanceAdmin.v1) בפרויקט. כדי לקרוא הסבר על מתן תפקידים, ראו איך מנהלים את הגישה ברמת הפרויקט, התיקייה והארגון.

זהו תפקיד שמוגדר מראש וכולל את ההרשאות שנדרשות ליצירת מכונות. כדי לראות בדיוק אילו הרשאות נדרשות, אפשר להרחיב את הקטע ההרשאות הנדרשות:

ההרשאות הנדרשות

כדי ליצור מכונות, צריך את ההרשאות הבאות:

  • ‫compute.instances.create בפרויקט
  • כדי להשתמש באימג' בהתאמה אישית ליצירת המכונה הווירטואלית (VM)‏: ‫compute.images.useReadOnly בקובץ אימג'
  • כדי להשתמש ב-snapshot ליצירת המכונה הווירטואלית: ‫compute.snapshots.useReadOnly בקובץ snapshot
  • כדי להשתמש בתבנית של הגדרות מכונה ליצירת המכונה הווירטואלית: compute.instanceTemplates.useReadOnly בתבנית של הגדרות המכונה
  • כדי לציין רשת משנה למכונה הווירטואלית: ‫compute.subnetworks.use בפרויקט או ברשת המשנה שנבחרה
  • כדי לציין כתובת IP סטטית למכונה הווירטואלית: ‫compute.addresses.use בפרויקט
  • כדי להקצות כתובת IP חיצונית למכונה הווירטואלית כשמשתמשים ברשת VPC: ‫compute.subnetworks.useExternalIp בפרויקט או ברשת המשנה שנבחרה
  • כדי להקצות רשת מדור קודם למכונה הווירטואלית: ‫compute.networks.use בפרויקט
  • כדי להקצות כתובת IP חיצונית למכונה הווירטואלית כשמשתמשים ברשת מדור קודם: ‫compute.networks.useExternalIp בפרויקט
  • כדי להגדיר מטא-נתונים של המכונה הווירטואלית: ‫compute.instances.setMetadata בפרויקט
  • כדי להגדיר תגים למכונה הווירטואלית: ‫compute.instances.setTags במכונה הווירטואלית
  • כדי להגדיר תוויות למכונה הווירטואלית: ‫compute.instances.setLabels במכונה הווירטואלית
  • כדי להגדיר חשבון שירות לשימוש של המכונה הווירטואלית: ‫compute.instances.setServiceAccount במכונה הווירטואלית
  • כדי ליצור דיסק חדש למכונה הווירטואלית: ‫compute.disks.create בפרויקט
  • כדי לצרף דיסק קיים במצב קריאה-בלבד או במצב קריאה וכתיבה: ‫compute.disks.use בדיסק
  • כדי לצרף דיסק קיים במצב קריאה-בלבד: ‫compute.disks.useReadOnly בדיסק

יכול להיות שתקבלו את ההרשאות האלה באמצעות תפקידים בהתאמה אישית או תפקידים מוגדרים מראש אחרים.

מדריך למתחילים

במדריך הזה מתוארים השלבים ליצירת מכונת A3 Ultra או A4 שמשתמשת בתמונות מתקדמות של Compute כדי להגדיר ולהתאים אישית את מערכת ההפעלה של האורח.

דרישות מוקדמות

לפני שיוצרים מכונה, צריך לבצע את המשימות הבאות ליצירת מכונות A3 Ultra ו-A4:

  1. קבלת קיבולת משאבים למופעי A3 Ultra או A4
  2. יצירת רשתות VPC.
  3. אופציונלי: יצירת מדיניות למיקום קומפקטי

יצירת מכונה של Compute Engine באמצעות Advanced Compute Images

אחרי שביצעתם את המשימות הנדרשות, אתם יכולים להשתמש באחת מהשיטות הבאות כדי ליצור את המכונה.

המסוף

  1. נכנסים לדף Create an instance במסוף Google Cloud .

    כניסה לדף Create an instance

    אם מתבקשים, בוחרים פרויקט ולוחצים על המשך. מופיע הדף Create an instance ובו החלונית Machine configuration.

  2. בחלונית Machine configuration:

    1. בשדה Name (שם), מציינים שם למופע של המחשוב. מידע נוסף מופיע במאמר מוסכמות למתן שמות למשאבים.
    2. בוחרים Region ו-Zone למכונה. אם שריינתם את משאבי המחשוב, האזור והתחום שתבחרו צריכים להתאים לאזור ולתחום של השריון.

    3. לוחצים על הכרטיסייה GPUs ומבצעים את הפעולות הבאות:

      1. ברשימה GPU type, בוחרים את סוג ה-GPU.
        • למופעי A4, בוחרים באפשרות NVIDIA B200.
        • במקרים של מכונות וירטואליות מסוג A3 Ultra, בוחרים באפשרות NVIDIA H200 141GB.
      2. ברשימה Number of GPUs בוחרים באפשרות 8.
      3. אופציונלי: בוחרים סוג מכונה אחר.
  3. בתפריט הניווט, לוחצים על מערכת הפעלה ואחסון. בחלונית מערכת הפעלה ואחסון שמופיעה, מבצעים את השלבים הבאים:

    1. לוחצים על Change. מופיעה החלונית דיסק אתחול עם הכרטיסייה Public images.
    2. ברשימת מערכת הפעלה בוחרים באפשרות Advanced Compute Images.
    3. ברשימה Version בוחרים את גרסת מערכת ההפעלה.
    4. אופציונלי: ברשימה Boot disk type, בוחרים את סוג דיסק האתחול.
    5. אופציונלי: מציינים מאפיינים נוספים לדיסק האתחול, כמו גודל הדיסק.
    6. אופציונלי: כדי לראות אפשרויות הגדרה מתקדמות, מרחיבים את הקטע Show advanced configurations.
    7. כדי לאשר את האפשרויות של דיסק האתחול ולחזור לחלונית מערכת ההפעלה והאחסון, לוחצים על בחירה.
  4. בתפריט הניווט, לוחצים על Networking (רשת). החלונית Networking מופיעה.

  5. אופציונלי: כדי להגדיר גישה למופע מחוץ ל- Google Cloud, מבצעים את השלבים הבאים:

    1. עוברים לקטע Firewall.
    2. כדי לאפשר תעבורת HTTP או HTTPS למופע של Compute, בוחרים באפשרות Allow HTTP traffic או באפשרות Allow HTTPS traffic.

      ‫Compute Engine מוסיף תג רשת למכונת החישוב ויוצר את כלל חומת האש המתאים לתעבורת נתונים נכנסת, שמאפשר את כל תעבורת הנתונים הנכנסת ב-tcp:80 (HTTP) או ב-tcp:443 (HTTPS). תג הרשת משייך את כלל חומת האש למופע. מידע נוסף זמין במאמר סקירה כללית של כללי חומת האש במסמכי התיעוד של Cloud Next Generation Firewall.

  6. כדי ליצור multi-NIC, מבצעים את השלבים הבאים בחלונית Networking. אם מדובר במופע עם כרטיס רשת יחיד, מדלגים על השלבים האלה.

    1. בקטע Network interfaces (ממשקי רשת), מבצעים את השלבים הבאים:
    2. מוחקים את ממשק הרשת שמוגדר כברירת מחדל. כדי למחוק את הממשק, לוחצים על Delete.
    3. לוחצים על Add a network interface. משתמשים באפשרות הזו כדי להוסיף ממשקי רשת שמצורפים לרשתות ה-VPC שיצרתם בקטע הקודם. כשמוסיפים את ממשקי הרשת, חשוב לזכור את הדברים הבאים:

      • לממשק רשת שמשמש לתקשורת בין מארחים, בוחרים רשת VPC רגילה ותת-רשת מהרשימות Network ו-Subnetwork, ומגדירים את הרשימה Network interface card ל-gVNIC.

      • עבור ממשק רשת שמשמש לתקשורת בין GPU ל-GPU, בוחרים את רשת ה-VPC ואת רשת המשנה של RoCE מהרשימות Network ו-Subnetwork, ומגדירים את הרשימה כרטיס רשת ל-MRDMA עבור ממשקי הרשת האלה.

  7. בתפריט הניווט, לוחצים על מתקדם. לאחר מכן, מבצעים את השלבים הבאים בהתאם למודל ההקצאה שבו רוצים להשתמש.

    Flex-start

    1. בקטע Provisioning model, ברשימה VM provisioning model, בוחרים באפשרות Flex-start.
    2. בשדה Enter number of hours, מזינים את משך הזמן המקסימלי שרוצים שמכונת ה-Compute Engine תפעל. הערך חייב להיות בין 0.01 (0.01 שעות, או 36 שניות) לבין 168 (168 שעות, או שבעה ימים).

    3. בוחרים באפשרות הגדרת זמן המתנה ליצירת מכונה וירטואלית.

      בהתאם לדרישות האזוריות של עומס העבודה, מציינים את אחד משני משכי הזמן הבאים כדי להגדיל את הסיכוי שהבקשה ליצירת מכונה וירטואלית תצליח:

      • עומסי עבודה עם דרישות מחמירות לגבי אזורים: אם עומס העבודה מחייב ליצור את המכונה הווירטואלית באזור ספציפי, צריך לציין משך זמן בין 90 שניות ל-שעתיים. משך זמן ארוך יותר מגדיל את הסיכוי להשיג משאבים.
      • עומסי עבודה בלי דרישות מחמירות לגבי אזורים: אם אפשר להריץ את המכונה הווירטואלית בכל אזור, מציינים משך זמן של 0 שניות או מבטלים את הסימון בתיבה Set a wait time for VM creation. הפעולה הזו מציינת ש-Compute Engine יקצה משאבים רק אם הם זמינים באופן מיידי. אם הבקשה ליצירת מכונה וירטואלית נכשלת כי המשאבים לא זמינים, צריך לנסות שוב את הבקשה באזור אחר.

    4. בשדה On VM termination, בוחרים אם לעצור או למחוק את מכונת ה-Compute בסיום משך ההפעלה שלה:

      • כדי למחוק את המופע, לוחצים על מחיקה.
      • כדי לעצור את המופע, לוחצים על עצירה.

    הזמנה מראש

    1. לוחצים על בחירת הזמנה. הפעולה הזו פותחת חלונית עם רשימה של הזמנות זמינות באזור שבחרתם. ברשימת ההזמנות, מבצעים את הפעולות הבאות:

      1. בוחרים את ההזמנה שרוצים להשתמש בה עבור מכונת החישוב. אפשר גם לבחור משבצת ספציפית בתוך ההזמנה.
      2. לוחצים על בחירה.

    כרטיס Spot

    1. בקטע Provisioning model בוחרים באפשרות Spot מהרשימה VM provisioning model.
    2. אופציונלי: כדי לבחור את פעולת הסיום שמתרחשת כש-Compute Engine מפקיע את ה-VM במודל Spot, מבצעים את השלבים הבאים:

      1. מרחיבים את הקטע VM provisioning model advanced settings (הגדרות מתקדמות של מודל הקצאת משאבים למכונה וירטואלית).
      2. ברשימה On VM termination בוחרים באחת מהאפשרויות הבאות:
      3. כדי לעצור את ה-VM במודל Spot במהלך ההפקעה, בוחרים באפשרות Stop (ברירת המחדל).
      4. כדי למחוק את ה-VM במודל Spot כשהיא מפסיקה לפני הזמן, בוחרים באפשרות Delete.
  8. כדי ליצור את המכונה ולהפעיל אותה, לוחצים על Create.

gcloud

כדי ליצור את המכונה הווירטואלית, משתמשים בפקודה gcloud compute instances create.

הפרמטרים שצריך לציין תלויים באפשרות הצריכה שבה אתם משתמשים לפריסה הזו. בוחרים את הכרטיסייה שמתאימה לאפשרות הצריכה שלכם.

הזמנה

לפני שמריצים את הפקודה, כדאי לעיין בכל השלבים הבאים כדי להחליט אם לכלול דגלים נוספים.

gcloud compute instances create INSTANCE_NAME  \
    --machine-type=MACHINE_TYPE \
    --image-family=IMAGE_FAMILY \
    --image-project=IMAGE_PROJECT \
    --zone=ZONE \
    --boot-disk-type=hyperdisk-balanced \
    --boot-disk-size=DISK_SIZE \
    --scopes=cloud-platform \
    --network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-0,subnet=GVNIC_NAME_PREFIX-sub-0 \
    --network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-1,subnet=GVNIC_NAME_PREFIX-sub-1,no-address 
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-0,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-1,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-2,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-3,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-4,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-5,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-6,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-7,no-address \
    --reservation-affinity=specific \
    --reservation=RESERVATION \
    --provisioning-model=RESERVATION_BOUND \
    --instance-termination-action=TERMINATION_ACTION \
    --maintenance-policy=TERMINATE \
    --restart-on-failure

כך עושים את זה:

  1. מחליפים את מה שכתוב בשדות הבאים:

    • ‫INSTANCE_NAME: שם ה-VM.
    • ‫MACHINE_TYPE: סוג המכונה שבה רוצים להשתמש עבור המכונה הווירטואלית. מידע נוסף זמין במאמר סוגי מכונות עם GPU במאמרי העזרה של Compute Engine.
    • ‫IMAGE_FAMILY: משפחת קובצי האימג' של קובץ האימג' של מערכת ההפעלה שבו רוצים להשתמש. רשימה של כל מערכות ההפעלה הנתמכות מופיעה במאמר מערכות הפעלה נתמכות.
    • ‫IMAGE_PROJECT: מזהה הפרויקט של תמונת מערכת ההפעלה.
    • ‫ZONE: האזור שבו סוג המכונה שרוצים להשתמש בה זמין. כדי לציין מדיניות למיקום קומפקטי, צריך להשתמש באזור שנמצא באותו אזור כמו המדיניות למיקום קומפקטי. מידע על אזורים זמין במאמר זמינות של GPU לפי אזורים ואזורי זמינות.
    • ‫DISK_SIZE: גודל דיסק האתחול ב-GB. למידע נוסף, אפשר לעיין במאמרים מגבלות הגודל של Google Cloud Hyperdisk או מגבלות הגודל של Persistent Disk, בהתאם לסוג הדיסק.
    • ‫GVNIC_NAME_PREFIX: התחילית של השם שציינתם כשיצרתם את רשתות ה-VPC הרגילות ואת רשתות המשנה שמשתמשות ב-gVNIC.
    • ‫RDMA_NAME_PREFIX: תחילית השם שציינתם כשייצרתם את רשתות ה-VPC ואת תת-הרשתות שמשתמשות בכרטיסי NIC של RDMA.
    • ‫RESERVATION: שם ההזמנה או בלוק ספציפי בהזמנה. כדי לראות את שם ההזמנה או את הבלוקים הזמינים, אפשר לעיין במאמר בנושא הצגת קיבולת מוזמנת. בהתאם לדרישות שלכם לגבי מיקום המופע, בוחרים באחת מהאפשרויות הבאות:
      • כדי ליצור את המכונה בכל בלוק:

        projects/RESERVATION_OWNER_PROJECT_ID/reservations/RESERVATION_NAME

        בנוסף, כדי ליצור כמה מופעים באותו בלוק, צריך להחיל את אותה מדיניות מיקום קומפקטית שמציינת מיקום משותף של בלוק (maxDistance=2) כשיוצרים כל מופע. ‫Compute Engine מחיל את המדיניות על שמירת המקום ויוצר מכונות באותו בלוק.

      • כדי ליצור את המופע בבלוק ספציפי:

        projects/RESERVATION_OWNER_PROJECT_ID/reservations/RESERVATION_NAME/reservationBlocks/RESERVATION_BLOCK_NAME
    • ‫TERMINATION_ACTION: אם המכונה הווירטואלית ב-Compute Engine תופסק (STOP) או תימחק (DELETE) בסיום תקופת שמירת המקום.

  2. אופציונלי: כדי להשתמש במדיניות למיקום קומפקטי, מוסיפים את הדגל הבא:

      --resource-policies=POLICY_NAME
    

    מחליפים את מה שכתוב בשדות הבאים:

    • ‫POLICY_NAME: השם של מדיניות המיקום הקומפקטי.
  3. מריצים את הפקודה.

Flex-start

לפני שמריצים את הפקודה, כדאי לעיין בכל השלבים הבאים כדי להחליט אם לכלול דגלים נוספים.

gcloud compute instances create INSTANCE_NAME  \
    --machine-type=MACHINE_TYPE \
    --image-family=IMAGE_FAMILY \
    --image-project=IMAGE_PROJECT \
    --zone=ZONE \
    --boot-disk-type=hyperdisk-balanced \
    --boot-disk-size=DISK_SIZE \
    --scopes=cloud-platform \
    --network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-0,subnet=GVNIC_NAME_PREFIX-sub-0 \
    --network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-1,subnet=GVNIC_NAME_PREFIX-sub-1,no-address 
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-0,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-1,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-2,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-3,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-4,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-5,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-6,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-7,no-address \
    --provisioning-model=FLEX_START \
    --request-valid-for-duration=REQUEST_VALID_FOR_DURATION \
    --max-run-duration=MAX_RUN_DURATION \
    --instance-termination-action=TERMINATION_ACTION \
    --maintenance-policy=TERMINATE

כך עושים את זה:

  1. מחליפים את מה שכתוב בשדות הבאים:

    • ‫INSTANCE_NAME: שם ה-VM.
    • ‫MACHINE_TYPE: סוג המכונה שבה משתמשים למכונה הווירטואלית. מידע נוסף זמין במאמר סוגי מכונות GPU במסמכי התיעוד של Compute Engine.
    • ‫IMAGE_FAMILY: משפחת קובצי האימג' של מערכת ההפעלה שבה רוצים להשתמש. רשימה של כל מערכות ההפעלה הנתמכות מופיעה במאמר מערכות הפעלה נתמכות.
    • ‫IMAGE_PROJECT: מזהה הפרויקט של קובץ האימג' של מערכת ההפעלה.
    • ‫ZONE: האזור שבו זמין סוג המכונה שרוצים להשתמש בו. כדי לציין מדיניות למיקום קומפקטי, צריך להשתמש באזור באותו מחוז כמו המדיניות למיקום קומפקטי. מידע על אזורים זמין במאמר זמינות של GPU לפי אזורים ואזורי זמינות.
    • ‫DISK_SIZE: גודל דיסק האתחול ב-GB. למידע נוסף, קראו את המאמר מגבלות הגודל של Google Cloud Hyperdisk או את המאמר מגבלות הגודל של Persistent Disk, בהתאם לסוג הדיסק.
    • ‫GVNIC_NAME_PREFIX: תחילית השם שציינתם כשאתם יוצרים את רשתות ה-VPC הרגילות ואת רשתות המשנה שמשתמשות ב-gVNIC.
    • ‫RDMA_NAME_PREFIX: תחילית השם שציינתם כשייצרתם את רשתות ה-VPC ואת תת-הרשתות שמשתמשות בכרטיסי NIC של RDMA.
    • ‫REQUEST_VALID_FOR_DURATION: משך הזמן שבו הבקשה ליצירת המכונה הווירטואלית נשארת בתוקף. הערך צריך להיות בפורמט של מספר הימים, השעות, הדקות או השניות, ואחריו d, h, m ו-s בהתאמה. לדוגמה, מציינים 30m ל-30 דקות או 1h2m3s לשעה אחת, שתי דקות ו-3 שניות.

      בהתאם לדרישות האזוריות של עומס העבודה, מציינים את אחד משני משכי הזמן הבאים כדי להגדיל את הסיכוי שהבקשה ליצירת מכונה וירטואלית תצליח:

      • עומסי עבודה עם דרישות מחמירות לאזורים: אם עומס העבודה מחייב ליצור את ה-VM באזור ספציפי, צריך לציין משך זמן בין 90 שניות (90s) לשעתיים (2h). ככל שמשך הזמן ארוך יותר, כך גדלים הסיכויים לקבל משאבים.
      • עומסי עבודה בלי דרישות מחמירות לגבי אזורים: אם אפשר להריץ את ה-VM בכל אזור, מציינים משך זמן של אפס שניות (0s). הפעולה הזו מציינת ש-Compute Engine מקצה משאבים רק אם הם זמינים באופן מיידי. אם הבקשה ליצירת מכונה וירטואלית נכשלת כי המשאבים לא זמינים, צריך לנסות שוב את הבקשה באזור אחר.
    • ‫MAX_RUN_DURATION: משך הזמן שבו רוצים שהמכונות הווירטואליות המבוקשות יפעלו. צריך להגדיר את הערך כמספר הימים, השעות, הדקות או השניות, ואחריו d,‏ h,‏ m ו-s בהתאמה. הערך צריך להיות בין 10 דקות לשבעה ימים.

    • ‫TERMINATION_ACTION: מציין אם Compute Engine מפסיק (STOP) או מוחק (DELETE) את המכונה הווירטואלית בסוף משך ההפעלה שלה.

  2. אופציונלי: כדי להשתמש במדיניות למיקום קומפקטי, מוסיפים את הדגל הבא:

      --resource-policies=POLICY_NAME
    

    מחליפים את מה שכתוב בשדות הבאים:

    • ‫POLICY_NAME: השם של מדיניות המיקום הקומפקטי.
  3. מריצים את הפקודה.

Spot

לפני שמריצים את הפקודה, צריך לעיין בכל השלבים הבאים כדי להחליט אם לכלול דגלים נוספים.

gcloud compute instances create INSTANCE_NAME  \
    --machine-type=MACHINE_TYPE \
    --image-family=IMAGE_FAMILY \
    --image-project=IMAGE_PROJECT \
    --zone=ZONE \
    --boot-disk-type=hyperdisk-balanced \
    --boot-disk-size=DISK_SIZE \
    --scopes=cloud-platform \
    --network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-0,subnet=GVNIC_NAME_PREFIX-sub-0 \
    --network-interface=nic-type=GVNIC,network=GVNIC_NAME_PREFIX-net-1,subnet=GVNIC_NAME_PREFIX-sub-1,no-address 
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-0,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-1,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-2,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-3,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-4,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-5,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-6,no-address \
    --network-interface=nic-type=MRDMA,network=RDMA_NAME_PREFIX-mrdma,subnet=RDMA_NAME_PREFIX-mrdma-sub-7,no-address \
    --provisioning-model=SPOT \
    --instance-termination-action=TERMINATION_ACTION \
    --maintenance-policy=TERMINATE \
    --no-restart-on-failure

כך עושים את זה:

  1. מחליפים את מה שכתוב בשדות הבאים:

    • ‫INSTANCE_NAME: שם ה-VM.
    • ‫MACHINE_TYPE: סוג המכונה שבה רוצים להשתמש עבור המכונה הווירטואלית. מידע נוסף זמין במאמר סוגי מכונות עם GPU במאמרי העזרה של Compute Engine.
    • ‫IMAGE_FAMILY: משפחת התמונות של תמונת מערכת ההפעלה שרוצים להשתמש בה. רשימה של כל מערכות ההפעלה הנתמכות מופיעה במאמר מערכות הפעלה נתמכות.
    • ‫IMAGE_PROJECT: מזהה הפרויקט של תמונת מערכת ההפעלה.
    • ‫ZONE: האזור שבו זמין סוג המכונה שרוצים להשתמש בו. כדי לציין מדיניות למיקום קומפקטי, צריך להשתמש באזור באותו מחוז כמו המדיניות למיקום קומפקטי. מידע על אזורים זמין במאמר זמינות של GPU לפי אזורים ואזורי זמינות.
    • ‫DISK_SIZE: גודל דיסק האתחול ב-GB. למידע נוסף, קראו את המאמר מגבלות הגודל של Google Cloud Hyperdisk או את המאמר מגבלות הגודל של Persistent Disk, בהתאם לסוג הדיסק.
    • ‫GVNIC_NAME_PREFIX: תחילית השם שציינתם כשאתם יוצרים את רשתות ה-VPC הרגילות ואת רשתות המשנה שמשתמשות ב-gVNIC.
    • ‫RDMA_NAME_PREFIX: תחילית השם שציינתם כשייצרתם את רשתות ה-VPC ואת תת-הרשתות שמשתמשות בכרטיסי NIC של RDMA.
    • ‫TERMINATION_ACTION: הפעולה שצריך לבצע כש-Compute Engine מפקיע את המכונה, STOP (ברירת המחדל) או DELETE.

  2. אופציונלי: כדי להשתמש במדיניות למיקום קומפקטי, מוסיפים את הדגל הבא:

      --resource-policies=POLICY_NAME
    

    מחליפים את מה שכתוב בשדות הבאים:

    • ‫POLICY_NAME: השם של מדיניות המיקום הקומפקטי.
  3. מריצים את הפקודה.

אחרי זמן מה, יצירת מופע המחשוב מסתיימת. כדי לוודא את הגדרות המופע ולראות את הסטטוס שלו, מריצים את הפקודה הבאה:

gcloud compute instances describe INSTANCE_NAME

הגדרת VM במודל Spot

אם יצרתם VM במודל Spot, מבצעים את השלבים הבאים:

גישה למכונה

אחרי שיוצרים את המכונה, היא מתחילה לפעול באופן אוטומטי. כדי לגשת למופע, מבצעים אחת מהפעולות הבאות:

המסוף

  1. נכנסים לדף VM instances במסוף Google Cloud .

    כניסה לדף VM instances

  2. לוחצים על השם של מכונת החישוב.

  3. בקטע גישה מרחוק, לוחצים על הרשימה הנפתחת הראשונה ובוחרים איך רוצים לגשת למכונה.

מפתחות ה-SSH מועברים על ידי Compute Engine ונוצר משתמש. מידע נוסף זמין במאמר התחברות למכונות וירטואליות של Linux.

gcloud

כדי לגשת למכונה באמצעות SSH, משתמשים בפקודה gcloud compute ssh:

gcloud compute ssh INSTANCE_NAME --zone ZONE

מפתחות ה-SSH מועברים על ידי Compute Engine ונוצר משתמש. מידע נוסף זמין במאמר התחברות למכונות וירטואליות של Linux.

הסרת המשאבים

כדי להימנע מחיובים בחשבון Google Cloud על המשאבים שבהם השתמשתם במדריכים למתחילים האלה, מוחקים את כל מופעי המחשוב ואת כל המשאבים המצורפים שיצרתם.

המסוף

  1. נכנסים לדף VM instances במסוף Google Cloud .

    כניסה לדף VM instances

  2. בוחרים את המופעים שרוצים למחוק.

  3. לוחצים על מחיקה.

  4. בתיבת הדו-שיח, מבצעים את הפעולות הבאות:

    1. אופציונלי: כדי למחוק את המופעים בלי לכבות אותם בצורה מסודרת, או כדי להפסיק כיבוי מסודר שמתבצע כרגע, מסמנים את התיבה דילוג על כיבוי מסודר (אם רלוונטי).

    2. כדי לאשר, לוחצים על מחיקה.

  5. כדי למחוק את הדיסקים שבהם נעשה שימוש במופעים שנמחקו, עוברים לדף Disks (דיסקים) ומבצעים את השלבים הבאים:

    לפתיחת הדף Disks

    1. בוחרים את הדיסקים שרוצים למחוק. לדיסקים שבוחרים לא יכול להיות ערך בעמודה In use by.

    2. לוחצים על מחיקה.

    3. כדי לאשר, לוחצים על מחיקה.

gcloud

כדי למחוק מכונה וירטואלית אחת או יותר באותו אזור, משתמשים בפקודה gcloud compute instances delete. כדי לכפות את המחיקה של הדיסקים שמצורפים למופע אחד או יותר, צריך לכלול את הדגל --delete-disks:

gcloud compute instances delete INSTANCE_NAMES \
        --delete-disks=DELETE_DISK_TYPE \
        --zone=ZONE

מחליפים את מה שכתוב בשדות הבאים:

  • ‫INSTANCE_NAMES: רשימה של שמות מופרדים ברווחים של מופעים – לדוגמה, instance-01 instance-02 instance-03.

  • ‫ZONE: האזור שבו נמצאים המופעים.

  • ‫DELETE_DISK_TYPE: מציינים אחד מהערכים הבאים:

    • כדי למחוק אחסון מתמיד מצורף של אתחול ושל לא אתחול: all
    • כדי למחוק רק את האחסון המתמיד של האתחול המצורף: boot
    • כדי למחוק רק אחסון מתמיד שאינו ניתן לאתחול: data

יצירת תמונה בהתאמה אישית על סמך Advanced Compute Images

אתם יכולים ליצור קובץ אימג' בהתאמה אישית שמבוסס על קובץ Advanced Compute Images. אחר כך תוכלו להשתמש בתמונה בהתאמה אישית כשתיצרו מכונות Compute חדשות לעומסי העבודה ולאפליקציות שלכם.

כדי ליצור תמונה בהתאמה אישית, מבצעים את הפעולות הבאות:

  1. מגדירים מיקום אחסון לתמונה. כדי ליצור, לשנות ולמחוק קובצי אימג' של מערכות הפעלה שמאוחסנים ב-Cloud Storage, צריך לקבל את התפקיד roles/compute.storageAdmin.

  2. יצירת מכונה של Compute Engine באמצעות Advanced Compute Images.

  3. מתאימים אישית את מערכת ההפעלה של האורח לפי הצורך של מכונת ה-Compute Engine.

  4. עוצרים את המכונה הווירטואלית כדי למנוע כתיבה לדיסקים. אם אי אפשר לעצור את המופע, צריך לבצע את השלבים במאמר צמצום כתיבת נתונים לדיסק אחסון מתמיד (persistent disk).

  5. משביתים את אפשרות המחיקה האוטומטית לדיסק האתחול.

  6. יוצרים תמונה בהתאמה אישית באמצעות דיסק האתחול של מכונת ה-Compute שלכם כדיסק המקור. אפשר לעשות זאת באמצעות מסוףGoogle Cloud או Google Cloud CLI.

    המסוף

    1. נכנסים לדף Images במסוף Google Cloud .

      כניסה לדף Images

    2. לוחצים על יצירת תמונה.

    3. מציינים שם לתמונה.

    4. בקטע Source disk, בוחרים את השם של דיסק האתחול של מכונת ה-Compute שמשתמשת ב-Advanced Compute Images.

      אם המכונה לא נעצרה, בוחרים באפשרות Keep instance running כדי לאשר שרוצים ליצור את קובץ האימג' בזמן שהמכונה פועלת. כבר הייתם אמורים להשלים את השלבים לצמצום הכתיבה לדיסק האתחול.

    5. ברשימה הנפתחת Based on source disk location (default), מציינים את המיקום שבו רוצים לאחסן את קובץ האימג' בהתאמה אישית. לדוגמה, מציינים us כדי לאחסן את התמונה us במספר אזורים בארה"ב, או us-central1 כדי לאחסן את התמונה המותאמת אישית באזור us-central1.

      אם לא תבחרו אזור, Compute Engine יאחסן את התמונה באזור המרובה הקרוב ביותר למיקום המקור של התמונה המותאמת אישית.

    6. אופציונלי: מציינים מאפיינים אחרים לתמונה:

      • משפחה: משפחת התמונות שאליה התמונה החדשה שייכת.
      • תיאור: תיאור של התמונה המותאמת אישית.
      • ‫Label: תווית לקיבוץ משאבים.
    7. מציינים את מפתח ההצפנה. אתם יכולים לבחור בין מפתחGoogle-owned and Google-managed encryption key לבין מפתח Cloud Key Management Service (Cloud KMS). אם לא מצוין מפתח הצפנה, התמונות מוצפנות באמצעות Google-owned and Google-managed encryption key.

    8. כדי ליצור את התמונה, לוחצים על יצירה.

    gcloud

    משתמשים בפקודה gcloud compute images create כדי ליצור קובץ אימג' בהתאמה אישית.

    הדגל --force הוא דגל אופציונלי שמאפשר ליצור את התמונה ממופע פעיל. כברירת מחדל, אי אפשר ליצור קובצי אימג' ממכונות פועלות. מציינים את הדגל הזה רק אם בטוחים שרוצים ליצור את התמונה בזמן שהמופע פועל.

    gcloud compute images create IMAGE_NAME \
        --source-disk=SOURCE_DISK \
        --source-disk-zone=ZONE \
        [--family=IMAGE_FAMILY] \
        [--storage-location=LOCATION] \
        [--force]
    

    מחליפים את מה שכתוב בשדות הבאים:

    • ‫IMAGE_NAME: שם לתמונה החדשה
    • ‫SOURCE_DISK: הדיסק שממנו רוצים ליצור את קובץ האימג'
    • ‫ZONE: האזור שבו נמצא הדיסק
    • ‫IMAGE_FAMILY: אופציונלי: דגל שמציין לאיזו משפחת קובצי אימג' שייך קובץ האימג' הזה
    • ‫LOCATION: אופציונלי: דגל שמאפשר לציין את האזור או את מספר האזורים שבהם התמונה מאוחסנת. לדוגמה, אפשר לציין us כדי לאחסן את התמונה במספר אזורים us, או לציין us-central1 כדי לאחסן אותה באזור us-central1. אם לא תבחרו מיקום, Compute Engine ישמור את קובץ האימג' באזור במספר אזורים שהכי קרוב למיקום המקור של קובץ האימג'.

מידע נוסף על יצירת תמונות בהתאמה אישית זמין במאמר יצירת תמונות בהתאמה אישית.

שיתוף התמונה

אחרי שיוצרים תמונה בהתאמה אישית, אפשר לשתף אותה בין פרויקטים. אם אתם מאפשרים למשתמשים מפרויקט אחר להשתמש בתמונות בהתאמה אישית, הם יכולים לגשת לתמונות האלה על ידי ציון פרויקט התמונות בבקשה שלהם.

שימוש ב-Advanced Compute Images עם תבניות של הגדרות מכונה

אתם יכולים ליצור תבנית של הגדרות מכונה שמציינת קובץ Advanced Compute Images, ואז להשתמש בתבנית כדי:

מגבלות על יצירת תבניות של הגדרות מכונה

חשוב לשים לב למגבלות הבאות כשיוצרים תבנית של הגדרות מכונה:

  • אפשר להשתמש ב-VPC משותף בממשקים שהם לא nic0 לתבניות של הגדרות מכונה ב-CLI של gcloud וב-REST, אבל לא במסוףGoogle Cloud .
  • אי אפשר לעדכן תבנית של הגדרות מכונה קיימת או לשנות תבנית של הגדרות מכונה אחרי שהיא נוצרה. אם תבנית של הגדרות מכונה לא עדכנית או שצריך לשנות את ההגדרות, יוצרים תבנית חדשה.
  • אם רוצים לציין משפחת תמונות בתבנית של הגדרות מכונה, אי אפשר להשתמש במסוף Google Cloud . במקום זאת, אפשר להשתמש ב-Google Cloud CLI או ב-REST.
  • אם רוצים לציין דיסקים אזוריים במקום דיסקים אזוריים בתבנית של מכונה, אי אפשר להשתמש במסוף Google Cloud . במקום זאת, אפשר להשתמש ב-Google Cloud CLI או ב-REST.
  • אפשר להשתמש בתבנית של הגדרות מכונה כדי ליצור מכונות עם דיסק אתחול של Hyperdisk Balanced שנמצא בStorage Pool, אבל רק אם ה-Storage Pool נמצא באותו תחום (zone) כמו המכונה.
  • אי אפשר להשתמש בתבניות של הגדרות מכונה גלובליות כדי ליצור מכונות עם דיסקים שאינם דיסקי אתחול שנמצאים ב-Storage Pool.
  • כדי ליצור תבנית של הגדרות מכונה אזורית, סוג ה-GPU שאתם מציינים בתבנית צריך להיות זמין לפחות בתחום (zone) אחד באזור שצוין.

יצירת תבנית של הגדרות מכונה

אפשר לציין בתבנית של הגדרות מכונה את רוב מאפייני המכונה שאפשר לציין בבקשה ליצירת מכונה נפרדת, כולל מטא-נתונים של מכונה, סקריפטים לטעינה בזמן ההפעלה, דיסקים אחסון מתמידים (persistent disk) וחשבונות שירות. המידע שחובה לציין בתבנית של הגדרות מכונה כולל את סוג המכונה, דיסק האתחול והרשת.

אפשר ליצור תבנית של הגדרות מכונה אזורית או גלובלית שמשתמשת ב-Advanced Compute Images באמצעות מסוף Google Cloud או Google Cloud CLI.

כדי ליצור תבנית של הגדרות מכונה, לחשבון המשתמש שלכם צריכות להיות כל ההרשאות שנדרשות להפעלת ה-method‏ instanceTemplates.insert.

בקטעים הבאים מוסבר איך ליצור תבנית של הגדרות מכונה לשימוש עם קבוצות מופעי מכונה מנוהלים (MIG), מכונות Compute נפרדות או מקומות שמורים. כדי ליצור תבנית של הגדרות מכונה לשימוש עם AI Hypercomputer, צריך לפעול לפי ההוראות במאמר יצירת קבוצת מכונות מנוהלת (MIG) שעברה אופטימיזציה ל-AI עם סוג מכונה A4 או A3 Ultra.

יצירת משאבים נוספים שנדרשים למופעי A3 ultra או A4

לפני שיוצרים תבנית של הגדרות מכונה למכונות שמשתמשות ב-Advanced Compute Images, צריך קודם ליצור את המשאבים שתציינו בתבנית של הגדרות המכונה. כדי ליצור את המשאבים האלה, צריך להשלים את המשימות שמפורטות בקטע דרישות מוקדמות.

יצירת תבנית של הגדרות מכונה שמציינת תמונה של Advanced Compute Images

אפשר ליצור את תבנית של הגדרות מכונה באמצעות Google Cloud המסוף או פקודות של ה-CLI של gcloud.

המסוף

  1. נכנסים לדף Instance templates במסוף Google Cloud .

    כניסה לדף Instance templates

  2. לוחצים על יצירת תבנית של הגדרות מכונה.

  3. בשדה Name, מזינים שם לתבנית של הגדרות מכונה.

  4. בוחרים את המיקום באופן הבא:

    1. כדי להשתמש בתבנית של הגדרות מכונה באזורים שונים, בוחרים באפשרות Global (ברירת מחדל).
    2. כדי לצמצם את התלות בין אזורים, בוחרים באפשרות אזורי ואז בוחרים את האזור שבו רוצים ליצור את תבנית של הגדרות מכונה.
  5. בקטע Machine configuration מבצעים את הפעולות הבאות:

    1. לוחצים על הכרטיסייה GPUs.
    2. ברשימה GPU type, בוחרים את סוג ה-GPU. במכונות A4, בוחרים באפשרות NVIDIA B200, ובמכונות A3 Ultra בוחרים באפשרות NVIDIA H200 141GB.
    3. ברשימה Number of GPUs, בוחרים באפשרות 8.
    4. אופציונלי: בוחרים סוג מכונה שונה מברירת המחדל.
  6. בקטע Boot disk (דיסק אתחול), לוחצים על Change (שינוי) ומבצעים את הפעולות הבאות:

    1. ברשימה מערכת הפעלה, בוחרים באפשרות Advanced Compute Images.
    2. ברשימה Version, בוחרים את גרסת מערכת ההפעלה.
    3. אופציונלי: מציינים מאפיינים נוספים לדיסק האתחול, כמו גודל הדיסק.
  7. לוחצים על Create כדי ליצור את התבנית של הגדרות המכונה.

gcloud

כדי ליצור תבנית של הגדרות מכונה אזורית או גלובלית, משתמשים בפקודה instance-templates create. כדי להגדיר את האזור של תבנית של הגדרות מכונה אזורית, צריך להשתמש בדגל --instance-template-region.

כשיוצרים תבנית של הגדרות מכונה למכונות GPU, צריך להגדיר את האפשרות --maintenance-policy לערך TERMINATE.

  • יוצרים תבנית של הגדרות מכונה אזורית באמצעות הפקודה הבאה.

    gcloud compute instance-templates create INSTANCE_TEMPLATE_NAME \
      --instance-template-region=REGION \
      --accelerator=count=8,type=GPU_TYPE \
      --machine-type=MACHINE_TYPE \
      --image-project=advanced-compute-images \
      --image-family=IMAGE_FAMILY \
      --maintenance-policy=TERMINATE
    
  • יוצרים תבנית גלובלית של הגדרות מכונה באמצעות הפקודה הבאה:

    gcloud compute instance-templates create INSTANCE_TEMPLATE_NAME
      --accelerator=count=8,type=GPU_TYPE \
      --machine-type=MACHINE_TYPE \
      --image-project=advanced-compute-images \
      --image-family=IMAGE_FAMILY \
      --maintenance-policy=TERMINATE
    

מחליפים את מה שכתוב בשדות הבאים:

  • ‫INSTANCE_TEMPLATE_NAME: שם לתבנית של הגדרות המכונה.
  • ‫REGION: בתבניות של הגדרות מכונה אזוריות, זהו האזור שבו התבנית נוצרת.
  • ‫GPU_TYPE: סוג ה-GPU שבו משתמשים במכונות המחשוב. כשמשתמשים ב-Advanced Compute Images, צריך לציין nvidia-b200 עבור מכונות וירטואליות מסוג A4 או nvidia-h200-141gb עבור מכונות וירטואליות מסוג A3 Ultra.
  • ‫MACHINE_TYPE: סוג המכונה של מופע ה-Compute. כדי להשתמש ב-Advanced Compute Images, צריך לציין סוג מכונה A3 Ultra או A4.
  • ‫IMAGE_FAMILY: מציינים אחת מהאפשרויות הבאות:
    • ‫IMAGE_FAMILY: משפחה של תמונות. הערך הזה מציין את גרסת תמונת מערכת ההפעלה העדכנית ביותר באותה משפחה. לדוגמה, אפשר לציין aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64.
    • ‫IMAGE: גרסה ספציפית של קובץ האימג' של מערכת ההפעלה, לדוגמה aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64-v20260427-1. כדי לציין גרסה ספציפית של קובץ אימג' של מערכת ההפעלה במקום משפחת תמונות, צריך להשתמש בדגל --image במקום בדגל --image-family.

אפשר להוסיף עד 15 דיסקים משניים שאינם דיסקים לאתחול. מציינים את הדגל --create-disk לכל דיסק משני שיוצרים.

  • כדי ליצור דיסקים משניים מתמונה ציבורית או מתמונה בהתאמה אישית, מציינים את המאפיינים image ו-image-project לכל דיסק בדגל --create-disk.
  • כדי ליצור דיסק ריק, לא כוללים את המאפיינים image או image-project
  • אפשר גם לכלול מאפיינים לדיסק size ו-type.

רשימה של כל פקודות המשנה והדגלים הזמינים מופיעה בחומר העזר בנושא instance-templates.

המאמרים הבאים

* כדאי לעיין בתרחישים בסיסיים ליצירת קבוצות של מופעי מכונה מנוהלים (MIG). * כך בודקים את הסטטוס של מכונה כדי לדעת מתי היא מוכנה לשימוש. * איך מתחברים למכונה