בעיות מוכרות

בדף הזה מתוארות בעיות ידועות שאתם עלולים להיתקל בהן בזמן הפעלת מכונות וירטואליות או אשכולות שעברו אופטימיזציה באמצעות AI. אם יש בעיות במכונות וירטואליות ב-Compute Engine, אפשר לעיין במאמר בנושא בעיות מוכרות ב-Compute Engine.

בעיות

בקטע הבא מפורטות בעיות ידועות ופתרונות עקיפים ל-AI Hypercomputer.

הפרעות בעומסי עבודה במכונות וירטואליות מסוג A4 בגלל בעיות בתוכנת קושחה (firmware) של מעבדי GPU מסוג NVIDIA B200

חברת NVIDIA זיהתה שתי בעיות בקושחה של יחידות עיבוד גרפיות (GPU) מדגם B200, שמשמשות מכונות וירטואליות מדגם A4. הבעיות האלה עלולות לגרום להפרעות בעומסי העבודה, למשל אם הפקודה nvidia-smi לא מגיבה. אם אתם מבחינים בהפרעות בעומסי עבודה במכונות וירטואליות מסוג A4, אתם צריכים לוודא שאחד מהתנאים הבאים מתקיים:

  • זמן הפעולה של ה-VM ‏ (lastStartTimestamp) חורג מ-65 ימים.
  • בנתוני היומן מוצגת הודעת השגיאה Xid 149 שבה מוזכר 0x02a.

אם אחד מהתנאים האלה מתקיים, צריך לאפס את יחידות ה-GPU שמצורפות למכונות הווירטואליות מסוג A4. כדי למנוע שיבושים בעתיד בעומס העבודה בגלל בעיות בתוכנת הקושחה, מומלץ לאפס את ה-GPU לפחות פעם ב-60 יום. מידע נוסף מופיע במאמר בנושא איפוס של יחידות GPU.

יכול להיות ששרת המטא-נתונים יציג מטא-נתונים ישנים של מכונה וירטואלית physicalHost

אחרי שחוויתם שגיאת מארח או השתמשתם באפשרות דיווח על API מארח פגום כדי להעביר מופע של Compute למארח חדש, כשאתם מריצים שאילתה בשרת המטא-נתונים, יכול להיות שיוצגו מטא-נתונים של physicalHost המארח הקודם של מופע ה-Compute.

כדי לעקוף את הבעיה, אפשר לנסות את אחד מהפתרונות הבאים: