תחזוקה של מכונות Filestore

בדף הזה מובאת סקירה כללית על תחזוקה של מופעי Filestore. המדריך כולל מידע על קטגוריות תחזוקה, השפעה על רמת השירות, התמדה ברשת ושיטות מומלצות.

סקירה כללית

מערכת Filestore מעדכנת באופן שוטף את המופעים כדי להבטיח ששירות שיתוף הקבצים יהיה אמין, מאובטח ועדכני. עדכוני תחזוקה מתבצעים בדרך כלל כל שבוע עד שבועיים.

התחזוקה של Filestore מנוהלת באופן מלא על ידי Google. אי אפשר להגדיר חלונות זמן מותאמים אישית לתחזוקה, או לדחות או לתזמן מחדש תחזוקה באופן ידני.

עדכוני תחזוקה מחולקים לקטגוריות הבאות:

  • עדכוני תוכנה של Filestore: אופטימיזציות של המערכת, שיפורים בביצועים ותכונות חדשות.
  • תיקונים למערכת ההפעלה: ניטור ותיקון רציפים של מערכות ההפעלה של המכונות הווירטואליות (VM) הבסיסיות כדי להגן מפני נקודות חולשה באבטחה.
  • שדרוגים בתשתית: העברות של מכונות וירטואליות, תחזוקת חומרה ועדכונים ברשת.

ההשפעה של התחזוקה לפי מדרגת שירות

ההשפעה של עדכון תחזוקה תלויה ברמת השירות של המכונה.

בגלל שמופעלת השבתה קצרה של מופעים ברמה Basic במהלך תחזוקה, מומלץ להשתמש ברמה Basic בעיקר לפיתוח, לבדיקות ולעומסי עבודה לא קריטיים. לעומסי עבודה בסביבת ייצור שדורשים זמינות גבוהה וגישה רציפה לקבצים, מומלץ להשתמש ברמות שירות אזוריות, ארגוניות או אזוריות.

רמות שירות של תחום מוגדר, אזור ו-Enterprise

רמות השירות האזורי, האזורי והארגוני משתמשות בשדרוגים ללא הפרעה (NDU).

במהלך התחזוקה, המופעים ברמות האלה נשארים זמינים לחלוטין וממשיכים לטפל בבקשות לקבצים עם זמן השבתה כמעט אפסי. עדכוני תחזוקה מוחלים ברקע, כך שתהליך השדרוג שקוף ללקוחות של מערכת קבצים ברשת (NFS) שמחוברים.

מסלולים בסיסיים

מופעים ברמה Basic מגובים על ידי אחסון בצומת יחיד ללא מעבר אוטומטי לגיבוי במקרה של כשל. כשמתבצעות העברות של מארחים בסיסיים, תיקוני מערכת או עדכוני תוכנה, פעולות הקבצים מושהות באופן זמני עד לסיום העדכון.

במהלך אירוע תחזוקה, מכונות וירטואליות ברמות HDD בסיסי ו-SSD בסיסי לא יהיו זמינות לפרק זמן קצר שנמשך בדרך כלל בין 2 ל-5 דקות.

במהלך חלון הזמן לתחזוקה:

  • פעולות על קבצים, כמו קריאה, כתיבה ורישום של ספריות, מושהות או מוקפאות באופן זמני.
  • לקוחות מחוברים שמשתמשים במנגנוני ניסיון חוזר שמוגדרים כברירת מחדל ממתינים עד שהמופע יחזור להגיב.

התמדה של רשת ומכונה

כתובת ה-IP הפנימית שהוקצתה למופע Filestore שלכם נשארת קבועה לאורך התחזוקה ולא משתנה. לקוחות NFS מחוברים לא צריכים לעדכן את הגדרות ההרכבה או להרכיב מחדש שיתופי קבצים אחרי עדכון.

הסכם רמת שירות (SLA)

בהתאם להסכם רמת השירות (SLA) של Filestore, זמן השבתה שנובע מתחזוקה מתוזמנת לא נכלל בחישובים של זמן ההשבתה.

שיטות מומלצות לטיפול בתחזוקה

אי אפשר לתזמן או לדחות תחזוקה של Filestore, לכן צריך להגדיר את לקוחות ה-NFS והתשתית כך שיטפלו בצורה חלקה במקרים של חוסר זמינות זמני:

  • שימוש בטעינות קשיחות: כשמבצעים טעינה של שיתוף קבצים ב-Filestore בלקוח, צריך לציין את אפשרות הטעינה hard ולא את soft. בחיבור קשיח, אם שרת הקבצים הופך ללא זמין באופן זמני, לקוח ה-NFS מנסה לשלוח בקשות שוב ושוב עד שהשרת מגיב. כך אפשר לשמור על תקינות הנתונים ולמנוע שגיאות קלט/פלט באפליקציה.
  • הגדרת פסק זמן וניסיונות חוזרים בלקוחות NFS: מגדירים אפשרויות של פסק זמן והעברה חוזרת בלקוחות NFS כדי שעיכובים זמניים במהלך תחזוקה לא יגרמו לפסק זמן בלקוח.
  • הטמעה של ניסיונות חוזרים באפליקציה: כדאי להטמיע באפליקציות הלקוח לוגיקה של ניסיונות חוזרים עם השהיה מעריכית לפני ניסיון חוזר (exponential backoff), כדי לטפל בצורה חלקה בעיכובים זמניים באחסון.
  • מעקב אחרי תקינות ותחזוקה של מופעים: אפשר לעקוב אחרי הביצועים והסטטוס של המופעים במסוף Google Cloud או באמצעות Cloud Monitoring. במקרים של מופעים ברמת Basic, יכול להיות שתבחינו בעלייה קצרה בזמן האחזור או בהשהיה זמנית של פעולות בקבצים במהלך חלון העדכון.

המאמרים הבאים