העיקרון הזה, שמופיע בעמודה 'מהימנות' בGoogle Cloud מסגרת Well-Architected Framework, כולל המלצות שיעזרו לכם לתכנן ולהריץ בדיקות לשחזור נתונים שאבדו.
העיקרון הזה רלוונטי לתחום ההתמקדות למידה של אמינות.
סקירה כללית של העקרונות
כדי לוודא שהמערכת יכולה להתאושש ממצבים שבהם הנתונים אבדו או נפגמו, צריך להריץ בדיקות לתרחישים האלה. מקרים של אובדן נתונים עשויים להיגרם עקב באג בתוכנה או אסון טבע כלשהו. אחרי אירועים כאלה, צריך לשחזר נתונים מגיבויים ולהפעיל מחדש את כל השירותים באמצעות הנתונים ששוחזרו.
מומלץ להשתמש בשלושה קריטריונים כדי להעריך את ההצלחה או הכישלון של בדיקת שחזור מסוג זה: שלמות הנתונים, יעד משך ההתאוששות (RTO) ויעד נקודת ההתאוששות (RPO). פרטים על מדדי RTO ו-RPO זמינים במאמר בנושא יסודות התכנון של DR.
המטרה של בדיקות שחזור נתונים היא לוודא מעת לעת שהארגון שלכם יכול להמשיך לעמוד בדרישות של המשכיות עסקית. בנוסף למדידת RTO ו-RPO, בדיקת שחזור נתונים צריכה לכלול בדיקה של כל מחסנית האפליקציות וכל שירותי התשתית הקריטיים עם הנתונים ששוחזרו. כך ניתן לוודא שכל האפליקציה שנפרסה פועלת בצורה תקינה בסביבת הבדיקה.
המלצות
כשמתכננים ומריצים בדיקות לשחזור נתונים שאבדו, כדאי לעיין בהמלצות שבקטעי המשנה הבאים.
אימות העקביות של הגיבוי ובדיקת תהליכי השחזור
צריך לוודא שהגיבויים מכילים תמונות מצב עקביות ושימושיות של נתונים שאפשר לשחזר כדי להחזיר את האפליקציות לשירות באופן מיידי. כדי לאמת את תקינות הנתונים, מגדירים בדיקות עקביות אוטומטיות שיפעלו אחרי כל גיבוי.
כדי לבדוק גיבויים, משחזרים אותם בסביבה שאינה סביבת ייצור. כדי לוודא שאפשר לשחזר את הגיבויים ביעילות ושנתוני השחזור עומדים בדרישות האפליקציה, מומלץ לדמות באופן קבוע תרחישי שחזור נתונים. חשוב לתעד את השלבים לשחזור נתונים, ולהכשיר את הצוותים לבצע את השלבים ביעילות במהלך כשל.
תזמון גיבויים קבועים ותכופים
כדי לצמצם את אובדן הנתונים במהלך השחזור ולעמוד ביעדי RPO, חשוב לתזמן גיבויים באופן קבוע. קובעים תדירות גיבוי שתואמת ל-RPO. לדוגמה, אם ה-RPO הוא 15 דקות, צריך לתזמן גיבויים שיפעלו לפחות כל 15 דקות. כדאי לבצע אופטימיזציה של מרווחי הגיבוי כדי להקטין את הסיכון לאובדן נתונים.
להשתמש Google Cloud בכלים כמו Cloud Storage, גיבויים אוטומטיים של Cloud SQL או גיבויים של Spanner כדי לתזמן ולנהל גיבויים. לאפליקציות קריטיות, מומלץ להשתמש בפתרונות גיבוי כמעט רציפים כמו שחזור לנקודת זמן (PITR) ב-Cloud SQL או גיבויים מצטברים למערכי נתונים גדולים.
הגדרה ומעקב של RPO
חשוב להגדיר RPO ברור על סמך הצרכים העסקיים שלכם, ולעקוב אחרי העמידה בו. אם מרווחי הגיבוי חורגים מה-RPO שהוגדר, צריך להשתמש ב-Cloud Monitoring כדי להגדיר התראות.
מעקב אחר תקינות הגיבוי
כדי לעקוב אחרי תקינות הגיבויים ולוודא שהם מאוחסנים במיקומים מאובטחים ואמינים, אפשר להשתמש בGoogle Cloud שירות גיבוי ושחזור מאסון או בכלים דומים. כדי לשפר את העמידות, חשוב לוודא שהגיבויים משוכפלים בכמה אזורים.
תכנון תרחישים מעבר לגיבוי
כדי לשפר את זמן ההתאוששות במקרים קיצוניים, אפשר לשלב בין גיבויים לבין אסטרטגיות להתאוששות מאסון, כמו הגדרות של מעבר פעיל לגיבוי פעיל או שכפול בין אזורים. מידע נוסף זמין במדריך לתכנון תוכנית התאוששות מאסון.