הסבר על ההשפעה של כשלים ב-Google Distributed Cloud

‫Google Distributed Cloud נועד להגביל את היקף התקלות ולתת עדיפות לפונקציונליות שקריטית להמשכיות עסקית. במסמך הזה מוסבר איך הפונקציונליות של האשכולות מושפעת כשיש כשל. המידע הזה יכול לעזור לכם לתת עדיפות לתחומים שבהם צריך לפתור בעיות.

הפונקציונליות המרכזית של Google Distributed Cloud כוללת את הקטגוריות הבאות:

  • הפעלת עומסי עבודה: אפשר להמשיך להפעיל עומסי עבודה קיימים. זהו השיקול החשוב ביותר לשמירה על המשכיות עסקית. גם אם יש בעיה באשכול, יכול להיות שעומסי העבודה הקיימים ימשיכו לפעול ללא הפרעה.
  • ניהול עומסי עבודה: אתם יכולים ליצור, לעדכן ולמחוק עומסי עבודה. זהו השיקול השני בחשיבותו להרחבת עומסי עבודה כשיש עלייה בתנועה, גם אם יש בעיה באשכול.
  • ניהול של אשכולות משתמשים: אתם יכולים לנהל צמתים, לעדכן, לשדרג ולמחוק אשכולות משתמשים. הנושא הזה פחות חשוב מהשיקולים לגבי מחזור החיים של האפליקציה. אם יש קיבולת זמינה בצמתים הקיימים, חוסר היכולת לשנות את אשכולות המשתמשים לא משפיע על עומסי העבודה של המשתמשים.
  • ניהול אשכולות אדמין: אתם יכולים לעדכן ולשדרג את אשכול האדמין.
    • בפריסות שבהן נעשה שימוש באשכולות נפרדים לאדמין ולמשתמשים, זהו השיקול הכי פחות חשוב כי באשכול האדמין לא מתארחות עומסי עבודה של משתמשים. אם יש בעיה באשכול האדמין, עומסי העבודה של האפליקציות באשכולות אחרים ממשיכים לפעול ללא הפרעה.
    • אם משתמשים במודלים אחרים של פריסה, כמו היברידי או עצמאי, אשכול האדמין מריץ עומסי עבודה של אפליקציות. אם יש בעיה באשכול האדמין ומישור הבקרה מושבת, אי אפשר גם לנהל את עומסי העבודה של האפליקציות או את רכיבי אשכול המשתמשים.

בקטעים הבאים נשתמש בקטגוריות האלה של פונקציונליות עיקרית כדי לתאר את ההשפעה של סוגים ספציפיים של תרחישי כשל. במקרים של שיבוש כחלק מתרחיש כשל, מציינים גם את משך השיבוש (סדר), אם אפשר.

כשלים בצמתים

יכול להיות שצומת ב-Google Distributed Cloud יפסיק לפעול או שלא תהיה אליו גישה ברשת. יש כמה מצבי כשל שונים, בהתאם למאגר הצמתים ולמקלט שאליו שייך המחשב שנכשל.

צומת של מישור הבקרה

בטבלה הבאה מפורטת ההתנהגות של הצמתים שמהווים חלק ממישור הבקרה ב-Google Distributed Cloud:

הפעלת עומסי עבודה ניהול עומסי עבודה ניהול אשכולות משתמשים ניהול אשכולות אדמין
שיבוש (משך) ללא שיבושים יכול להיות שיש שיבוש (לא ידוע) יכול להיות שיש שיבוש (לא ידוע) יכול להיות שיש שיבוש (לא ידוע)
הסבר אם הכשל בצומת משפיע על צומת מישור הבקרה היחיד באשכול משתמשים שאין בו זמינות גבוהה (HA), או אם הוא משפיע על לפחות מחצית מצמתי מישור הבקרה באשכול משתמשים עם זמינות גבוהה, תהיה הפרעה. אבד הקוורום של מישור הבקרה של אשכול המשתמשים. אם הכשל בצומת משפיע על צומת יחיד של מישור הבקרה באשכול אדמין שאינו HA, או אם הוא משפיע על לפחות מחצית מהצמתים של מישור הבקרה באשכול אדמין HA, תהיה הפרעה. הושג קוורום במישור הבקרה של אשכול האדמין. אם הכשל בצומת משפיע על צומת יחיד של מישור הבקרה באשכול אדמין שאינו HA, או אם הוא משפיע על לפחות מחצית מהצמתים של מישור הבקרה באשכול אדמין HA, יש שיבוש. הושג קוורום במישור הבקרה של אשכול האדמין.
התאוששות מידע נוסף מופיע במאמר איך מתאוששים מאובדן קוורום. מידע נוסף מופיע במאמר איך מתאוששים מאובדן קוורום. מידע נוסף מופיע במאמר איך מתאוששים מאובדן קוורום.
מניעה כדאי לפרוס אשכולות משתמשים במצב זמינות גבוהה כדי לצמצם את הסיכוי לשיבוש. כדאי לפרוס אשכולות אדמין במצב HA כדי לצמצם את הסיכוי לשיבושים. כדאי לפרוס אשכולות אדמין במצב HA כדי לצמצם את הסיכוי לשיבושים.

צומת של מאזן עומסים

בטבלה הבאה מפורטת ההתנהגות של הצמתים שמארחים את מאזני העומסים ב-Google Distributed Cloud. ההנחיות האלה רלוונטיות רק למאזני עומסים בחבילה עם מצב שכבה 2. לגבי איזון עומסים ידני, כדאי לעיין במצבי הכשל של מאזני העומסים החיצוניים:

הפעלת עומסי עבודה ניהול עומסי עבודה ניהול אשכולות משתמשים ניהול אשכולות אדמין
שיבוש (משך) יכול להיות שיבוש (משתנה) יכול להיות שיבוש (משתנה) יכול להיות שיבוש (משתנה) יכול להיות שיבוש (משתנה)
הסבר אם עומסי עבודה חיצוניים מסתמכים על איזון העומסים במישור הנתונים כדי לתקשר עם עומסי עבודה באשכול, ויש לכם רק צומת אחד של איזון עומסים, תהיה הפרעה. כתובת ה-IP הווירטואלית של מישור הבקרה של אשכול המשתמשים נמצאת בצומת אחד של מאזן העומסים. אם מאגר הצמתים של איזון העומסים באשכול המשתמשים לא כולל זמינות גבוהה, תהיה הפרעה. כתובת ה-IP הווירטואלית של מישור הבקרה של אשכול האדמין נמצאת בצומת אחד של מאזן העומסים. אם מאגר הצמתים של איזון העומסים של אשכול האדמין לא כולל זמינות גבוהה, תהיה הפרעה. כתובת ה-IP הווירטואלית של מישור הבקרה של אשכול האדמין נמצאת בצומת אחד של מאזן העומסים. אם מאגר הצמתים של איזון העומסים של אשכול האדמין לא כולל זמינות גבוהה, תהיה הפרעה.
התאוששות

אם יש כמה צמתים של מאזן עומסים, יתירות כשל ב-MetalLB מתרחשת תוך כמה שניות.

אם לא מדובר ב-HA, כדאי לפרוס עוד צמתים של איזון עומסים.

אם מוגדרת זמינות גבוהה, המעבר לגיבוי אוטומטי מתבצע תוך שניות.

אם לא מדובר ב-HA, כדאי לפרוס עוד צמתים של איזון עומסים

אם מוגדרת זמינות גבוהה, המעבר לגיבוי אוטומטי מתבצע תוך שניות.

אם לא מדובר ב-HA, כדאי לפרוס עוד צמתים של איזון עומסים.

אם מוגדרת זמינות גבוהה, המעבר לגיבוי אוטומטי מתבצע תוך שניות.

אם לא מדובר ב-HA, כדאי לפרוס עוד צמתים של איזון עומסים.

מניעה כדי לצמצם את הסיכוי להפרעה, כדאי לפרוס מאגרי צמתים של איזון עומסים במצב HA. כדי לצמצם את הסיכוי להפרעה, כדאי לפרוס מאגרי צמתים של איזון עומסים במצב HA. כדי לצמצם את הסיכוי להפרעה, כדאי לפרוס מאגרי צמתים של איזון עומסים במצב HA. כדי לצמצם את הסיכוי להפרעה, כדאי לפרוס מאגרי צמתים של איזון עומסים במצב HA.

צומת עובד

בטבלה הבאה מפורטת ההתנהגות של צמתי עובדים ב-Google Distributed Cloud:

הפעלת עומסי עבודה ניהול עומסי עבודה ניהול אשכולות משתמשים ניהול אשכולות אדמין
שיבוש (משך) שיבוש אפשרי (בסדר גודל של שניות) ללא שיבושים ללא שיבושים ללא שיבושים
הסבר

הפעולות Pods שפועלות בצומת שנכשלות מופרעות, ומתוזמנות מחדש באופן אוטומטי בצמתים תקינים אחרים עם זמן קצוב לתפוגה ברירת מחדל של 5 דקות להוצאה.

אם לאפליקציות של המשתמשים יש קיבולת עודפת לעומס עבודה והן מפוזרות על פני כמה צמתים, הלקוחות שמיישמים ניסיונות חוזרים לא יבחינו בשיבוש.

ה-Pods מופעלים מחדש אוטומטית בצמתים תקינים.

אם לא נותרה קיבולת פנויה באשכול, יכול להיות שהשיבוש יימשך עד שיוספו לאשכול צמתים חדשים.

התאוששות אם אין לכם קיבולת פנויה באשכול, אתם צריכים לפרוס עוד צמתים שפרוסים על פני כמה אזורי כשל, ולהעביר את עומסי העבודה שנכשלו לצמתים החדשים.
מניעה

פריסת צמתים שמתפרסים על פני כמה אזורים שבהם עלולות להיות בעיות.

פריסת עומסי עבודה עם כמה רפליקות שמופצות על פני כמה אזורי כשל כדי למזער את הסיכוי לשיבוש.

כשל באחסון

יכול להיות שהאחסון ב-Google Distributed Cloud יפסיק לפעול או שלא תהיה אליו גישה ברשת. בהתאם לאחסון שנכשל, יש כמה מצבי כשל שונים.

etcd

התוכן של ספריות /var/lib/etcd ו-/var/lib/etcd-events עלול להיפגם אם יש הפסקת חשמל לא מבוקרת של הצומת או כשל בסיסי באחסון. בטבלה הבאה מפורטות ההתנהגויות של הפונקציונליות הבסיסית בגלל כשלים ב-etcd:

הפעלת עומסי עבודה ניהול עומסי עבודה ניהול אשכולות משתמשים ניהול אשכולות אדמין
שיבוש (משך) ללא שיבושים יכול להיות שיש שיבוש (לא ידוע) יכול להיות שיש שיבוש (לא ידוע) יכול להיות שיש שיבוש (לא ידוע)
הסבר אם עומסי העבודה הקיימים לא מסתמכים על רמת הבקרה של Kubernetes, הם ימשיכו לפעול ללא הפרעה. אם הפקודה etcd נכשלת באשכול משתמשים עם מישור בקרה יחיד, או אם היא נכשלת לפחות בחצי מהצמתים של מישור הבקרה באשכול משתמשים עם זמינות גבוהה, יש שיבוש. הושג קוורום במישור הבקרה של אשכול המשתמשים. אם etcd נכשל באשכול אדמין של מישור בקרה יחיד, או אם הוא נכשל לפחות בחצי מהצמתים של מישור הבקרה באשכול אדמין של HA, יש שיבוש. הקבוצה של מישור הבקרה של אשכול האדמין אבדה. אם etcd נכשל באשכול אדמין של מישור בקרה יחיד, או אם הוא נכשל לפחות בחצי מהצמתים של מישור הבקרה באשכול אדמין של HA, יש שיבוש. הקבוצה של מישור הבקרה של אשכול האדמין אבדה.
התאוששות מידע נוסף מופיע במאמר איך מתאוששים מאובדן קוורום. מידע נוסף מופיע במאמר איך מתאוששים מאובדן קוורום. מידע נוסף מופיע במאמר איך מתאוששים מאובדן קוורום.
מניעה כדי לצמצם את הסיכוי להפרעות, כדאי לפרוס אשכולות משתמשים במצב HA. כדי לצמצם את הסיכוי להפרעות, כדאי לפרוס אשכולות של אדמין במצב HA. כדי לצמצם את הסיכוי להפרעות, כדאי לפרוס אשכולות של אדמין במצב HA.

בקשת משתמש PersistentVolume

בטבלה הבאה מפורטת ההתנהגות של הפונקציונליות העיקרית בעקבות כשל של PersistentVolume:

הפעלת עומסי עבודה ניהול עומסי עבודה ניהול אשכולות משתמשים ניהול אשכולות אדמין
שיבוש (משך) יכול להיות שיש שיבוש (לא ידוע) ללא שיבושים ללא שיבושים ללא שיבושים
הסבר עומסי העבודה שמשתמשים בPersistentVolume are affected. שנכשל
התאוששות
מניעה כדי לצמצם את הסיכוי לשיבושים, כדאי לפרוס את עומס העבודה של המשתמש במצב HA.

דיסק פגום של Fluent Bit

השחיתות של דיסק Fluent Bit לא משפיעה על אף אחת מהפונקציות העיקריות, אבל היא משפיעה על היכולת לאסוף ולבדוק יומנים ב- Google Cloud.

לפעמים אפשר לראות את האירוע SIGSEGV ביומנים של stackdriver-log-forwarder. יכול להיות שהשגיאה הזו נגרמת בגלל יומני מאגרים פגומים בדיסק.

ל-Fluent Bit יש מנגנון לסינון ולביטול של נתונים פגומים. התכונה הזו זמינה בגרסת fluent-bit‏ (v1.8.3) שנעשה בה שימוש ב-Google Distributed Cloud.

מתוך LoadBalancer כתובות IP

אם כל כתובות ה-IP במאגרי הכתובות שהוקצו תפוסות כרגע, שירותי LoadBalancer שנוצרו לאחרונה לא יכולים לקבל כתובת IP של LoadBalancer. התרחיש הזה משפיע על היכולת של לקוחות השירות לתקשר עם שירותי LoadBalancer.

כדי לפתור את הבעיה של מיצוי כתובות ה-IP, צריך להקצות עוד כתובות IP למאגר הכתובות על ידי שינוי משאב בהתאמה אישית של האשכול.

תפוגת האישור

מערכת Google Distributed Cloud יוצרת רשות אישורים (CA) בחתימה עצמית במהלך תהליך התקנת האשכול. התוקף של הרשות שמנפיקה את האישורים (CA) הוא 10 שנים, והיא אחראית ליצירת אישורים שתוקפם פג אחרי שנה. כדי למנוע השבתה של האשכול, צריך להחליף את האישורים באופן קבוע. אפשר לבצע רוטציה של אישורים על ידי שדרוג האשכול, וזו השיטה המומלצת. אם אין לכם אפשרות לשדרג את האשכול, אתם יכולים לבצע החלפה של רשות אישורים על פי דרישה. מידע נוסף על אישורים של אשכולות זמין במאמר בנושא אישורי PKI ודרישות במאמרי העזרה של Kubernetes.

אם תוקף האישורים של האשכול פג, צריך לחדש אותם באופן ידני.

הפעלת עומסי עבודה ניהול עומסי עבודה ניהול אשכולות משתמשים ניהול אשכולות אדמין
שיבוש (משך) ללא הפרעה יכול להיות שיש שיבוש (לא ידוע) יכול להיות שיש שיבוש (לא ידוע) יכול להיות שיש שיבוש (לא ידוע)
הסבר אם עומסי העבודה של המשתמשים לא מתקשרים עם רכיבי מישור הבקרה של Kubernetes, לא יהיו שיבושים. אם תוקף רשויות האישורים של אשכולות משתמשים יפוג, תהיה הפרעה. אם יפוג התוקף של רשויות האישורים של אשכולות האדמין, תהיה הפרעה. אם תוקף רשויות האישורים של אשכולות המשתמשים פג, תהיה הפרעה.
התאוששות

פועלים לפי השלבים לחידוש ידני של אישורים באשכול המשתמשים.

פועלים לפי השלבים לחידוש ידני של אישורים באשכול המשתמשים.

פועלים לפי השלבים לחידוש ידני של אישורים באשכול המשתמשים.

מניעה הגדרת מעקב אחרי תפוגה של אישורים. דוגמה למדד kubelet_certificate_manager_server_expiration_seconds אפשר למצוא ברשימת המדדים.

כשלים בשדרוג

הפעלת עומסי עבודה ניהול עומסי עבודה ניהול אשכולות משתמשים ניהול אשכולות אדמין
שיבוש (משך) ללא הפרעה ללא הפרעה יכול להיות שיש שיבוש (לא ידוע) יכול להיות שיש שיבוש (לא ידוע)
הסבר

אם השדרוג נכשל במישור הבקרה של אשכול המשתמשים, לא תהיה הפרעה לעומסי העבודה הקיימים.

אם השדרוג נכשל בצומת עובד מסוים, עומסי העבודה בצומת הזה יועברו לצמתים תקינים אחרים, אם יש בהם קיבולת נוספת.

השדרוג ייפסק אם אחד מהצמתים של רמת הבקרה ייכשל בשדרוג. האשכול עדיין יפעל אם השדרוג ייכשל, אם אשכול המשתמשים הוא HA. אם השדרוג נכשל ברמת הבקרה של אשכול האדמין, תהיה הפרעה עד שהשדרוג יסתיים. אם השדרוג נכשל ברמת הבקרה של אשכול האדמין, תהיה הפרעה עד שהשדרוג יסתיים.
התאוששות אפשר לנסות לשדרג שוב. מידע נוסף מופיע במאמר אבחון בעיות בשדרוג והמשך השדרוג. אפשר לנסות לשדרג שוב. מידע נוסף מופיע במאמר אבחון בעיות בשדרוג והמשך השדרוג.
מניעה מידע נוסף על יצירת גיבוי לפני שדרוג מידע נוסף על יצירת גיבוי לפני שדרוג

המאמרים הבאים

מידע נוסף על בעיות מוכרות במוצר ופתרונות עקיפים זמין במאמר בעיות מוכרות ב-Google Distributed Cloud.

לקבלת עזרה נוספת, אפשר לפנות אל Cloud Customer Care. אפשר גם לעיין במאמר קבלת תמיכה לקבלת מידע נוסף על מקורות מידע לתמיכה, כולל:

  • דרישות לפתיחת בקשת תמיכה.
  • כלים שיעזרו לכם לפתור בעיות, כמו הגדרת הסביבה, היומנים והמדדים.
  • רכיבים נתמכים.