Google Distributed Cloud מתוכנן להגביל את היקף התקלות ולתת עדיפות לפונקציונליות שקריטית להמשכיות עסקית. במסמך הזה מוסבר איך הפונקציונליות של האשכולות מושפעת כשיש כשל. המידע הזה יכול לעזור לכם לתת עדיפות לתחומים שבהם צריך לפתור בעיות.
הפונקציונליות המרכזית של Google Distributed Cloud כוללת את הקטגוריות הבאות:
- הפעלת עומסי עבודה: אפשר להמשיך להפעיל עומסי עבודה קיימים. זהו השיקול החשוב ביותר לשמירה על המשכיות עסקית. גם אם יש בעיה באשכול, יכול להיות שעומסי העבודה הקיימים ימשיכו לפעול ללא הפרעה.
- ניהול עומסי עבודה: אתם יכולים ליצור, לעדכן ולמחוק עומסי עבודה. זהו השיקול השני בחשיבותו להרחבת עומסי עבודה כשנפח התנועה גדל, גם אם יש בעיה באשכול.
- ניהול של אשכולות משתמשים: אתם יכולים לנהל צמתים, לעדכן, לשדרג ולמחוק אשכולות משתמשים. הנושא הזה פחות חשוב מהשיקולים לגבי מחזור החיים של האפליקציה. אם יש קיבולת זמינה בצמתים הקיימים, חוסר היכולת לשנות את אשכולות המשתמשים לא משפיע על עומסי העבודה של המשתמשים.
- ניהול אשכולות אדמין: אתם יכולים לעדכן ולשדרג את אשכול האדמין.
- בפריסות שבהן נעשה שימוש באשכולות נפרדים לאדמינים ולמשתמשים, זהו השיקול הכי פחות חשוב כי באשכול האדמין לא מתארחות עומסי עבודה של משתמשים. אם יש בעיה באשכול האדמין, עומסי העבודה של האפליקציות באשכולות אחרים ממשיכים לפעול ללא הפרעה.
- אם משתמשים במודלים אחרים של פריסה, כמו היברידי או עצמאי, אשכול האדמין מריץ עומסי עבודה של אפליקציות. אם יש בעיה באשכול האדמין ומישור הבקרה מושבת, אי אפשר גם לנהל את עומסי העבודה של האפליקציות או את רכיבי אשכול המשתמשים.
בקטעים הבאים נשתמש בקטגוריות האלה של פונקציונליות עיקרית כדי לתאר את ההשפעה של סוגים ספציפיים של תרחישי כשל. במקרים של שיבוש כחלק מתרחיש כשל, מציינים גם את משך השיבוש (סדר), אם אפשר.
כשלים בצמתים
יכול להיות שצומת ב-Google Distributed Cloud יפסיק לפעול או שלא תהיה אליו גישה ברשת. בהתאם למאגר הצמתים ולתצוגת האשכולות שהמכונה שנכשלה היא חלק מהם, יש כמה מצבי כשל שונים.
צומת מישור הבקרה
בטבלה הבאה מפורטת ההתנהגות של הצמתים שמהווים חלק ממישור הבקרה ב-Google Distributed Cloud:
| הרצת עומסי עבודה | ניהול עומסי עבודה | ניהול אשכולות משתמשים | ניהול אשכולות אדמין | |
|---|---|---|---|---|
| שיבוש (משך) | ללא הפרעה | יכול להיות שיש שיבוש (לא ידוע) | יכול להיות שיש שיבוש (לא ידוע) | יכול להיות שיש שיבוש (לא ידוע) |
| הסבר | — | אם הכשל בצומת משפיע על צומת יחיד של מישור הבקרה באשכול משתמשים שאין בו זמינות גבוהה (HA), או אם הוא משפיע על לפחות מחצית מהצמתים של מישור הבקרה באשכול משתמשים עם זמינות גבוהה, תהיה הפרעה. הושג קוורום במישור הבקרה של אשכול המשתמשים. | אם הכשל בצומת משפיע על צומת יחיד של מישור הבקרה באשכול אדמין שאינו HA, או אם הוא משפיע על לפחות מחצית מהצמתים של מישור הבקרה באשכול אדמין HA, יש שיבוש. אובד קוורום של מישור הבקרה של אשכול האדמין. | אם הכשל בצומת משפיע על צומת יחיד של מישור הבקרה באשכול אדמין שאינו HA, או אם הוא משפיע על לפחות מחצית מהצמתים של מישור הבקרה באשכול אדמין HA, יש שיבוש. אובד קוורום של מישור הבקרה של אשכול האדמין. |
| שחזור | — | מידע נוסף מופיע במאמר איך להתאושש מאובדן קוורום. | מידע נוסף מופיע במאמר איך להתאושש מאובדן קוורום. | מידע נוסף מופיע במאמר איך להתאושש מאובדן קוורום. |
| מניעה | — | כדאי לפרוס אשכולות משתמשים במצב HA כדי לצמצם את הסיכוי לשיבוש. | כדי לצמצם את הסיכוי לשיבושים, כדאי לפרוס אשכולות אדמין במצב HA. | כדי לצמצם את הסיכוי לשיבושים, כדאי לפרוס אשכולות אדמין במצב HA. |
צומת של מאזן עומסים
בטבלה הבאה מפורטת ההתנהגות של הצמתים שמארחים את מאזני העומסים ב-Google Distributed Cloud. ההנחיות האלה רלוונטיות רק למאזני עומסים בחבילה עם מצב שכבה 2. לגבי איזון עומסים ידני, כדאי לעיין במצבי הכשל של מאזני העומסים החיצוניים:
| הרצת עומסי עבודה | ניהול עומסי עבודה | ניהול אשכולות משתמשים | ניהול אשכולות אדמין | |
|---|---|---|---|---|
| שיבוש (משך) | יכול להיות שתהיה הפרעה (משתנה) | יכול להיות שיבוש (משתנה) | יכול להיות שיבוש (משתנה) | יכול להיות שיבוש (משתנה) |
| הסבר | אם עומסי עבודה חיצוניים מסתמכים על איזון העומסים במישור הנתונים כדי לתקשר עם עומסי עבודה באשכול, ויש לכם רק צומת אחד של איזון עומסים, תהיה הפרעה. | כתובת ה-IP הווירטואלית של מישור הבקרה של אשכול המשתמשים נמצאת בצומת אחד של מאזן העומסים. אם מאגר הצמתים של איזון העומסים באשכול המשתמשים לא זמין, תהיה הפרעה. | כתובת ה-IP הווירטואלית של מישור הבקרה של אשכול האדמין נמצאת באחד מצמתי מאזן העומסים. אם מאגר הצמתים של איזון העומסים באשכול האדמין לא כולל זמינות גבוהה, תהיה הפרעה. | כתובת ה-IP הווירטואלית של מישור הבקרה של אשכול האדמין נמצאת בצומת אחד של מאזן העומסים. אם מאגר הצמתים של איזון העומסים באשכול האדמין לא כולל זמינות גבוהה, תהיה הפרעה. |
| שחזור | אם יש כמה צמתים של מאזן עומסים, המעבר לגיבוי (failover) של MetalLB מתרחש תוך כמה שניות. אם לא מוגדרת זמינות גבוהה, כדאי לפרוס עוד צמתים של איזון עומסים. |
אם מוגדרת זמינות גבוהה, הגיבוי האוטומטי מתבצע תוך שניות. אם לא מוגדרת זמינות גבוהה, כדאי לפרוס עוד צמתים של איזון עומסים |
אם מוגדרת זמינות גבוהה, הגיבוי האוטומטי מתבצע תוך שניות. אם לא מוגדרת זמינות גבוהה, כדאי לפרוס עוד צמתים של איזון עומסים. |
אם מוגדרת זמינות גבוהה, הגיבוי האוטומטי מתבצע תוך שניות. אם לא מוגדרת זמינות גבוהה, כדאי לפרוס עוד צמתים של איזון עומסים. |
| מניעה | כדי לצמצם את הסיכוי להפרעה, כדאי לפרוס מאגרי צמתים של איזון עומסים במצב HA. | כדי לצמצם את הסיכוי להפרעה, כדאי לפרוס מאגרי צמתים של איזון עומסים במצב HA. | כדי לצמצם את הסיכוי להפרעה, כדאי לפרוס מאגרי צמתים של איזון עומסים במצב HA. | כדי לצמצם את הסיכוי להפרעה, כדאי לפרוס מאגרי צמתים של איזון עומסים במצב HA. |
צומת עובד
בטבלה הבאה מפורטת ההתנהגות של צמתי עובד ב-Google Distributed Cloud:
| הרצת עומסי עבודה | ניהול עומסי עבודה | ניהול אשכולות משתמשים | ניהול אשכולות אדמין | |
|---|---|---|---|---|
| שיבוש (משך) | שיבוש אפשרי (בסדר גודל של שניות) | ללא הפרעה | ללא הפרעה | ללא הפרעה |
| הסבר | ה- אם לאפליקציות של המשתמשים יש קיבולת עודפת לעומס עבודה והן מפוזרות על פני כמה צמתים, הלקוחות שמיישמים ניסיונות חוזרים לא יבחינו בשיבוש. ה- |
— | — | — |
| שחזור | אם אין לכם קיבולת פנויה באשכול, אתם צריכים לפרוס עוד צמתים שפרוסים על פני כמה אזורי כשל, ולהעביר את עומסי העבודה שנכשלו לצמתים החדשים. | — | — | — |
| מניעה | פריסת צמתים שמתפרסים על פני כמה אזורים שמועדים לכשלים. פריסת עומסי עבודה עם כמה רפליקות שמופצות על פני כמה אזורי כשל כדי למזער את הסיכוי לשיבוש. |
— | — | — |
כשל באחסון
יכול להיות שהאחסון ב-Google Distributed Cloud יפסיק לפעול או שלא יהיה אפשר לגשת אליו ברשת. בהתאם לאחסון שנכשל, יש כמה מצבי כשל שונים.
etcd
התוכן של ספריות /var/lib/etcd ו-/var/lib/etcd-events עלול להיפגם אם יש הפסקת חשמל לא מבוקרת של הצומת או כשל בסיסי באחסון. בטבלה הבאה מפורטות ההתנהגויות של הפונקציונליות הבסיסית בגלל כשלים ב-etcd:
| הרצת עומסי עבודה | ניהול עומסי עבודה | ניהול אשכולות משתמשים | ניהול אשכולות אדמין | |
|---|---|---|---|---|
| שיבוש (משך) | ללא הפרעה | יכול להיות שיש שיבוש (לא ידוע) | יכול להיות שיש שיבוש (לא ידוע) | יכול להיות שיש שיבוש (לא ידוע) |
| הסבר | אם עומסי העבודה הקיימים לא מסתמכים על רמת הבקרה של Kubernetes, הם ימשיכו לפעול ללא הפרעה. | אם etcd נכשל באשכול משתמשים עם מישור בקרה יחיד, או
נכשל בלפחות מחצית מצמתי מישור הבקרה באשכול משתמשים עם זמינות גבוהה, יש שיבוש. הקוורום של מישור הבקרה של אשכול המשתמשים אבד. |
אם etcd נכשל באשכול אדמין של מישור בקרה יחיד, או
אם הוא נכשל לפחות במחצית מצמתי מישור הבקרה באשכול אדמין של HA, יש שיבוש. הקבוצה של מישור הבקרה של אשכול האדמין אבדה. |
אם etcd נכשל באשכול אדמין של מישור בקרה יחיד, או
אם הוא נכשל לפחות במחצית מצמתי מישור הבקרה באשכול אדמין של HA, יש שיבוש. הקבוצה של מישור הבקרה של אשכול האדמין אבדה. |
| שחזור | — | מידע נוסף מופיע במאמר איך להתאושש מאובדן קוורום. | מידע נוסף מופיע במאמר איך להתאושש מאובדן קוורום. | מידע נוסף מופיע במאמר איך להתאושש מאובדן קוורום. |
| מניעה | — | כדי לצמצם את הסיכוי להפרעות, כדאי לפרוס אשכולות משתמשים במצב HA. | כדי למזער את הסיכוי לשיבוש, כדאי לפרוס אשכולות של אדמין במצב HA. | כדי למזער את הסיכוי לשיבוש, כדאי לפרוס אשכולות של אדמין במצב HA. |
אפליקציית משתמש PersistentVolume
בטבלה הבאה מפורטות התנהגויות של הפונקציונליות העיקרית כתוצאה מכשל של PersistentVolume:
| הרצת עומסי עבודה | ניהול עומסי עבודה | ניהול אשכולות משתמשים | ניהול אשכולות אדמין | |
|---|---|---|---|---|
| שיבוש (משך) | יכול להיות שיש שיבוש (לא ידוע) | ללא הפרעה | ללא הפרעה | ללא הפרעה |
| הסבר | עומסי העבודה שמשתמשים בPersistentVolume שנכשל |
— | — | — |
| שחזור | — | — | — | — |
| מניעה | כדי לצמצם את הסיכוי לשיבושים, כדאי לפרוס את עומס העבודה של המשתמשים במצב HA. | — | — | — |
דיסק פגום של Fluent Bit
השחיתות של דיסק Fluent Bit לא משפיעה על אף אחת מהפונקציות העיקריות, אבל היא משפיעה על היכולת לאסוף ולבדוק יומנים ב- Google Cloud.
לפעמים אפשר לראות את האירוע SIGSEGV ביומנים של stackdriver-log-forwarder. יכול להיות שהשגיאה הזו נגרמת בגלל יומני מאגרים פגומים בדיסק.
ל-Fluent Bit יש מנגנון לסינון ולמחיקה של נתונים פגומים. התכונה הזו זמינה בגרסת fluent-bit (v1.8.3) שנעשה בה שימוש ב-Google Distributed Cloud.
מתוך LoadBalancer כתובות IP
אם כל כתובות ה-IP במאגרי הכתובות שהוקצו תפוסות כרגע, שירותים חדשים של LoadBalancer לא יכולים לקבל כתובת IP של LoadBalancer. התרחיש הזה משפיע על היכולת של לקוחות השירות לתקשר עם שירותי LoadBalancer.
כדי לפתור את הבעיה של מיצוי כתובות ה-IP, צריך להקצות עוד כתובות IP למאגר הכתובות על ידי שינוי משאב בהתאמה אישית של האשכול.
תפוגת האישור
מערכת Google Distributed Cloud יוצרת רשות אישורים (CA) בחתימה עצמית במהלך תהליך התקנת האשכול. התוקף של רשות האישורים הוא 10 שנים, והיא אחראית ליצירת אישורים שתוקפם הוא שנה אחת. כדאי להחליף את האישורים באופן קבוע כדי למנוע השבתה של האשכול. אפשר לבצע רוטציה של אישורים על ידי שדרוג האשכול, וזו השיטה המומלצת. אם אין לך אפשרות לשדרג את האשכול, אפשר לבצע רוטציה של רשות אישורים לפי דרישה. מידע נוסף על אישורים של אשכולות זמין במאמר בנושא אישורי PKI ודרישות במסמכי התיעוד של Kubernetes.
אם תוקף האישורים של האשכול פג, צריך לחדש אותם באופן ידני.
| הרצת עומסי עבודה | ניהול עומסי עבודה | ניהול אשכולות משתמשים | ניהול אשכולות אדמין | |
|---|---|---|---|---|
| שיבוש (משך) | ללא הפרעה | יכול להיות שיש שיבוש (לא ידוע) | יכול להיות שיש שיבוש (לא ידוע) | יכול להיות שיש שיבוש (לא ידוע) |
| הסבר | אם עומסי העבודה של המשתמש לא מתקשרים עם רכיבי מישור הבקרה של kubernetes, לא יהיו שיבושים. | אם תוקף רשויות האישורים של אשכולות משתמשים יפוג, תהיה הפרעה. | אם יפוג התוקף של רשויות האישורים של אשכולות האדמין, תהיה הפרעה. | אם תוקף רשויות האישורים של אשכולות המשתמשים פג, תהיה הפרעה. |
| שחזור | — | פועלים לפי השלבים לחידוש ידני של אישורים באשכול המשתמשים. |
פועלים לפי השלבים לחידוש ידני של אישורים באשכול המשתמשים. |
פועלים לפי השלבים לחידוש ידני של אישורים באשכול המשתמשים. |
| מניעה | הגדרת מעקב אחרי תפוגה של אישורים. דוגמה למדד kubelet_certificate_manager_server_expiration_seconds מופיעה ברשימת המדדים. |
|||
כשלים בשדרוג
| הרצת עומסי עבודה | ניהול עומסי עבודה | ניהול אשכולות משתמשים | ניהול אשכולות אדמין | |
|---|---|---|---|---|
| שיבוש (משך) | ללא הפרעה | ללא הפרעה | יכול להיות שיש שיבוש (לא ידוע) | יכול להיות שיש שיבוש (לא ידוע) |
| הסבר | אם השדרוג נכשל במישור הבקרה של אשכול המשתמשים, לא תהיה הפרעה לעומסי העבודה הקיימים. אם השדרוג נכשל בצומת עובד מסוים, עומסי העבודה בצומת הזה יועברו לצמתים תקינים אחרים אם יש בהם קיבולת נוספת. |
השדרוג ייפסק אם אחד מצמתי רמת הבקרה ייכשל בשדרוג. האשכול עדיין יפעל אם השדרוג ייכשל, אם אשכול המשתמשים הוא HA. | אם השדרוג נכשל ברמת הבקרה של אשכול האדמין, תהיה הפרעה עד שהשדרוג יסתיים. | אם השדרוג נכשל ברמת הבקרה של אשכול האדמין, תהיה הפרעה עד שהשדרוג יסתיים. |
| שחזור | — | — | אפשר לנסות שוב לבצע את השדרוג. מידע נוסף מופיע במאמר אבחון בעיות בשדרוג והמשך השדרוג. | אפשר לנסות לשדרג שוב. מידע נוסף מופיע במאמר אבחון בעיות בשדרוג והמשך השדרוג. |
| מניעה | — | — | מידע נוסף על יצירת גיבוי לפני שדרוג | מידע נוסף על יצירת גיבוי לפני שדרוג |
המאמרים הבאים
מידע נוסף על בעיות מוכרות במוצר ופתרונות לעקיפת בעיות זמין במאמר בעיות מוכרות ב-Google Distributed Cloud.
אם אתם צריכים עזרה נוספת, אתם יכולים לפנות אל