Compute 可靠性洞察資料總覽

Compute Reliability Insights 提供一系列功能,可提升 Compute Engine 工作負載的可靠性。這項工具可顯示潛在風險,並提供詳細解決方案和主動式建議,協助您有效管理風險。

本頁面提供 Compute Reliability Insights 的概念資訊。如要進一步瞭解如何查看及套用可靠性建議,請參閱「查看及套用可靠性建議」。

瞭解可靠性風險

可靠性風險是指 Compute Engine 功能或設定設定錯誤,可能對基礎架構的穩定性和可用性造成負面影響的情況。這可能發生於下列情況:

  • 非預期的連鎖故障:Google 基礎架構中某個區域或地區發生服務中斷時,可能會非預期地影響其他區域或地區的資源。
  • 外部依附元件:您的資源可能依賴位於主要資源位置以外的特定 Compute Engine 區域。

風險類型

Compute Reliability Insights 會找出工作負載中的部分潛在風險:

風險嚴重程度和優先順序

Compute 可靠性洞察資料會使用下列嚴重程度和優先順序定義,優先處理風險。

嚴重性 Priority 說明
P1 設定錯誤或設定不當,導致區域性中斷發生時,常用服務在多個區域中斷 (例如 VM 建立作業)。
P2 設定或設定錯誤,導致區域性中斷時,多個區域的非重要服務中斷 (例如建立執行個體範本)。

遙測與延遲

Compute 可靠性洞察資料會根據遙測資料找出風險。使用這項功能時,請注意下列行為:

  • 新專案和閒置資源:如果是過去 7 天內建立的專案,或是含有閒置 VM 的專案,系統可能無法提供最佳化建議,因為管道需要更多遙測資料。
  • 緩解延遲:緩解風險後, Google Cloud 控制台和 API 最多可能仍會顯示建議 24 小時。這是因為擷取管道每 24 小時會執行一次,清除已解決的建議。

後續步驟