서비스 오류 이벤트 관리

Error Reporting을 사용하면 스택 트레이스 없이 오류 메시지를 기록하는 Google Cloud 서비스 전반에서 플랫폼 장애를 모니터링하고 진단할 수 있습니다. 예를 들어 Cloud Run이 최대 컨테이너 인스턴스 한도에 도달하면 Error Reporting에서 로그 이벤트를 그룹화하고, 알림을 전송하고, 서비스별 문제 해결 문서에 대한 직접 링크를 제공합니다.

서비스 오류 그룹 보기

Google Cloud 콘솔에서 Error Reporting 페이지로 이동합니다.

Error Reporting으로 이동

검색창을 사용하여 이 페이지를 찾을 수도 있습니다.

Error Reporting에서 서비스 장애가 있다고 판단하면 이러한 오류 이벤트를 그룹화하고 오류 유형을 Service error로 설정합니다. Error Reporting 개요에는 오류 유형과 오류 그룹에 관한 기타 정보가 표시됩니다.

Error Reporting 개요 페이지

문서화된 해결 방법이 있는 서비스 오류 이벤트의 경우 Error Reporting에서 Google Cloud 서비스의 문제 해결 가이드 링크를 제공합니다.

샘플 서비스 오류 이벤트

다음 표에는 Error Reporting의 서비스 오류 기능에서 캡처하는 오류 이벤트 중 일부가 나와 있습니다.

Google Cloud 서비스 이름 오류 유형
Dataflow 작업자 로그 제한
메모리 부족 (시스템)
맞춤 서브넷 누락
단계에서 긴 작업
JRE 비정상 종료
작업자 JAR 파일 구성 오류
Cloud Run 메모리 한도 초과
사용 가능한 인스턴스 없음
Google Kubernetes Engine 비정상 포드, 프로브 실패
포드 예약 실패
백오프로 컨테이너 다시 시작 실패
마운트 해제된 볼륨
컨테이너 이미지 가져오기 실패
엔드포인트 업데이트 실패
보안 비밀/ConfigMap을 찾을 수 없음