데이터 수집 상태 확인
이 가이드는 Google Security Operations 내에서 데이터 수집 상태를 모니터링하고 문제를 해결하려는 보안 엔지니어를 위한 것입니다. 데이터 소스 및 파서의 상태를 추적하기 위해 상태 허브를 사용하고, Cloud Monitoring 알림을 구성하고, 무음 호스트 모니터링 (SHM)을 사용하여 잠재적인 수집기 중지를 감지하는 방법을 설명합니다.
이러한 모니터링 워크플로를 사용하면 데이터 파이프라인 문제를 식별, 진단, 해결하고 사용자가 해결할 수 있는 문제 (조치 가능)와 지원이 필요한 문제 (조치 불가능)를 구분할 수 있습니다. 성공적인 구성을 통해 안정적인 데이터 흐름을 보장할 수 있으며, 이는 효과적인 보안 운영 및 분석에 매우 중요합니다.
일반적인 사용 사례
이 섹션에서는 수집 모니터링의 일반적인 사용 사례를 다룹니다.
사전 예방적 상태 점검
- 목표: 구성된 모든 데이터 소스의 상태와 상태를 검토합니다.
- 가치: 보안 가시성에 영향을 미치기 전에 잠재적인 수집 문제를 감지합니다.
알림 응답
- 목표: 자동 알림으로 표시된 데이터 소스 또는 파서 문제를 조사하고 수정합니다.
- 가치: 데이터 손실 또는 지연을 최소화하여 적시에 위협을 감지하고 대응할 수 있도록 데이터를 제공합니다.
주요 용어
- Health Hub: 구성된 모든 데이터 소스 및 파서의 상태와 상태를 모니터링하는 Google SecOps 내의 중앙 대시보드입니다.
- Cloud Monitoring: Google Cloud Google SecOps 수집의 측정항목을 포함한 측정항목을 기반으로 알림 정책을 만드는 데 사용되는 서비스입니다.
- 자동 호스트 모니터링: 환경에서 자동 모드로 전환된 호스트를 식별하는 모니터링 방법입니다.
- 조치를 취할 수 있는 문제: 일반적으로 구성 변경 (예: 사용자 인증 정보 업데이트)을 통해 직접 해결할 수 있는 수집 문제입니다.
- 조치를 취할 수 없는 문제: Google 지원팀의 도움이 필요하여 해결할 수 있는 인제스트 문제 (예: 내부 시스템 오류)입니다.
- 파서: 원시 로그 데이터를 통합 데이터 모델 (UDM) 구조로 정규화하는 구성요소입니다.
시작하기 전에
Google SecOps 인스턴스에 액세스하고, 상태 허브를 확인하고, Cloud Monitoring에서 알림을 구성하는 데 필요한 Identity and Access Management (IAM) 역할 및 권한이 있는지 확인합니다.
데이터 수집 모니터링
이 섹션에서는 데이터 수집을 모니터링하는 다양한 방법을 자세히 설명합니다.
상태 허브를 사용한 모니터링
상태 허브를 사용하여 전체 데이터 상태를 한눈에 모니터링하고 각 피드, 데이터 소스, 로그 유형의 핵심 상태를 확인할 수 있습니다. 이를 통해 맞춤 외부 알림을 구성하지 않고도 비정상 및 실패한 소스와 파서를 식별할 수 있습니다.
- Google SecOps 측면 탐색 메뉴에서 Health Hub를 클릭합니다.
- 실패한 소스 및 실패한 파서의 큰 숫자 위젯을 검토하여 즉각적인 주의가 필요한 구성요소를 파악합니다.
- 데이터 소스별 상태 표를 검사합니다. 최신 문제 세부정보 열에서
Config credential issue또는Normalization issue와 같은 오류 설명을 확인합니다. - 표에 제공된 데이터 소스 수정 또는 파서 수정 링크를 클릭하여 해결을 위한 해당 구성 페이지로 바로 이동합니다.
- 마지막 이벤트 시간 및 마지막 수집 시간과 같은 타임스탬프를 확인하여 데이터가 예상대로 수집되었는지 확인합니다.
- 수정사항을 적용한 후 상태 허브에서 특정 데이터 소스 또는 파서를 모니터링하여 수정이 성공적으로 이루어졌는지 확인합니다.
자동 수집 알림 설정
수집 값이 사전 정의된 특정 수준에 도달하면 알림이 트리거되도록 Monitoring을 구성합니다. 이를 통해 이메일 알림을 기존 워크플로에 통합하여 손상된 피드를 사전 대응 방식으로 수정하거나 자동 로그 소스를 감지할 수 있습니다.
- Health Hub에서 Set Up Alerts 링크를 클릭하면 Monitoring 인터페이스로 이동합니다.
- 알림 정책을 만듭니다.
- 측정항목 선택: Chronicle 수집기 > 수집에서 수집된 총 로그 수 또는 수집된 총 로그 크기와 같은 측정항목을 선택합니다.
collector_id또는log_type필터를 추가하여 알림 범위를 특정 소스로 좁힙니다.
- 무음 전달자를 감지하려면 조건 유형으로 측정항목 부재를 선택합니다. 로그가 지정된 시간 (예: 60분) 동안 흐르지 않으면 알림이 트리거되도록 구성합니다.
문제 해결
이 섹션에서는 데이터 수집 문제를 해결하는 다양한 방법을 자세히 설명합니다.
일반적인 문제
- 파이프라인 지연 시간: 마지막 이벤트 시간과 마지막 수집 시간 타임스탬프 간의 큰 지연은 지연 시간이 발생할 수 있음을 나타냅니다. 상태 허브는 이 델타의
95th백분위수를 노출합니다. 값이 높으면 파이프라인 지연 시간이 있음을 나타내고, 값이 정상적이면 소스에서 이전 데이터를 전송하고 있음을 의미할 수 있습니다. - 수집 급증 또는 급락: 시스템은 z-점수 표준화를 사용하여 비정상 상태를 표시합니다. 일별 및 주간 표준화된 차이가 모두
-1.645미만이면 감소로 표시됩니다. - 파싱 실패: 파서 오류의 비율이 수집된 총 이벤트에 비해 전날보다 5% 이상 증가하면 알림이 트리거됩니다. 헬스 허브의 링크를 사용하여 파서 구성을 조사합니다.
데이터 수집 및 파싱 문제를 식별하는 방법을 자세히 알아보려면 데이터 수집 및 파싱 문제 식별 및 조사를 참고하세요.
지연 시간, 서비스 할당량, 한도
- 데이터 새로고침: 상태 허브 및 데이터 수집 대시보드의 정보는 약 15분마다 새로고침됩니다.
오류 해결
전체 오류 메시지 및 해결 방법 목록은 인제스트 문제 해결을 참고하세요.
도움이 더 필요하신가요? 커뮤니티 회원 및 Google SecOps 전문가에게 문의하여 답변을 받으세요.