이 문서에서는 개발자, 설계자, 의사결정권자에게 Managed Service for Apache Kafka를 다른 Google Cloud서비스와 통합하는 옵션을 안내합니다.
다음 표에는 Google Cloud에서 Kafka 데이터용 통합 솔루션을 선택할 때 고려해야 할 몇 가지 요소가 나와 있습니다.
| 솔루션 | 사용 사례 |
|---|---|
| Kafka Connect |
일반적인 데이터 통합 작업 클러스터 간 Kafka 데이터 복제 고가용성/재해 복구 |
| Dataflow |
대량 데이터 파이프라인 복잡한 데이터 변환 또는 데이터 집계 고급 윈도우 |
| Managed Service for Apache Spark |
기존 Apache Spark 워크로드와 통합 Apache Spark 워크로드를 Google Cloud로 마이그레이션 |
Kafka Connect 사용
Kafka Connect는 Kafka와 다른 시스템 간에 데이터를 스트리밍하기 위한 프레임워크를 제공합니다. Managed Service for Apache Kafka를 사용하면 Kafka Connect를 실행하는 클러스터를 프로비저닝할 수 있습니다.
지원되는 커넥터가 있는 가장 일반적인 데이터 통합 작업에는 Kafka Connect가 권장됩니다. MirrorMaker 2.0이 있는 Kafka Connect는 고가용성 및 재해 복구 (HA/DR) 아키텍처와 같이 Kafka 클러스터 간에 데이터를 복제하는 데 권장됩니다.
Kafka Connect 사용의 장점은 다음과 같습니다.
BigQuery, Cloud SQL, Cloud Storage와 같은 소스 및 싱크용 기본 제공 커넥터
Managed Service for Apache Kafka에 완전히 통합되어 관리, 운영, 모니터링이 간소화됩니다.
Dataflow 사용
Dataflow는 오픈소스 Apache Beam 프로젝트를 기반으로 빌드된 관리형 스트리밍 플랫폼입니다. Dataflow 파이프라인을 실행하여 Kafka 데이터를 BigQuery 및 Cloud Storage와 같은 싱크에 쓸 수 있습니다.
다음 시나리오에서는 Dataflow를 사용하는 것이 좋습니다.
대량 데이터 파이프라인 Dataflow 작업은 수천 명의 작업자로 확장할 수 있습니다. Dataflow는 필요에 따라 작업자를 추가하거나 삭제하는 수평 자동 확장도 지원합니다.
데이터 정리, 보강 또는 집계와 같은 복잡한 변환이 필요한 데이터 파이프라인
AI 및 ML을 데이터 파이프라인에 통합
윈도우 처리 및 늦게 도착하는 데이터 처리를 세밀하게 제어하여 여러 데이터 스트림을 조인합니다.
Dataflow 파이프라인을 배포하려면 사전 빌드된 템플릿을 실행하거나 Apache Beam 파이프라인을 만들면 됩니다. 일반적인 데이터 통합 시나리오의 경우 템플릿을 실행하는 것이 좋습니다. 유연성과 제어 기능을 최대한 활용하거나 파이프라인에 맞춤 로직이 필요한 경우 Apache Beam 파이프라인을 만드세요.
Managed Service for Apache Spark 사용
Managed Service for Apache Spark를 사용하면 서버리스 모델 또는 클러스터 기반 모델을 사용하여 Apache Spark 워크로드를 실행할 수 있습니다.
기존 Spark 파이프라인이 있는 경우 Kafka 데이터와 함께 Managed Service for Apache Spark를 사용하는 것이 좋습니다. 예를 들어 Kafka에서 스트리밍 데이터를 처리하는 Spark 애플리케이션이 있고 이 애플리케이션을Google Cloud로 마이그레이션하려는 경우 Managed Service for Apache Spark가 적합합니다.
다음 단계
Apache Kafka용 관리형 서비스의 Kafka Connect에 대해 알아봅니다.
Dataflow 템플릿을 사용합니다.
Apache Beam 파이프라인을 만듭니다.
Spark Streaming 및 Kafka의 경우 Apache Spark에서 통합 가이드를 제공합니다.