Dokumen ini memberikan saran kepada developer, arsitek, dan pengambil keputusan tentang opsi untuk mengintegrasikan Managed Service for Apache Kafka dengan layanan Google Cloud lain.
Tabel berikut mencantumkan beberapa faktor yang perlu dipertimbangkan saat memilih solusi integrasi untuk data Kafka Anda di Google Cloud.
| Solusi | Kasus penggunaan |
|---|---|
| Kafka Connect |
Tugas integrasi data umum Mereplikasi data Kafka antar-cluster Ketersediaan tinggi/pemulihan dari bencana (disaster recovery) |
| Dataflow |
Pipeline data bervolume tinggi Transformasi data atau agregasi data yang kompleks Penampilan jendela lanjutan |
| Managed Service untuk Apache Spark |
Berintegrasi dengan workload Apache Spark yang ada Memigrasikan workload Apache Spark ke Google Cloud |
Menggunakan Kafka Connect
Kafka Connect menyediakan framework untuk streaming data antara Kafka dan sistem lainnya. Managed Service untuk Apache Kafka memungkinkan Anda menyediakan cluster yang menjalankan Kafka Connect.
Kafka Connect direkomendasikan untuk sebagian besar tugas integrasi data umum yang memiliki konektor yang didukung. Kafka Connect dengan MirrorMaker 2.0 direkomendasikan untuk mereplikasi data antar-cluster Kafka, misalnya dalam arsitektur ketersediaan tinggi dan pemulihan dari bencana (HA/DR).
Keuntungan menggunakan Kafka Connect meliputi:
Konektor bawaan untuk sumber dan tujuan seperti BigQuery, Cloud SQL, dan Cloud Storage.
Terintegrasi sepenuhnya ke dalam Managed Service untuk Apache Kafka, yang menyederhanakan pengelolaan, operasi, dan pemantauan.
Dukungan untuk pemfilteran dan transformasi per pesan.
Menggunakan Dataflow
Dataflow adalah platform streaming terkelola yang dibangun di project Apache Beam open source. Anda dapat menjalankan pipeline Dataflow untuk menulis data Kafka ke tujuan seperti BigQuery dan Cloud Storage.
Pertimbangkan untuk menggunakan Dataflow dalam skenario berikut:
Pipeline data bervolume tinggi. Tugas Dataflow dapat ditingkatkan skalanya hingga ribuan worker. Dataflow juga mendukung penskalaan otomatis horizontal, dengan menambahkan atau menghapus worker sesuai kebutuhan.
Pipeline data yang memerlukan transformasi kompleks, seperti pembersihan, pengayaan, atau penggabungan data.
Mengintegrasikan AI dan ML ke dalam pipeline data Anda.
Menggabungkan beberapa aliran data dengan kontrol terperinci atas penentuan jendela dan penanganan data yang terlambat tiba.
Untuk men-deploy pipeline Dataflow, Anda dapat menjalankan template bawaan atau membuat pipeline Apache Beam. Untuk skenario integrasi data umum, pertimbangkan untuk menjalankan template. Untuk fleksibilitas dan kontrol maksimum, atau jika pipeline Anda memerlukan logika kustom, buat pipeline Apache Beam.
Menggunakan Managed Service untuk Apache Spark
Managed Service untuk Apache Spark memungkinkan Anda menjalankan workload Apache Spark menggunakan model serverless atau model berbasis cluster.
Pertimbangkan untuk menggunakan Managed Service untuk Apache Spark dengan data Kafka Anda jika Anda memiliki pipeline Spark yang sudah ada. Misalnya, jika Anda memiliki aplikasi Spark yang memproses data streaming dari Kafka, dan Anda ingin memigrasikan aplikasi ini ke Google Cloud, Managed Service untuk Apache Spark adalah pilihan yang tepat.
Langkah berikutnya
Pelajari Kafka Connect di Managed Service untuk Apache Kafka.
Menggunakan template Dataflow:
Buat pipeline Apache Beam:
Untuk Spark Streaming dan Kafka, Apache Spark menyediakan panduan integrasi.