Mengintegrasikan Managed Service untuk Apache Kafka dengan layanan Google Cloud lainnya

Dokumen ini memberikan saran kepada developer, arsitek, dan pengambil keputusan tentang opsi untuk mengintegrasikan Managed Service for Apache Kafka dengan layanan Google Cloud lain.

Tabel berikut mencantumkan beberapa faktor yang perlu dipertimbangkan saat memilih solusi integrasi untuk data Kafka Anda di Google Cloud.

SolusiKasus penggunaan
Kafka Connect

Tugas integrasi data umum

Mereplikasi data Kafka antar-cluster

Ketersediaan tinggi/pemulihan dari bencana (disaster recovery)

Dataflow

Pipeline data bervolume tinggi

Transformasi data atau agregasi data yang kompleks

Penampilan jendela lanjutan

Managed Service untuk Apache Spark

Berintegrasi dengan workload Apache Spark yang ada

Memigrasikan workload Apache Spark ke Google Cloud

Menggunakan Kafka Connect

Kafka Connect menyediakan framework untuk streaming data antara Kafka dan sistem lainnya. Managed Service untuk Apache Kafka memungkinkan Anda menyediakan cluster yang menjalankan Kafka Connect.

Kafka Connect direkomendasikan untuk sebagian besar tugas integrasi data umum yang memiliki konektor yang didukung. Kafka Connect dengan MirrorMaker 2.0 direkomendasikan untuk mereplikasi data antar-cluster Kafka, misalnya dalam arsitektur ketersediaan tinggi dan pemulihan dari bencana (HA/DR).

Keuntungan menggunakan Kafka Connect meliputi:

  • Konektor bawaan untuk sumber dan tujuan seperti BigQuery, Cloud SQL, dan Cloud Storage.

  • Terintegrasi sepenuhnya ke dalam Managed Service untuk Apache Kafka, yang menyederhanakan pengelolaan, operasi, dan pemantauan.

  • Dukungan untuk pemfilteran dan transformasi per pesan.

Menggunakan Dataflow

Dataflow adalah platform streaming terkelola yang dibangun di project Apache Beam open source. Anda dapat menjalankan pipeline Dataflow untuk menulis data Kafka ke tujuan seperti BigQuery dan Cloud Storage.

Pertimbangkan untuk menggunakan Dataflow dalam skenario berikut:

  • Pipeline data bervolume tinggi. Tugas Dataflow dapat ditingkatkan skalanya hingga ribuan worker. Dataflow juga mendukung penskalaan otomatis horizontal, dengan menambahkan atau menghapus worker sesuai kebutuhan.

  • Pipeline data yang memerlukan transformasi kompleks, seperti pembersihan, pengayaan, atau penggabungan data.

  • Mengintegrasikan AI dan ML ke dalam pipeline data Anda.

  • Menggabungkan beberapa aliran data dengan kontrol terperinci atas penentuan jendela dan penanganan data yang terlambat tiba.

Untuk men-deploy pipeline Dataflow, Anda dapat menjalankan template bawaan atau membuat pipeline Apache Beam. Untuk skenario integrasi data umum, pertimbangkan untuk menjalankan template. Untuk fleksibilitas dan kontrol maksimum, atau jika pipeline Anda memerlukan logika kustom, buat pipeline Apache Beam.

Menggunakan Managed Service untuk Apache Spark

Managed Service untuk Apache Spark memungkinkan Anda menjalankan workload Apache Spark menggunakan model serverless atau model berbasis cluster.

Pertimbangkan untuk menggunakan Managed Service untuk Apache Spark dengan data Kafka Anda jika Anda memiliki pipeline Spark yang sudah ada. Misalnya, jika Anda memiliki aplikasi Spark yang memproses data streaming dari Kafka, dan Anda ingin memigrasikan aplikasi ini ke Google Cloud, Managed Service untuk Apache Spark adalah pilihan yang tepat.

Langkah berikutnya

Apache Kafka® adalah merek dagang terdaftar milik The Apache Software Foundation atau afiliasinya di Amerika Serikat dan/atau negara lainnya.