Managed Service for Apache Kafka を他の Google Cloud サービスと統合する

このドキュメントでは、Managed Service for Apache Kafka を他の Google Cloudサービスと統合するためのオプションについて、デベロッパー、アーキテクト、意思決定者に説明します。

次の表に、 Google Cloudの Kafka データの統合ソリューションを選択する際に考慮すべき要素をいくつか示します。

解決策ユースケース
Kafka Connect

一般的なデータ統合タスク

クラスタ間の Kafka データの複製

高可用性/障害復旧

Dataflow

大容量のデータ パイプライン

複雑なデータ変換またはデータ集計

高度なウィンドウ処理

Managed Service for Apache Spark

既存の Apache Spark ワークロードと統合する

Apache Spark ワークロードを Google Cloudに移行する

Kafka Connect を使用する

Kafka Connect は、Kafka と他のシステム間でデータをストリーミングするためのフレームワークを提供します。Managed Service for Apache Kafka を使用すると、Kafka Connect を実行するクラスタをプロビジョニングできます。

Kafka Connect は、サポートされているコネクタがある一般的なデータ統合タスクに推奨されます。Kafka クラスタ間でデータを複製する場合は、MirrorMaker 2.0 を使用した Kafka Connect をおすすめします。たとえば、高可用性と障害復旧(HA/DR)アーキテクチャなどです。

Kafka Connect を使用するメリットは次のとおりです。

  • BigQuery、Cloud SQL、Cloud Storage などのソースとシンク用の組み込みコネクタ。

  • Managed Service for Apache Kafka に完全に統合されているため、管理、運用、モニタリングが簡素化されます。

  • フィルタリングとメッセージごとの変換のサポート。

Dataflow を使用する

Dataflow は、オープンソースの Apache Beam プロジェクトで構築されたマネージド ストリーミング プラットフォームです。Dataflow パイプラインを実行して、Kafka データを BigQuery や Cloud Storage などのシンクに書き込むことができます。

次のシナリオでは Dataflow の使用を検討してください。

  • 大容量のデータ パイプライン。Dataflow ジョブは、数千のワーカーにスケールアップできます。Dataflow は水平自動スケーリングもサポートしており、必要に応じてワーカーを追加または削除します。

  • データ クリーニング、拡充、集計などの複雑な変換が必要なデータ パイプライン。

  • AI と ML をデータ パイプラインに統合する。

  • ウィンドウ処理と遅延データの処理をきめ細かく制御して、複数のデータ ストリームを結合します。

Dataflow パイプラインをデプロイするには、ビルド済みのテンプレートを実行するか、Apache Beam パイプラインを作成します。一般的なデータ統合シナリオでは、テンプレートの実行を検討してください。最大限の柔軟性と制御が必要な場合や、パイプラインにカスタム ロジックが必要な場合は、Apache Beam パイプラインを作成します。

Managed Service for Apache Spark を使用する

Managed Service for Apache Spark を使用すると、サーバーレス モデルまたはクラスタベースのモデルを使用して Apache Spark ワークロードを実行できます。

既存の Spark パイプラインがある場合は、Kafka データで Managed Service for Apache Spark の使用を検討してください。たとえば、Kafka からのストリーミング データを処理する Spark アプリケーションがあり、このアプリケーションをGoogle Cloudに移行する場合は、Managed Service for Apache Spark が適しています。

次のステップ

Apache Kafka® は、Apache Software Foundation または米国その他の諸国における関連会社の商標です。