BigQuery テーブルのデータリネージを追跡する
このドキュメントでは、BigQuery テーブルのデータリネージを追跡する方法について説明します。データリネージとは、データの取り込み元、変換方法、時間の経過に伴う移動先を追跡するプロセスです。データリネージを理解することは、コンプライアンスの確保、データに関する問題のトラブルシューティング、根本原因の分析を行ううえで非常に重要です。
このクイックスタートでは、BigQuery テーブルのデータリネージを開始する方法について説明します。
一般公開されている
new_york_taxi_tripsデータセットから 2 つのテーブルをコピーします。両テーブルのタクシー乗車数を集計して新しいテーブルにします。
3 つすべての操作のリネージ可視化グラフを表示します。
始める前に
プロジェクトを設定します。
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
If you're using an existing project for this guide, verify that you have the permissions required to complete this guide. If you created a new project, then you already have the required permissions.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Dataplex, BigQuery, and Data Lineage APIs.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.
必要なロール
リネージの可視化グラフを確認するために必要な権限を取得するには、次の IAM ロールを付与するよう管理者に依頼してください。
- Knowledge Catalog(旧称: Dataplex Universal Catalog)リソース プロジェクトに対する Dataplex Catalog 閲覧者 (
roles/dataplex.catalogViewer) - BigQuery を使用するプロジェクトに対するデータリネージ閲覧者 (
roles/datalineage.viewer) - BigQuery を使用するプロジェクトに対する BigQuery データ閲覧者(
roles/bigquery.dataViewer)
ロールの付与については、プロジェクト、フォルダ、組織へのアクセス権の管理をご覧ください。
一般公開データセットをプロジェクトに追加する
Google Cloud コンソールで、[BigQuery] ページに移動します。
左側のペインで、 エクスプローラをクリックします。
![ハイライト表示された [エクスプローラ] ペインのボタン。](https://docs.cloud.google.com/static/bigquery/images/explorer-tab.png?hl=ja)
左側のペインが表示されていない場合は、 左ペインを開くをクリックしてペインを開きます。
[エクスプローラ] ペインで [データを追加] をクリックします。
[データを追加] ペインで [一般公開データセット] を選択します。
[Marketplace] ペインで「
NYC TLC Trips」を検索し、[NYC TLC Trips] の結果をクリックします。[データセットを表示] をクリックします。
これにより、一般公開データセットのプロジェクトがリファレンスとして追加され、[エクスプローラ] ペインで確認できるようになります。詳細ペインには [データセット情報] が表示され、[データセット ID]、[データのロケーション]、[最終更新] 日時などの情報が示されます。
プロジェクトにデータセットを作成する
左側のペインで、 エクスプローラをクリックします。

[エクスプローラ] ペインで、データセットを作成するプロジェクトを選択します。
アクションを表示、[データセットを作成] の順にクリックします。
[データセットの作成] ページの [データセット ID] フィールドに「
data_lineage_demo」と入力します。他のフィールドはデフォルト値のままにします。[データセットを作成] をクリックします。
[エクスプローラ] ペインで [データセット] をクリックし、新しく追加された
data_lineage_demoをクリックします。
詳細ペインに [データセット情報] が表示されます。
一般公開されている 2 つのテーブルをデータセットにコピーする
クエリエディタを開きます。詳細ペインで、
data_lineage_demoという名前のタブの横にある [SQL クエリ] をクリックします。このステップでは、Untitledというタブが作成されます。クエリエディタで、次のクエリを入力して 1 番目のテーブルをコピーします。
PROJECT_IDはプロジェクトの ID に置き換えます。CREATE TABLE `PROJECT_ID.data_lineage_demo.nyc_green_trips_2021` COPY `bigquery-public-data.new_york_taxi_trips.tlc_green_trips_2021`[ 実行] をクリックします。このステップでは、
nyc_green_trips_2021という 1 番目のテーブルを作成します。[クエリ結果] ペインで、[テーブルに移動] をクリックします。このステップでは、1 番目のテーブルの内容が表示されます。
クエリエディタで、前のクエリを次のクエリに置き換えて、2 番目のテーブルをコピーします。
PROJECT_IDはプロジェクトの ID に置き換えます。CREATE TABLE `PROJECT_ID.data_lineage_demo.nyc_green_trips_2022` COPY `bigquery-public-data.new_york_taxi_trips.tlc_green_trips_2022`[ 実行] をクリックします。このステップでは、
nyc_green_trips_2022という 2 番目のテーブルを作成します。[クエリ結果] ペインで、[テーブルに移動] をクリックします。このステップでは、2 番目のテーブルの内容が表示されます。
データを集計して新しいテーブルにする
クエリエディタで、次のクエリを入力します。
PROJECT_IDはプロジェクトの ID に置き換えます。CREATE TABLE `PROJECT_ID.data_lineage_demo.total_green_trips_22_21` AS SELECT vendor_id, COUNT(*) AS number_of_trips FROM ( SELECT vendor_id FROM `PROJECT_ID.data_lineage_demo.nyc_green_trips_2022` UNION ALL SELECT vendor_id FROM `PROJECT_ID.data_lineage_demo.nyc_green_trips_2021` ) GROUP BY vendor_id[ 実行] をクリックします。このステップでは、
total_green_trips_22_21という名前の結合されたテーブルを作成します。[クエリ結果] ペインで、[テーブルに移動] をクリックします。このステップでは、結合されたテーブルが表示されます。
Knowledge Catalog でリネージグラフを表示する
Google Cloud コンソールで、Knowledge Catalog の [検索] ページに移動します。
検索プラットフォームが [Data Catalog] に設定されている場合は、[検索プラットフォームの選択] メニューで [Knowledge Catalog] を選択します。
[検索] ボックスに「
total_green_trips_22_21」と入力し、[検索] をクリックします。結果リストで [
total_green_trips_22_21] をクリックします。このステップでは、BigQuery テーブルの [詳細] タブが表示されます。[リネージ] タブをクリックします。
リネージグラフで、長方形の各ノードはテーブル(元のテーブル、コピーされたテーブル、結合されたテーブルのいずれか)を表します。以下の操作を行うことができます。
テーブルの元データを表示または非表示にするには、[+](開く)または [-](閉じる)をクリックします。
テーブル情報を表示するには、ノードをクリックします。このステップでは、ノードの [詳細] ペインが表示されます。
プロセス情報を表示するには、
をクリックします。このステップでは、ソーステーブルをターゲット テーブルに変換したジョブを示すプロセスの [詳細] ペインが表示されます。
クリーンアップ
このページで使用したリソースについて、 Google Cloud アカウントに課金されないようにするには、次の手順を実施します。
プロジェクトを削除する
- Google Cloud コンソールで [リソースの管理] ページに移動します。
- プロジェクト リストで、削除するプロジェクトを選択し、[削除] をクリックします。
- ダイアログでプロジェクト ID を入力し、[シャットダウン] をクリックしてプロジェクトを削除します。
データセットを削除する
Google Cloud コンソールで、[BigQuery] ページに移動します。
左側のペインで、 エクスプローラをクリックします。

[エクスプローラ] ペインで、作成した
data_lineage_demoデータセットを検索します。データセットをクリックし、[削除] をクリックします。
削除が実行されたことを確認します。
次のステップ
- データリネージの詳細を学習する。
- BigQuery クエリを実行する方法を学習する。
- データリネージを使用する方法を確認する。
- Knowledge Catalog とデータリネージのクライアント ライブラリの使用方法を学習する。
- Knowledge Catalog の料金について学習する。
- Knowledge Catalog のユースケースを試す。