Cloud Storage データを検出してカタログ化する

Knowledge Catalog の自動検出(スタンドアロン検出とも呼ばれる Knowledge Catalog の機能)を使用すると、Cloud Storage バケット内のデータをスキャンしてメタデータを抽出してカタログ化できます。この一元化されたテーブルデータを使用すると、AI を活用したデータ分析情報、データ セキュリティ、ガバナンスを簡素化できます。

検出スキャンの概要

Cloud Storage データの自動検出を使用するには、検出スキャンを作成して実行します。検出スキャンは次の処理を行います。

  • Cloud Storage バケットまたはパス内のデータをスキャンします。
  • 構造化データと半構造化データをテーブルにグループ化します。
  • テーブル名、スキーマ、パーティション定義などのメタデータを収集します。
  • スキーマとパーティション定義を使用して、BigQuery で BigLake 外部テーブル、BigLake 以外の外部テーブル、または BigLake オブジェクトテーブルを作成および更新します。

構造化データと半構造化データ

構造化データと半構造化データには、Avro、Parquet、CSV などの形式が含まれます。検出スキャンは、これらのファイルのグループを BigLake 外部テーブルとして登録します。スキャンは、同じデータ形式と互換性のあるスキーマを含むフォルダにある場合にのみファイルを検出します。

  • ユースケース: 厳密に型指定された構造化ファイルを BigQuery に一元化し、スキーマを手動で定義せずに分析 SQL クエリを実行します。
  • ワークフロー:
    1. 構造化されたファイルをフォルダに整理します。各フォルダ内のファイルが同じデータ形式を共有し、互換性のあるスキーマを持っていることを確認します。
    2. 検出スキャンを作成し、 Google Cloud リソース接続 ID を指定します。
    3. スキャンはデータをグループ化し、BigLake 外部テーブルとして登録します。
    4. SQL を使用して、BigQuery で公開されたテーブルを直接クエリします。

サポートされているファイル形式

  • Parquet
  • Avro
  • ORC
  • JSON(改行区切り形式のみ)
  • CSV(ただし、コメント行を含む CSV ファイルは除く)

圧縮形式

構造化データと半構造化データの場合、検出スキャンでは次の圧縮形式がサポートされています。

  • 次の形式の内部圧縮:

    圧縮 ファイル拡張子のサンプル 使用可能な形式
    gzip .gz.parquet Parquet
    LZ4 .lz4.parquet Parquet
    Snappy .snappy.parquet Parquet、ORC、Avro
    LZO .lzo.parquet Parquet、ORC
  • JSON ファイルと CSV ファイルの外部圧縮:

    • gzip
    • Bzip2

非構造化データ

画像や動画などの非構造化データの場合、検出スキャンは、同じデータファイル形式を共有するファイルのグループを検出して登録します。ファイルは、同じファイル形式を含むフォルダに配置する必要があります。たとえば、検出スキャンで 2 つの BigLake オブジェクト テーブルを検出して登録するには、gs://images/group1 には GIF 画像のみが含まれ、gs://images/group2 には JPEG 画像のみが含まれている必要があります。

  • ユースケース: BigQuery ML またはリモート関数を使用して ML 推論を実行するために、画像やドキュメントなどの非構造化ファイルをカタログに登録します。
  • ワークフロー:
    1. 非構造化ファイルをフォルダに整理します。各フォルダ内のファイルが同じファイル形式であることを確認します。
    2. 検出スキャンを作成します。
    3. スキャンは非構造化データをグループ化し、BigLake オブジェクト テーブルとして登録します。
    4. BigQuery で非構造化ファイルに対して推論を直接実行します。

サポートされているファイル形式

検出スキャンは、次の非構造化形式をサポートしています。

  • 画像(JPEG、PNG、BMP など)
  • ドキュメント(PDF、スライド プレゼンテーション、テキスト レポートなど)
  • 音声または動画(WAV、MP3、MP4 など)

詳しくは、サポートされているオブジェクト ファイルをご覧ください。

圧縮形式

オブジェクト テーブルの場合、圧縮は BigQuery の内部設定ではなく、主に Cloud Storage オブジェクト メタデータを介して管理されます。

  • 標準メタデータ圧縮: 標準の .gz または .bz2 拡張子を使用している場合、BigQuery は gzip と bzip2 で圧縮されたファイルを自動的に認識します。
  • Content-Encoding: Cloud Storage の Content-Encoding gzip メタデータを使用すると、元のコンテンツ タイプを維持しながら圧縮ファイルを配信できます。
  • メディア内部圧縮: 本質的に圧縮されている形式(画像の JPEG、音声の MP3、動画の MP4 など)はネイティブにサポートされます。

テーブルの登録と可用性

検出されたテーブルは、データ形式とスキャン構成に応じて、次のいずれかのテーブルタイプとして BigQuery に登録されます。

  • BigLake オブジェクト テーブル。画像や動画などの非構造化データ用に作成されています。オブジェクト テーブルは、Cloud Storage 内の非構造化データのメタデータ インデックスを提供します。詳細については、オブジェクト テーブルの概要をご覧ください。
  • BigLake 外部テーブル。スキャン構成時に Google Cloud リソース接続 ID を指定すると、構造化データと半構造化データ用に作成されます。BigLake テーブルを使用すると、外部データストアの構造化データをクエリできます。詳細については、BigLake テーブルの概要をご覧ください。
  • 外部テーブル(BigLake 以外)。リソース接続 ID を指定しない場合は、構造化データと半構造化データ用に作成されます。外部テーブルを使用すると、外部データストアの構造化データをクエリできます。詳細については、外部テーブルの概要をご覧ください。

この登録により、データを BigQuery で分析できるようになります。BigLake テーブルとオブジェクト テーブルのメタデータ キャッシュ保存も有効になります。すべての BigLake テーブルは、検索と見つけやすさのために Knowledge Catalog に自動的に取り込まれます。

新しく登録したテーブルの操作を開始するには、次の操作を行います。

制限と割り当て

検出スキャンは、Apache Iceberg テーブル形式と Delta Lake テーブル形式をサポートしていません。

検出スキャンでサポートされるテーブル数の上限については、割り当てと上限をご覧ください。

始める前に

Dataplex API が有効になっていない場合は、有効にします。

API を有効にするために必要なロール

API を有効にするには、serviceusage.services.enable 権限が必要です。プロジェクトを作成した場合は、オーナーロール(roles/owner)を介してこの権限がすでに付与されている可能性があります。それ以外の場合は、Service Usage 管理者ロール(roles/serviceusage.serviceUsageAdmin)を介してこの権限を取得できます。ロールを付与する方法を確認する。

API の有効化

Knowledge Catalog サービス アカウントに必要なロール

始める前に、プロジェクトの Knowledge Catalog サービス アカウントに IAM 権限を割り当てます。

  service-PROJECT_NUMBER@gcp-sa-dataplex.iam.gserviceaccount.com
  

PROJECT_NUMBER は、Dataplex API が有効になっているプロジェクトに置き換えます。

Knowledge Catalog サービス アカウントに検出スキャンの作成と実行に必要な権限が付与されるように、Knowledge Catalog サービス アカウントに次の IAM ロールを付与するよう管理者に依頼してください。

ロールの付与については、プロジェクト、フォルダ、組織へのアクセス権の管理をご覧ください。

これらの事前定義ロールには、検出スキャンの作成と実行に必要な権限が含まれています。必要とされる正確な権限については、「必要な権限」セクションを開いてご確認ください。

必要な権限

検出スキャンを作成して実行するには、次の権限が必要です。

  • データソース プロジェクトに対する bigquery.datasets.create
  • データソース バケットに対する storage.buckets.get
  • データソース バケットに対する storage.objects.get
  • データソース バケットに対する storage.objects.list
  • データソース プロジェクトに対する bigquery.datasets.get
  • 接続を指定します。
    • BigQuery 接続に対する bigquery.connections.delegate
    • BigQuery 接続に対する bigquery.connections.use

管理者は、Knowledge Catalog サービス アカウントに、カスタムロールや他の事前定義ロールを付与することもできます。

BigQuery 接続サービス アカウントに必要なロール

BigQuery Connection サービス アカウントに検出スキャンの作成に必要な権限があることを確認するには、Cloud Storage バケットに対する Dataplex 検出サービス エージェント (roles/dataplex.discoveryServiceAgent)IAM ロールを BigQuery Connection サービス アカウントに付与するよう管理者に依頼してください。

ロールの付与については、プロジェクト、フォルダ、組織へのアクセス権の管理をご覧ください。

この事前定義ロールには、検出スキャンの作成に必要な権限が含まれています。必要とされる正確な権限については、「必要な権限」セクションを開いてご確認ください。

必要な権限

検出スキャンを作成するには、次の権限が必要です。

  • データソース プロジェクトに対する bigquery.datasets.create
  • データソース バケットに対する storage.buckets.get
  • データソース バケットに対する storage.objects.get
  • データソース バケットに対する storage.objects.list
  • データソース プロジェクトに対する bigquery.datasets.get
  • 接続を指定します。
    • BigQuery 接続に対する bigquery.connections.delegate
    • BigQuery 接続に対する bigquery.connections.use

管理者は、BigQuery 接続のサービス アカウントにカスタムロールや他の事前定義ロールを付与することもできます。

エンドユーザーに必要なロール

データ検出スキャンの作成と管理に必要な権限を取得するには、Cloud Storage バケットに対する次の IAM ロールを付与するよう管理者に依頼してください。

  • DataScan リソースに対する完全アクセス権: プロジェクトに対する Dataplex DataScan 管理者(roles/dataplex.dataScanAdmin)
  • DataScan リソースに対する書き込みアクセス権: プロジェクトに対する Dataplex DataScan 編集者(roles/dataplex.dataScanEditor)
  • DataScan リソースへの読み取りアクセス(結果を除く): プロジェクトに対する Dataplex DataScan 閲覧者(roles/dataplex.dataScanViewer)
  • 結果を含む DataScan リソースへの読み取りアクセス権: プロジェクトに対する Dataplex DataScan データ閲覧者(roles/dataplex.dataScanDataViewer)

ロールの付与については、プロジェクト、フォルダ、組織へのアクセス権の管理をご覧ください。

これらの事前定義ロールには、データ検出スキャンの作成と管理に必要な権限が含まれています。必要とされる正確な権限については、「必要な権限」セクションを開いてご確認ください。

必要な権限

データ検出スキャンの作成と管理には、次の権限が必要です。

  • DataScan を作成する: プロジェクトに対する dataplex.datascans.create
  • DataScan を削除する: プロジェクトまたは DataScan リソースに対する dataplex.datascans.delete
  • 結果を除く DataScan の詳細を表示する: プロジェクトまたは DataScan リソースに対する dataplex.datascans.get
  • 結果を含む DataScan の詳細を表示する: プロジェクトまたは DataScan リソースに対する dataplex.datascans.getData
  • DataScan を一覧表示する: プロジェクトまたは DataScan リソースに対する dataplex.datascans.list
  • DataScan を実行する: プロジェクトまたは DataScan リソースに対する dataplex.datascans.run
  • DataScan の説明を更新する: プロジェクトまたは DataScan リソースに対する dataplex.datascans.update
  • DataScan の IAM 権限を表示する: プロジェクトまたは DataScan リソースに対する dataplex.datascans.getIamPolicy
  • DataScan の IAM 権限を設定する: プロジェクトまたは DataScan リソースに対する dataplex.datascans.setIamPolicy

カスタムロールや他の事前定義ロールを使用して、これらの権限を取得することもできます。

検出スキャンを作成する

データを検出するには、検出スキャンを作成して実行する必要があります。スキャンのスケジュールを設定することも、スキャンをオンデマンドで実行することもできます。

検出スキャンが実行されると、スキャンされた Cloud Storage バケットに対応する新しいデータセットが BigQuery に作成されます。BigQuery データセット名は Cloud Storage バケット名と同じです。バケット名の無効な文字は、アンダースコアに置き換えられます。データセット名を使用できない場合は、接尾辞が追加されます(例: _discovered_001)。このデータセットには、詳細な分析のために検出スキャンによって作成された BigLake 外部テーブルまたは BigLake 以外の外部テーブルが含まれています。

コンソール

  1. Google Cloud コンソールで、[Cloud Storage 検出] ページに移動します。

    Cloud Storage の検出に移動

  2. [作成] をクリックします。

  3. スキャンの名前を入力します。

  4. [ID] フィールドに、 Google Cloudのリソース命名規則に沿った一意の ID を入力します。ID を指定しない場合、検出スキャンによってスキャン ID が生成されます。

  5. 省略可: スキャンの説明を指定します。

  6. スキャンするファイルを含む Cloud Storage バケットを指定するには、[バケット] フィールドでバケットを参照して選択します。

  7. 省略可: ファイル フィルタリング用の glob パターンのリストを指定して、検出スキャンに含めるデータまたは除外するデータを定義します。Knowledge Catalog は、次の glob パターンをサポートしています。

    • *: ディレクトリ境界を越えずに、0 個以上の文字と一致します。たとえば、*.csv は file.csv と一致しますが、folder/file.csv とは一致しません。
    • **: ディレクトリ境界を越えて 0 個以上の文字と一致します。たとえば、**/*.csv は file.csv や folder/subfolder/file.csv と一致します。
    • ?: 1 文字と完全に一致します。たとえば、file_?.csv は file_1.csv および file_a.csv と一致しますが、file_10.csv とは一致しません。
    • [...]: 文字セット内の 1 つの文字と一致します。たとえば、[abc] は a、b、c に一致し、[a-z] は小文字に一致します。
    • {...}: サブパターンのカンマ区切りのリストに一致します。たとえば、{sun,moon,stars} は sun、moon、stars と一致します。
    • \: 文字(*、?、\)をエスケープします。たとえば、file\*.csv はリテラル ファイル名 file*.csv と一致します。

    次のタイプのパターンを指定できます。

    • 含める: データのサブセットのみをスキャンする場合は、含めるオブジェクトに一致する glob パターンのリストを指定します。
    • 除外: 除外するオブジェクトに一致する glob パターンのリストを指定します。

    たとえば、gs://test_bucket/foo/.. を検出スキャンから除外するには、除外パスとして **/foo/** を入力します。引用符はエラーの原因となります。"**/foo/**" ではなく **/foo/** を入力してください。

    包含パターンと除外パターンの両方を指定すると、除外パターンが最初に適用されます。

  8. 省略可: [プロジェクト ID] で、検出スキャンによって作成された BigLake 外部テーブルまたは BigLake 以外の外部テーブルを含む BigQuery データセット プロジェクトを選択します。指定しない場合、データセットは Cloud Storage バケットを含むプロジェクトに作成されます。

  9. [ロケーション タイプ] で、BigQuery 公開データセットが作成される [リージョン] または [マルチリージョン](使用可能な方)を選択します。

  10. スキャンされたデータから BigLake テーブルを作成するには、[接続 ID] フィールドに Google Cloud リソース接続 ID を指定します。詳細については、BigQuery のGoogle Cloud リソース接続をご覧ください。

    BigQuery データセットのロケーションと同じロケーションに新しい接続 ID を作成できます。これは、Cloud Storage バケットのロケーションと互換性があります。

    リソース接続 ID を指定しない場合、検出スキャンは BigLake 以外の外部テーブルを作成します。これらの外部テーブル タイプの違いと、検出サービスが一方を選択する理由については、動作の違いの比較をご覧ください。

  11. [検出頻度] セクションで、検出スキャンを実行するタイミングを構成します。

    • 繰り返し: 事前定義されたスケジュールでスキャンが実行されます。開始時間、スキャンを実行する日数、頻度(1 時間ごとなど)を指定します。

    • オンデマンド: スキャンはオンデマンドで実行されます。

  12. 省略可: [JSON または CSV の仕様] セクションで、スキャンで JSON ファイルと CSV ファイルを処理する方法を指定します。[JSON または CSV の仕様] をクリックします。

    1. JSON オプションを構成するには、[JSON 解析オプションを有効にする] を選択します。
      • 型推論を無効にする: データのスキャン時に検出スキャンでデータ型を推論するかどうか。JSON データの型推定を無効にすると、すべての列がプリミティブ型(文字列、数値、ブール値など)として登録されます。
      • エンコード形式: UTF-8、US-ASCII、ISO-8859-1 など、データの文字エンコード。値を指定しない場合、デフォルトとして UTF-8 が使用されます。
    2. CSV オプションを構成するには、[CSV 解析オプションを有効にする] を選択します。
      • 型推論を無効にする: データのスキャン時に検出スキャンでデータ型を推論するかどうか。CSV データの型推定を無効にすると、すべての列が文字列として登録されます。
      • ヘッダー行: ヘッダー行の数(0 または 1)。値 0 を指定すると、検出スキャンは見出しを推測し、ファイルから列名を抽出します。デフォルトは 0 です。
      • 列区切り文字: 値を区切るために使用される文字。単一の文字(\r(改行)または \n(改行))を指定します。デフォルトはカンマです。(,)
      • エンコード形式: データの文字エンコード(UTF-8、US-ASCII、ISO-8859-1 など)。値を指定しない場合、デフォルトとして UTF-8 が使用されます。
  13. [作成](スケジュール設定されたスキャンの場合)、[今すぐ実行](オンデマンド スキャンの場合)、[作成して実行](1 回限りのスキャンの場合)をクリックします。

    • スケジュール設定されたスキャン: 設定したスケジュールに沿って実行されます。
    • オンデマンド スキャン: 作成時に最初に 1 回実行され、いつでも実行できます。検出スキャンの実行には数分かかることがあります。
    • 1 回限りのスキャン: 自動的に実行されます。定義された有効期間(TTL)のしきい値に達すると、自動的に削除されます。TTL は、検出スキャンが実行後にアクティブな状態を維持する期間を決定する値です。TTL 値は 0 秒(即時削除)から 365 日の範囲で設定できます。TTL が指定されていない検出スキャンは、24 時間後に自動的に削除されます。

gcloud

検出スキャンを作成するには、gcloud dataplex datascans create data-discovery コマンドを使用します。

gcloud dataplex datascans create data-discovery --location=LOCATION \
  --data-source-resource=BUCKET_PATH

次のように置き換えます。

  • LOCATION: 検出スキャンを作成するロケーション
  • BUCKET_PATH: スキャンするバケットの Cloud Storage パス

REST

検出スキャンを作成するには、dataScans.create メソッドを使用します。

公開された BigLake テーブルに対してクエリを実行する

検出スキャンを実行すると、BigLake テーブルが BigQuery の新しいデータセットに公開されます。テーブルは、BigQuery で SQL を使用して分析できます。

BigQuery でテーブルを表示またはクエリできます。BigQuery でクエリを実行する方法については、クエリを実行するをご覧ください。

公開された BigLake テーブルを管理する

公開された BigLake テーブルは、検出スキャンによって BigQuery で作成および管理されます。デフォルトでは、検出スキャンは、スケジュール設定されたスキャンまたはオンデマンド スキャンが実行されるたびに、新しいデータの検出、スキーマ推定、スキーマの進化を処理します。メタデータがスキャンによって管理されていることを示すため、スキャンは metadata-managed-mode ラベルが discovery-managed に設定されたテーブルを公開します。

スキーマや CSV オプション、JSON オプションなどの他のメタデータを自分で管理する場合は、metadata-managed-mode ラベルを user_managed に設定します。これにより、次の検出スキャンを実行してもスキーマは変更されません。この方法は、検出スキャンで推定されたスキーマが正しくない場合や、特定のテーブルで想定されるスキーマと異なる場合に役立ちます。metadata-managed-mode ラベルが user_managed に設定されている場合、費用を削減できます。

ラベルを更新するには、ラベルキーの値 metadata-managed-mode を discovery-managed ではなく user_managed に編集します。この場合、user_managed ラベルがテーブルに添付されている限り、検出スキャンによってテーブルのスキーマが更新されることはありません。

公開された BigLake テーブルを更新する

デフォルト構成で検出スキャンジョブを使用して公開された BigLake テーブルの場合、スキーマとその他のメタデータは、スケジュールされた頻度で実行される検出スキャンのジョブごとに自動的に更新されます。

公開済みの BigLake テーブルを更新する手順は次のとおりです。

  1. Google Cloud コンソールで、[BigQuery] ページに移動します。

    [BigQuery] に移動

  2. 1 つ以上のテーブル プロパティを更新します。

  3. 左側のペインで、 [エクスプローラ] をクリックします。

    ハイライト表示された [エクスプローラ] ペインのボタン。

    左側のペインが表示されていない場合は、 [左ペインを開く] をクリックしてペインを開きます。

  4. [エクスプローラ] ペインでプロジェクトを開き、[データセット] をクリックして、データセットを選択します。

  5. [概要] > [テーブル] をクリックし、テーブルを選択します。

  6. [詳細] タブの [ラベル] セクションで、metadata-managed-mode ラベルが user_managed に設定されていることを確認します。別の値に設定されている場合は、次の手順を行います。

    1. 「詳細を編集」をクリックします。

    2. [metadata-managed-mode] キーの横にある [値] フィールドに「user_managed」と入力します。

公開された BigLake テーブルを削除する

公開済みの BigLake テーブルを削除する手順は次のとおりです。

  1. Cloud Storage バケット内のテーブルのデータファイルを削除します。

  2. Google Cloud コンソールで、[BigQuery] ページに移動します。

    [BigQuery] に移動

  3. 左側のペインで、 [エクスプローラ] をクリックします。

    エクスプローラ ペインのボタンがハイライト表示されている。

  4. [エクスプローラ] ペインでプロジェクトを開き、[データセット] をクリックして、データセットを選択します。

  5. [概要] > [テーブル] をクリックし、テーブルを選択します。

  6. [詳細] ペインの [ラベル] セクションで、metadata-managed-mode ラベルが user_managed に設定されていないことを確認します。user_managed に設定されている場合は、次の手順を行います。

    1. 詳細を編集 をクリックします。

    2. [metadata-managed-mode] キーの横にある [値] フィールドに「discovery-managed」と入力します。

  7. [実行] をクリックします。検出スキャンはオンデマンドで実行されます。

検出スキャンが実行されると、BigLake テーブルは BigQuery で削除され、Spark でリストまたはクエリできなくなります。

検出スキャンをオンデマンドで実行する

オンデマンドで検出スキャンを実行するには、次のいずれかのオプションを選択します。

コンソール

  1. Google Cloud コンソールで、[Cloud Storage 検出] ページに移動します。

    Cloud Storage の検出に移動

  2. 実行する検出スキャンをクリックします。

  3. [今すぐ実行] をクリックします。

gcloud

検出スキャンを実行するには、gcloud dataplex datascans run コマンドを使用します。

gcloud dataplex datascans run DATASCAN \
  --location=LOCATION

次の変数を置き換えます。

  • LOCATION: 検出スキャンが作成された Google Cloud リージョン。
  • DATASCAN: 検出スキャンの名前。

REST

検出スキャンをオンデマンドで実行するには、Dataplex API の dataScans.run メソッドを使用します。

検出スキャンを一覧表示する

検出スキャンを一覧表示するには、次のいずれかのオプションを選択します。

コンソール

  1. Google Cloud コンソールで、[Cloud Storage 検出] ページに移動します。

    Cloud Storage の検出に移動

  2. プロジェクトで作成された検出スキャンが一覧表示されます。

gcloud

gcloud dataplex datascans list --location=LOCATION --project=PROJECT_ID

次のように置き換えます。

  • LOCATION: プロジェクトのロケーション
  • PROJECT_ID: 実際の Google Cloud プロジェクト ID

REST

プロジェクト内の検出スキャンのリストを取得するには、Dataplex API の dataScans.list メソッドを使用します。

検出スキャンを表示する

検出スキャンを表示するには、次のいずれかのオプションを選択します。

コンソール

  1. Google Cloud コンソールで、[Cloud Storage 検出] ページに移動します。

    Cloud Storage の検出に移動

  2. 詳細を表示する検出スキャンをクリックします。

    • [スキャンの詳細] セクションには、検出スキャンの詳細が表示されます。
    • [スキャンのステータス] セクションには、最新のスキャンジョブの検出結果が表示されます。

gcloud

gcloud dataplex datascans jobs describe JOB \
  --location=LOCATION \
  --datascan=DATASCAN \
  --view=FULL

次のように置き換えます。

  • JOB: 検出スキャンジョブのジョブ ID。
  • LOCATION: 検出スキャンが作成された Google Cloud リージョン。
  • DATASCAN: ジョブが属する検出スキャンの名前。

REST

データ検出スキャンの結果を表示するには、Dataplex API の dataScans.get メソッドを使用します。

過去の検出スキャン結果を表示する

過去の検出スキャン結果を表示するには、次のいずれかのオプションを選択します。

コンソール

  1. Google Cloud コンソールで、[Cloud Storage 検出] ページに移動します。

    Cloud Storage の検出に移動

  2. 詳細を表示する検出スキャンをクリックします。

  3. [スキャン履歴] ペインをクリックします。[スキャン履歴] ペインには、各ジョブでスキャンされたレコード数、各ジョブのステータス、ジョブの実行時刻など、過去のジョブに関する情報が表示されます。

  4. ジョブの詳細情報を表示するには、[ジョブ ID] 列でジョブをクリックします。

gcloud

gcloud dataplex datascans jobs list \
  --location=LOCATION \
  --datascan=DATASCAN

次のように置き換えます。

  • LOCATION: 検出スキャンが作成された Google Cloud リージョン。
  • DATASCAN: ジョブが属する検出スキャンの名前。

REST

検出スキャンのすべてのジョブを表示するには、Dataplex API の dataScans.jobs.list メソッドを使用します。

検出スキャンを更新する

検出スキャンのスケジュールを変更するには(スケジュールをオンデマンドから繰り返しに変更する場合など)、検出スキャンを更新します。

コンソール

  1. Google Cloud コンソールで、[Cloud Storage 検出] ページに移動します。

    Cloud Storage の検出に移動

  2. 更新する検出スキャンの [アクション>編集] をクリックします。

  3. 値を編集します。

  4. [保存] をクリックします。

gcloud

検出スキャンを更新するには、gcloud dataplex datascans update data-discovery コマンドを使用します。

gcloud dataplex datascans update data-discovery SCAN_ID --location=LOCATION --description=DESCRIPTION

次のように置き換えます。

  • SCAN_ID: 更新する検出スキャンの ID
  • LOCATION: 検出スキャンが作成された Google Cloud リージョン
  • DESCRIPTION: 検出スキャンの新しい説明

REST

検出スキャンを更新するには、Dataplex API の dataScans.patch メソッドを使用します。

検出スキャンを削除する

検出スキャンを削除するには、次のいずれかのオプションを選択します。

コンソール

  1. Google Cloud コンソールで、[Cloud Storage 検出] ページに移動します。

    Cloud Storage の検出に移動

  2. 削除する検出スキャンの [アクション>削除] をクリックします。

  3. [削除] をクリックします。

gcloud

gcloud dataplex datascans delete SCAN_ID --location=LOCATION --async

次のように置き換えます。

  • SCAN_ID: 削除する検出スキャンの ID
  • LOCATION: 検出スキャンが作成された Google Cloud リージョン。

REST

検出スキャンを削除するには、Dataplex API の dataScans.delete メソッドを使用します。

次のステップ