跟踪 BigQuery 表的数据沿袭
本文档介绍了如何跟踪 BigQuery 表中的数据沿袭。 数据沿袭是指跟踪数据来源、转换方式以及随时间推移的移动路径的过程。了解数据沿袭对于确保合规性、排查数据问题和执行根本原因分析至关重要。
本快速入门将向您展示如何开始使用 BigQuery 表的数据沿袭:
从公开提供
new_york_taxi_trips数据集中复制两个表。将这两个表中的出租车总乘车次数合并到一个新表中。
查看所有三项操作的沿袭可视化图表。
准备工作
设置项目:
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
If you're using an existing project for this guide, verify that you have the permissions required to complete this guide. If you created a new project, then you already have the required permissions.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Dataplex, BigQuery, and Data Lineage APIs.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.
所需的角色
如需获得查看沿袭可视化图表所需的权限,请让您的管理员为您授予以下 IAM 角色:
- 针对 Knowledge Catalog(原 Dataplex Universal Catalog)资源项目的 Dataplex Catalog Viewer (
roles/dataplex.catalogViewer) - 针对您在其中使用 BigQuery 的项目的 Data Lineage Viewer (
roles/datalineage.viewer) - 针对您在其中使用 BigQuery 的项目的 BigQuery Data Viewer (
roles/bigquery.dataViewer)
如需详细了解如何授予角色,请参阅管理对项目、文件夹和组织的访问权限。
向项目添加公共数据集
在 Google Cloud 控制台中,前往 BigQuery 页面。
在左侧窗格中,点击 探索器:

如果您没有看到左侧窗格,请点击 展开左侧窗格以打开该窗格。
在探索器窗格中,点击添加数据。
在添加数据窗格中,选择公共数据集。
在 Marketplace 窗格中,搜索
NYC TLC Trips,然后点击 NYC TLC Trips 结果。点击查看数据集。
这样一来,系统会将公共数据集的项目添加为参考,您可以在探索器窗格中查看该参考。详细信息窗格会显示数据集信息,包括数据集 ID、数据位置和上次修改日期等信息。
在项目中创建数据集
在左侧窗格中,点击 探索器:

在探索器窗格中,选择您要在其中创建数据集的项目。
点击 操作,然后点击创建数据集。
在创建数据集页面上的数据集 ID 字段中,输入
data_lineage_demo。其他字段保留默认值。点击创建数据集。
在探索器窗格中,点击数据集,然后点击新添加的
data_lineage_demo。
详细信息窗格会显示其数据集信息。
将两个可公开访问的表复制到数据集
打开查询编辑器:在“详细信息”窗格中,点击标签页
data_lineage_demo旁边的 SQL 查询。此步骤会创建一个名为Untitled的标签页。在查询编辑器中,输入以下查询以复制第一个表。将
PROJECT_ID替换为项目的标识符。CREATE TABLE `PROJECT_ID.data_lineage_demo.nyc_green_trips_2021` COPY `bigquery-public-data.new_york_taxi_trips.tlc_green_trips_2021`点击 运行。 此步骤会创建第一个表,名为
nyc_green_trips_2021。在查询结果窗格中,点击前往表。此步骤会显示第一个表的内容。
在查询编辑器中,,将上述查询替换为以下查询以复制第二个表。将
PROJECT_ID替换为项目的标识符。CREATE TABLE `PROJECT_ID.data_lineage_demo.nyc_green_trips_2022` COPY `bigquery-public-data.new_york_taxi_trips.tlc_green_trips_2022`点击 运行。 此步骤会创建第二个表,名为
nyc_green_trips_2022。在查询结果窗格中,点击前往表。此步骤会显示第二个表的内容。
将数据汇总到新表中
在查询编辑器中,输入以下查询。将
PROJECT_ID替换为项目的标识符。CREATE TABLE `PROJECT_ID.data_lineage_demo.total_green_trips_22_21` AS SELECT vendor_id, COUNT(*) AS number_of_trips FROM ( SELECT vendor_id FROM `PROJECT_ID.data_lineage_demo.nyc_green_trips_2022` UNION ALL SELECT vendor_id FROM `PROJECT_ID.data_lineage_demo.nyc_green_trips_2021` ) GROUP BY vendor_id点击 运行。 此步骤会创建一个名为
total_green_trips_22_21的合并表。在查询结果窗格中,点击前往表。此步骤会显示该组合表。
在 Knowledge Catalog 中查看沿袭图
在 Google Cloud 控制台中,前往 Knowledge Catalog 搜索页面。
如果您的搜索平台设置为 Data Catalog,请在选择搜索平台菜单中选择 Knowledge Catalog。
在搜索框中,输入
total_green_trips_22_21,然后点击搜索。在结果列表中,点击
total_green_trips_22_21。此步骤会显示 BigQuery 表的详细信息标签页。点击沿袭标签页。
在沿袭图中,每个矩形节点都代表一个表,无论是原始表、已复制表还是组合表。您可以执行以下操作:
如需显示或隐藏表的来源,请点击 +(展开)或 -(收起)。
如需显示表信息,请点击节点。此步骤会显示节点详细信息窗格。
如需显示进程信息,请点击
。
此步骤会显示一个进程详细信息窗格,其中显示了将来源表转换为目标表的作业。
清理
为避免因本页中使用的资源导致您的 Google Cloud 账号产生费用,请按照以下步骤操作。
删除项目
- 在 Google Cloud 控制台中,前往管理资源页面。
- 在项目列表中,选择要删除的项目,然后点击删除。
- 在对话框中输入项目 ID,然后点击关闭以删除项目。
删除数据集
在 Google Cloud 控制台中,前往 BigQuery 页面。
在左侧窗格中,点击 探索器:

在探索器面板中,搜索您创建的
data_lineage_demo数据集。点击相应数据集,然后点击删除。
确认删除操作。
后续步骤
- 详细了解数据沿袭。
- 了解如何运行 BigQuery 查询。
- 了解如何使用数据沿袭。
- 了解如何使用 Knowledge Catalog 和 Data Lineage 客户端库。
- 了解 Knowledge Catalog 价格。
- 尝试 Knowledge Catalog 应用场景。