数据沿袭通过跟踪数据资产与转换这些资产的进程之间的关系,帮助您了解数据在系统中的流动方式。您可以在 Google Cloud 控制台中以图表和列表的形式查看此沿袭信息。
本文档介绍了表级和列级数据沿袭粒度,并提供了相关说明,以便您使用图表视图和列表视图在 Google Cloud 控制台中探索数据沿袭。
如需详细了解底层数据模型,请参阅数据沿袭信息模型。
表级沿袭与列级沿袭之间的区别
借助数据沿袭,您可以跟踪数据在表级和列级的来源和转换路径。
何时使用表级沿袭图
表级沿袭通过显示整个表之间的关系,简要概述了数据流水线。使用表级层沿袭可执行以下宏观层面的任务:
数据发现。构建新信息中心的分析师可以使用表级沿袭将汇总表追溯到其来源,并确认数据来自权威数据库。
迁移规划。计划迁移核心数据库的数据库管理员可以使用表级沿袭来确定依赖于该数据库的每个下游报告和信息中心。
审核和治理。数据监管员可以使用表级和列级沿袭来检查包含个人身份信息 (PII) 的表中的数据在流水线中的流向。
何时使用列级沿袭数据
列级沿袭通过跟踪各个列之间的数据流来提供更精细的视图。在此视图中,沿袭事件中的链接表示源列与目标列之间的关系。每个列级链接都有一个描述转换的依赖类型:
Exact copy:在列之间复制值。Other:列之间的其他类型的依赖关系。
列级沿袭可用于执行以下任务:
根本原因分析。 如果数据分析师发现列中的值不正确,可以使用列级沿袭将其追溯到源列,以找出根本原因。
影响分析。数据工程师在弃用列之前,可以使用列级沿袭来查找依赖于该列的每个下游列。
指标的数据源验证。数据分析师可以使用列级沿袭来确定哪些源列用于计算指标,而无需解读复杂的 SQL 查询。
系统会自动为以下类型的 BigQuery 作业收集列级沿袭信息:
对于 Managed Service for Apache Spark 作业,支持情况取决于 Managed Service for Apache Spark 使用的 Open Lineage 依赖项的类型和版本。支持的最低版本为 1.34。 以下是最低支持的 Managed Service for Apache Spark 集群映像版本:
- 3.0.3
- 2.3.22
- 2.2.75
- 2.1.107
以下是支持的最低 Managed Service for Apache Spark 运行时版本:
- 3.0.3
- 2.3.20
Google Cloud 控制台中的沿袭视图
借助 Google Cloud 控制台中的数据沿袭功能,您可以通过两种方式与沿袭信息互动:您可以探索多个可用区域的沿袭图,也可以使用沿袭探索器面板在特定区域内获得更集中的视图。您还可以在图视图和列表视图之间切换,以分析不同详细程度的数据传输。
沿袭视图仅适用于 Knowledge Catalog(以前称为 Dataplex Universal Catalog)条目、BigQuery 资产和 Vertex AI 资源(模型、数据集、特征存储区视图和特征组)。
如需查看本文档中讨论的不同视图,请参阅将数据沿袭与 Google Cloud 系统搭配使用。
沿袭图视图
图表视图可直观呈现系统和区域之间的数据资产流和关系,帮助您了解数据架构、追溯来源和目的地,以及识别模式。这些沿袭图由 Data Lineage API 服务针对特定的 Knowledge Catalog 条目生成,用于显示数据随时间推移的转换方式,并显示所选根条目的上游、下游或双向数据流。
Data Lineage API 会自动从受支持的系统并通过 API 调用接收自定义来源的资产信息。
图表中的关键元素如下:
节点。节点表示数据实体。在表级视图中,节点会显示表名称及其列。在列级视图中,每个节点都代表一个特定的表和列。
边缘。边是连接节点的线条,表示节点之间发生的流程。边的显示方式取决于沿袭视图:
- 在表格级视图中,边缘带有图标,用于指示数据转换。
- 在列级视图中,边带有标签,用于指示数据转换。例如,边缘标签可能会显示
Exact copy,以描述源列如何复制到目标列。
处理图标和标签。流程图标和标签会显示在边缘,以提供有关转换的更多信息。
- 图标。图标表示转换过程。手动探索图表时,边上的图标表示进程的来源系统(例如 BigQuery 或 Vertex AI)。如果涉及多个进程,则会显示“多个进程”图标。如果进程来源系统未知,则使用齿轮图标。应用过滤条件时,所有进程都使用齿轮图标。
- 标签。在列级沿袭视图中,标签用于描述列之间的依赖关系类型:
Exact copy或Other。
探索沿袭图
打开沿袭标签页后,您会看到默认的图表视图。默认视图提供跨系统和区域的概要信息,并支持手动和增量图表展开,每次可加载五个节点。边缘上的流程图标表示源系统或指示多个流程。
过滤和突出显示数据沿袭视图
对于大型复杂的沿袭图,您可以应用过滤条件或突出显示功能来减少视觉干扰,并专注于探索特定区域内的沿袭。使用沿袭资源管理器面板设置条件。应用过滤条件后,图表和列表视图顶部会显示一个过滤栏,其中以功能块的形式显示您已启用的过滤条件。
如需优化沿袭可视化图表,您可以选择以下模式之一:
突出显示:使用颜色和边框在视觉上突出显示匹配的节点,同时保持整个图表的可见性。这有助于在不丢失谱系图整体背景信息的情况下找到特定资源。
过滤:系统会隐藏不匹配的节点,并简化图表以仅显示匹配的节点以及它们之间的路径。匹配节点之间路径中的任何不匹配的资产都会分组到折叠节点中。此模式有助于降低复杂性,并仅关注相关资产及其直接关系。
如需过滤或突出显示沿袭,请使用以下条件:
- 项目:按 Google Cloud 项目 ID 进行过滤。
- 系统:按数据资产所在的系统(例如 BigQuery 或 Cloud Storage)过滤。
- 实体名称:按资产名称进行过滤。您可以使用
*进行通配符搜索(仅限前缀和后缀,例如*table或test*)。 - 子类型:按资产子类型(例如
dashboard或model)过滤。 - 列名称:按列名称过滤沿袭数据,以查看列级详细信息。
- 方向:显示上游沿袭、下游沿袭或两者都显示。
- 时间范围:根据特定开始时间或结束时间过滤谱系。
- 依赖关系类型:根据依赖关系类型过滤列级沿袭。
可用选项的示例包括
All或Exact copy。
如需进一步减少杂乱,您可以选择隐藏临时 BigQuery 表,以隐藏由 BigQuery 创建的临时资产,例如名称以 _script 开头的数据集中的表。
图表视图标签页中的聚焦视图会自动将图表展开到最多三个级别,并加载符合过滤条件的全部沿袭。沿袭浏览器最多可提取 10 级的沿袭图,但默认情况下仅展开前 3 级。您可以点击箭头展开图表,查看剩余的级别。
聚焦视图支持表级沿袭和列级沿袭,包括从任何选定节点到根节点的路径可视化。在此聚焦视图中,所有进程都使用通用齿轮图标。
如需查看列级沿袭,请使用以下方法之一:
在聚焦图表视图中,点击表格中的列图标可切换到列级沿袭。
列图标 在默认图表视图或聚焦图表视图的沿袭资源管理器面板中应用列名称。
如需移除所有过滤条件并返回默认视图,请点击 重置。
如需在突出显示模式和过滤模式之间切换,请参阅优化沿袭可视化图表。
查看沿袭节点详情
如需查看节点的详细信息,请点击相应节点。系统会显示一个侧边栏,其中包含所选数据资产的详细信息。例如,在表级沿袭视图中,点击某个节点会显示相应资产的完全限定名称、类型和其他相关属性等信息。
查看谱系运行历史记录
完整的沿袭图是多次运行不同作业的结果。每个作业都会在图中创建一个特定的链接。多次执行会记录为新的运行,但不会更改图表的静态外观。
如需查看这些单独执行的详细信息,请点击图上带有进程的边。在随即显示的查询面板中,点击运行标签页。
检查数据转换逻辑
如需了解转换的业务逻辑,而无需搜索代码,您可以查看运行的确切 SQL 查询。如需查看 SQL 代码,请点击图上带有进程的边。在随即显示的侧边栏中,点击详细信息标签页。
直观呈现数据沿袭路径
沿袭路径可视化可帮助您追踪从图表中的任何选定节点到根条目的路径。选择某个节点并点击可视化路径后,图表中只会突出显示构成通往根条目的直接沿袭路径的节点和进程。
如需查看沿袭路径可视化图表,请在沿袭探索器面板中应用过滤条件,以创建重点突出的图表视图。然后,在聚焦的图表视图中,选择一个节点。在所选节点的详细信息面板中,点击可视化路径。
沿袭路径可视化图表适用于表级和列级沿袭。您还可以在列表视图中使用沿袭路径可视化图表。
沿袭列表视图
列表视图以表格形式显示沿袭的结构化表示,并与图表视图同步。它可帮助您对数据资源进行排序、过滤和下载。此视图非常适合分析源与目标之间的关系、详细了解相关资产以及导出沿袭数据。
列表视图适用于表级沿袭数据和列级沿袭数据。您可以在以下详细列表视图和简化列表视图之间切换:
简化的列表视图:此视图有助于获取沿袭中涉及的所有资产的简化唯一列表。系统、项目、实体、FQN(完全限定名称)、方向和深度等列可帮助您查看沿袭中的所有数据资产、它们所在的位置、原始来源以及与正在分析的中心资产的距离。非常适合大致了解参与数据传输的所有实体。这是默认视图。
详细列表视图:此视图旨在分析各个来源-目标关系。通过为来源和目标提供单独的列,您可以查看每个具体的数据转换链接。此视图非常适合需要深入了解特定资产对之间的数据流动情况的任务,例如审核单个数据流、了解表之间的依赖关系,或导出每个连接的详细沿袭记录。
表级沿袭列表视图
此视图显示了表之间的整体关系。 使用提供的过滤条件选择所需的列。
展开以下部分,查看表级列表视图中可用的列。
简化的表级列表视图中可用的列
- 系统:数据资产所在的系统。例如 [BigQuery](/bigquery/docs)。
- 项目:包含数据资产的 Google Cloud 项目 ID。
- 实体:数据资源的名称。例如,表名称。
- FQN:原始来源实体或列的完全限定名称 (FQN)。
- 方向:表示所列出的资产在沿袭流中是上游(来源)还是下游(目标)。
- 深度:从正在分析的中心资产开始的沿袭步数。
详细表级列表视图中可用的列
- 源系统:源数据资产所在的系统。 例如 BigQuery。
- 源项目:包含源数据资产的 Google Cloud 项目 ID。
- 来源:源数据资产的名称。示例包括表名称。
- 来源 FQN:来源实体的 FQN。
- 目标系统:目标数据资产所在的系统。 例如 BigQuery。
- 目标项目:包含目标数据资产的 Google Cloud 项目 ID。
- 目标:目标数据资产的名称。示例包括表名称。
- 目标 FQN:目标实体的 FQN。
- 方向:表示所列出的资产在沿袭流中是上游(来源)还是下游(目标)。
- 深度:从正在分析的中心资产开始的沿袭步数。
列级沿袭列表视图
此视图显示了源表和目标表中各个列之间的关系。使用提供的过滤条件选择所需的列。
展开以下部分,查看列级列表视图中可用的列。
简化的列级列表视图中可用的列
- 系统:数据资产所在的系统。例如 BigQuery。
- 项目:包含数据资产的 Google Cloud 项目 ID。
- 实体:数据资源的名称。例如,表名称。
- 列:实体中在沿袭探索器面板内选择的特定列。
- FQN:原始来源实体或列的完全限定名称 (FQN)。
- 方向:表示所列出的资产在沿袭流中是上游(来源)还是下游(目标)。
- 深度:从正在分析的中心资产开始的沿袭步数。
详细的列级列表视图中可用的列
- 源系统:源数据资产所在的系统。
- 源项目:包含源数据资产的 Google Cloud 项目 ID。
- 来源 FQN:来源列的 FQN。
- 目标系统:目标数据资产所在的系统。
- 目标项目:包含目标数据资产的 Google Cloud 项目 ID。
- 目标 FQN:目标列的 FQN。
- 方向:指明数据传输是上行还是下行。
- 依赖关系类型:描述列之间的关系性质。
- 深度:从正在分析的中心资产开始的沿袭步数。
后续步骤
了解沿袭来源。