对敏感 Cloud Storage 数据进行去标识化处理

本页介绍了 Sensitive Data Protection 如何为存储在 Cloud Storage 中的数据创建去标识化副本。此外,本页面还列出了此操作的限制以及您在开始之前应考虑的事项。

如需了解如何使用 Sensitive Data Protection 创建 Cloud Storage 数据的去标识化副本,请参阅以下内容:

关于去标识化

去标识化是从数据中移除身份信息的过程。其目标是在满足隐私权要求的同时,实现个人信息(例如健康、财务或人口统计信息)的使用和共享。如需详细了解去标识化,请参阅对敏感数据进行去标识化

如需详细了解 Sensitive Data Protection 中的去标识化转换,请参阅转换参考文档。如需详细了解 Sensitive Data Protection 如何隐去图片中的敏感数据,请参阅图片检查和遮盖

何时使用存储去标识化

以下是一些常见使用场景:

  • 为非生产环境生成匿名化数据集:在将数据暂存到开发、测试或训练环境之前,先创建存储在 Cloud Storage 中的生产文件的去标识化副本。
  • 与第三方共享经过清理的文件库:对批量文档和非结构化文件中的敏感字段进行模糊处理,同时保留原始文件夹层次结构,以便与外部业务合作伙伴或审核人员共享。
  • 自动运行隐私保护流水线,处理已提取的文档:将新上传文件中的敏感数据转换到指定的输出存储桶,而不会更改源文件或中断上游流水线。
  • 强制执行数据留存和隔离:将敏感资产的去标识化镜像副本存储在具有不同 Identity and Access Management 访问权限控制的单独 Cloud Storage 存储桶中。

去标识化流程

本部分介绍 Sensitive Data Protection 如何对 Cloud Storage 中的内容进行去标识化处理。

如需使用此功能,您需要创建检查作业 (DlpJob),该作业配置为创建 Cloud Storage 文件的去标识化副本。Sensitive Data Protection 会扫描指定位置中的文件,并根据您的配置检查这些文件。在检查每个文件时,Sensitive Data Protection 会对符合敏感数据条件的任何数据进行去标识化处理,然后将内容写入新文件。新文件的文件名始终与原始文件相同。它会将此新文件存储在您指定的输出目录中。如果某个文件包含在扫描中,但没有数据符合去标识化条件,并且在处理过程中没有出现任何错误,则该文件会原封不动地复制到输出目录。

您设置的输出目录必须位于与包含输入文件的存储桶不同的 Cloud Storage 存储桶中。在输出目录中,Sensitive Data Protection 会创建一个与输入目录的文件结构相对应的文件结构。

例如,假设您设置了以下输入和输出目录:

  • 输入目录:gs://input-bucket/folder1/folder1a
  • 输出目录:gs://output-bucket/output-directory

在去标识化期间,Sensitive Data Protection 会将去标识化的文件存储在 gs://output-bucket/output-directory/folder1/folder1a 中。

如果输出目录中存在与去标识化文件同名的文件,则该文件会被覆盖。如果您不希望现有文件被覆盖,请在运行此操作之前更改输出目录。或者,考虑在输出存储桶上启用对象版本控制

原始文件的文件级访问权限控制列表 (ACL) 会复制到新文件中,无论是否发现并去标识化了敏感数据。不过,如果输出存储桶仅配置了统一的存储桶级权限,而未配置精细的(对象级)权限,则 ACL 不会复制到去标识化的文件中。

下图展示了存储在 Cloud Storage 存储桶中的四个文件的去标识化流程。无论 Sensitive Data Protection 是否检测到任何敏感数据,系统都会复制每个文件。每个复制的文件都与原始文件同名。

对存储在 Cloud Storage 中的文件进行去标识化处理。
对存储在 Cloud Storage 中的文件进行去标识化(点击可放大)。

价格

如需了解价格信息,请参阅检查和转换存储空间中的数据

支持的文件类型

Sensitive Data Protection 可以对以下文件类型组进行去标识化处理:

  • CSV
  • 映像
  • 文本
  • TSV

默认去标识化行为

如果您想定义 Sensitive Data Protection 如何转换发现的结果,可以为以下类型的文件提供去标识化模板

  • 非结构化文件,例如包含自由格式文本的文本文件
  • 结构化文件,例如 CSV 文件
  • 图片

如果您未提供任何去标识化模板,Sensitive Data Protection 会按如下方式转换检测结果:

  • 在非结构化文件和结构化文件中,Sensitive Data Protection 会将所有发现结果替换为对应的 infoType,如 infoType 替换中所述。
  • 在图片中,Sensitive Data Protection 会用黑色方框遮盖所有发现结果。

限制和注意事项

在创建 Cloud Storage 数据的去标识化副本之前,请考虑以下几点。

磁盘空间

此操作仅支持存储在 Cloud Storage 中的内容。

此操作会在 Sensitive Data Protection 检查每个文件时复制相应文件。它不会修改或移除原始内容。复制的数据将占用与原始数据大致相同的额外磁盘空间。

对存储空间的写入权限

由于 Sensitive Data Protection 会创建原始文件的副本,因此项目的服务代理必须具有对 Cloud Storage 输出存储桶的写入权限。

抽样和设置发现限制

此操作不支持抽样。具体来说,您无法限制 Sensitive Data Protection 扫描和去标识化每个文件的程度。也就是说,如果您使用的是 Cloud Data Loss Prevention API,则无法在 DlpJobCloudStorageOptions 对象中使用 bytesLimitPerFilebytesLimitPerFilePercent

此外,您也无法控制要返回的发现数量上限。 如果您使用的是 DLP API,则无法在 DlpJob 中设置 FindingLimits 对象。

检查数据的要求

在运行检查作业时,Sensitive Data Protection 会先根据您的检查配置检查数据,然后再执行去标识化。无法跳过检查流程。

使用文件扩展名的要求

Sensitive Data Protection 依靠文件扩展名来识别输入目录中文件的文件类型。即使文件属于受支持的类型,但如果文件没有扩展名,系统也可能不会对这些文件进行去标识化处理。

跳过的文件

对存储空间中的文件进行去标识化处理时,Sensitive Data Protection 会跳过以下文件:

  • 超过 60,000 KB 的文件。如果您有超出此限制的大文件,请考虑将其拆分为较小的块。
  • 此页面上的支持的文件类型中未列出的文件类型。
  • 您有意从去标识化配置中排除的文件类型。如果您使用的是 DLP API,系统会跳过您在 DlpJobDeidentify 操作的 file_types_to_transform 字段中排除的文件类型。
  • 遇到转换错误的文件。

去标识化表格中输出行的顺序

无法保证去标识化表中的行顺序与原始表中的行顺序一致。如果您想将原始表与去标识化表进行比较,则无法依靠行号来识别对应的行。如果您打算比较表的行,则必须使用唯一标识符来标识每条记录。

临时密钥

如果您选择加密方法作为转换方法,则必须先使用 Cloud Key Management Service 创建封装密钥。然后,在去标识化模板中提供该密钥。不支持临时(原始)密钥。

后续步骤