文本分类和遮盖

何时使用文本分类和遮盖

以下是一些常见使用场景:

  • 在数据库持久化之前清理用户输入:在将记录写入存储空间或应用数据库之前,从自由格式文本中隐去敏感的 PII(例如社会保障号、信用卡号或驾照)。
  • 清理客户服务转写内容和日志:在客服人员审核或训练数据注入之前,从聊天记录、支持服务工单和电子邮件对话中移除可识别的个人信息。
  • 识别敏感实体以进行下游标记:对文本进行分类以提取 infoType 和可能性评级,并在自定义工作流中使用此信息来路由或标记高风险消息。
  • 在生成式 AI 提示中遮盖机密数据:在将内容发送给公开或第三方 LLM 之前,从用户提示中隐去专有信息或受监管的信息。

文本分类

请考虑以下文本输入:

Please update my records with the following information:
Email address: foo@example.com

National Provider Identifier: 1245319599

Driver's license: AC333991

输出是一个结果列表,分为以下几类:

下表中显示了示例输出。

InfoType Likelihood Offset
US_HEALTHCARE_NPI VERY_LIKELY 122
EMAIL_ADDRESS LIKELY 72
US_DRIVERS_LICENSE_NUMBER LIKELY 155
CANADA_BC_PHN VERY_UNLIKELY 122
UK_TAXPAYER_REFERENCE VERY_UNLIKELY 122
CANADA_PASSPORT VERY_UNLIKELY 155

自动遮盖文本

自动遮盖会生成一个输出,其中并未提供结果列表,而是移除了敏感数据匹配项。

以下是自动遮盖输入的示例:

Please update my records with the following information:
Email address: foo@example.com

National Provider Identifier: 1245319599

Driver's license: AC333991

以下是使用占位符“***”输出的示例:

Please update my records with the following information:
Email address: ***

National Provider Identifier: ***

Driver's license: ***

资源

  • 如需详细了解如何使用 Sensitive Data Protection 遮盖文本,请参阅遮盖文本内容中的敏感数据
  • 如需详细了解如何使用 Sensitive Data Protection 对文本内容中的敏感数据进行去标识化(包括“遮盖”敏感数据、将敏感数据替换为“令牌”字符串,以及使用随机生成的密钥或预先确定的密钥加密和替换敏感数据),请参阅对文本内容中的敏感数据进行去标识化