何时使用文本分类和遮盖
以下是一些常见使用场景:
- 在数据库持久化之前清理用户输入:在将记录写入存储空间或应用数据库之前,从自由格式文本中隐去敏感的 PII(例如社会保障号、信用卡号或驾照)。
- 清理客户服务转写内容和日志:在客服人员审核或训练数据注入之前,从聊天记录、支持服务工单和电子邮件对话中移除可识别的个人信息。
- 识别敏感实体以进行下游标记:对文本进行分类以提取 infoType 和可能性评级,并在自定义工作流中使用此信息来路由或标记高风险消息。
- 在生成式 AI 提示中遮盖机密数据:在将内容发送给公开或第三方 LLM 之前,从用户提示中隐去专有信息或受监管的信息。
文本分类
请考虑以下文本输入:
Please update my records with the following information: Email address: foo@example.com National Provider Identifier: 1245319599 Driver's license: AC333991
输出是一个结果列表,分为以下几类:
InfoTypeLikelihoodOffset(在字符串中找到潜在的InfoType的位置)
下表中显示了示例输出。
InfoType |
Likelihood |
Offset |
|---|---|---|
US_HEALTHCARE_NPI |
VERY_LIKELY |
122 |
EMAIL_ADDRESS |
LIKELY |
72 |
US_DRIVERS_LICENSE_NUMBER |
LIKELY |
155 |
CANADA_BC_PHN |
VERY_UNLIKELY |
122 |
UK_TAXPAYER_REFERENCE |
VERY_UNLIKELY |
122 |
CANADA_PASSPORT |
VERY_UNLIKELY |
155 |
自动遮盖文本
自动遮盖会生成一个输出,其中并未提供结果列表,而是移除了敏感数据匹配项。
以下是自动遮盖输入的示例:
Please update my records with the following information: Email address: foo@example.com National Provider Identifier: 1245319599 Driver's license: AC333991
以下是使用占位符“***”输出的示例:
Please update my records with the following information: Email address: *** National Provider Identifier: *** Driver's license: ***
资源
- 如需详细了解如何使用 Sensitive Data Protection 遮盖文本,请参阅遮盖文本内容中的敏感数据。
- 如需详细了解如何使用 Sensitive Data Protection 对文本内容中的敏感数据进行去标识化(包括“遮盖”敏感数据、将敏感数据替换为“令牌”字符串,以及使用随机生成的密钥或预先确定的密钥加密和替换敏感数据),请参阅对文本内容中的敏感数据进行去标识化。