Übereinstimmungswahrscheinlichkeit

Die Scanergebnisse werden nach der Wahrscheinlichkeit kategorisiert, dass sie eine Übereinstimmung darstellen. Sensitive Data Protection verwendet eine Bucket-basierte Darstellung der Wahrscheinlichkeit, die angeben soll, wie wahrscheinlich es ist, dass ein Datenelement mit einem bestimmten infoTypeübereinstimmt.

Funktionsweise der Wahrscheinlichkeit

Wenn Sie einen Sensitive Data Protection-Scan konfigurieren, legen Sie die infoTypes fest, nach denen Sensitive Data Protection suchen soll. Um die Scan ergebnisse einzugrenzen, können Sie eine Mindestwahrscheinlichkeit in Ihrer Anfrage festlegen.

Für jede potenzielle Übereinstimmung (Ergebnis), die während des Scans erkannt wird, weist der Schutz sensibler Daten eine Wahrscheinlichkeitsstufe zu. Die Wahrscheinlichkeitsstufe eines Ergebnisses beschreibt, wie wahrscheinlich es ist, dass das Ergebnis mit einem infoType übereinstimmt, nach dem Sie suchen. Sensitive Data Protection kann beispielsweise einem Ergebnis, das wie eine E-Mail-Adresse aussieht, die Wahrscheinlichkeit LIKELY zuweisen.

Wenn der Schutz sensibler Daten die Ergebnisse zurückgibt, werden alle Ergebnisse herausgefiltert, deren Wahrscheinlichkeit niedriger ist als die in Ihrer Anfrage festgelegte Mindestwahrscheinlichkeit. Wenn Sie die Mindestwahrscheinlichkeit beispielsweise auf POSSIBLE festlegen, erhalten Sie nur die Ergebnisse, die als POSSIBLE, LIKELY und VERY_LIKELY bewertet wurden. Wenn Sie die Mindestwahrscheinlichkeit auf VERY_LIKELY festlegen, erhalten Sie die wenigsten Ergebnisse.

Wahrscheinlichkeitsstufen

In der folgenden Tabelle sind die möglichen Wahrscheinlichkeitswerte aufgeführt, die Sensitive Data Protection einem Ergebnis zuweisen kann.

ENUM Beschreibung
VERY_UNLIKELY Gekennzeichnet durch:
  • Ein schwaches Signal.
  • Fehlende kontextbezogene Hinweise.
  • Negative Signale für einen bestimmten infoType.
UNLIKELY Gekennzeichnet durch:
  • Ein oder mehrere schwache Signale.
  • Ein stärkeres Signal für einen anderen infoType.
POSSIBLE Gekennzeichnet durch:
  • Ein oder mehrere Signale für einen bestimmten infoType. Signale können bestandene Prüfsummen enthalten.
  • Fehlen eines starken kontextbezogenen Hinweises und einer eindeutigen, spezifischen Formatierung.
LIKELY Gekennzeichnet durch ein oder mehrere starke Signale für einen bestimmten infoType. Signale können bestandene Prüfsummen, starke kontextbezogene Hinweise und eine eindeutige, spezifische Formatierung enthalten.
VERY_LIKELY Gekennzeichnet durch viele starke Signale für einen bestimmten infoType. Signale können bestandene Prüfsummen, starke kontextbezogene Hinweise und eine eindeutige, spezifische Formatierung enthalten.

Mindestwahrscheinlichkeit für die Scanergebnisse auswählen

Wenn Sie in Ihrer Anfrage an den Schutz sensibler Daten eine höhere Mindestwahrscheinlichkeit festlegen, enthalten die Ergebnisse im Allgemeinen weniger falsch positive Ergebnisse (manchmal auch als Rauschen bezeichnet). Die Ergebnisse können aber auch mehr echt positive Ergebnisse ausschließen. Bei der Auswahl einer Mindestwahrscheinlichkeit muss das richtige Gleichgewicht zwischen Trefferquote und Genauigkeitgefunden werden.

Angenommen, in einem Dokument sind 10 Straßenadressen enthalten und Sensitive Data Protection hat 5 Straßenadressen identifiziert. Unter den vom Schutz sensibler Daten identifizierten Ergebnissen befinden sich jedoch nur 4 Straßenadressen.

  • Trefferquote ist die Anzahl der echt positiven Instanzen im Verhältnis zur Gesamtzahl der relevanten Instanzen. In diesem Beispiel beträgt die Trefferquote 4/10.
  • Genauigkeit ist die Anzahl der echt positiven Instanzen im Verhältnis zur Gesamtzahl der vom Schutz sensibler Daten identifizierten Instanzen. In diesem Beispiel beträgt die Genauigkeit 4/5.

In diesem Beispiel ist die Genauigkeit hoch, die Trefferquote aber relativ niedrig.

Die von Ihnen festgelegte Mindestwahrscheinlichkeit wirkt sich auf die Trefferquote und die Genauigkeit aus, die Sie in Ihren Scanergebnissen erhalten. In der folgenden Tabelle wird beschrieben, wann die einzelnen Mindestwahrscheinlichkeiten nützlich sind und wie sich Trefferquote und Genauigkeit auf den einzelnen Stufen unterscheiden.

Mindestwahrscheinlichkeit Beschreibung
LIKELIHOOD_UNSPECIFIED Standardwert; entspricht POSSIBLE.
VERY_UNLIKELY Nützlich, wenn Sie die höchste Trefferquote benötigen. Diese Mindestwahrscheinlichkeit erzeugt das meiste Rauschen.
UNLIKELY Nützlich, wenn Sie eine höhere Trefferquote benötigen. Diese Mindestwahrscheinlichkeit erzeugt etwas Rauschen.
POSSIBLE Nützlich, wenn Sie ein Gleichgewicht zwischen Genauigkeit und Trefferquote wünschen.
LIKELY Nützlich, wenn Sie eine höhere Genauigkeit benötigen, auch wenn die Trefferquote dadurch etwas sinkt.
VERY_LIKELY Nützlich, wenn Sie die höchste Genauigkeit wünschen, auch wenn die Trefferquote dadurch sinkt.

Standardmäßige Mindestwahrscheinlichkeit

Wenn Sie in Ihrer Anfrage keine Mindestwahrscheinlichkeit festlegen oder sie auf LIKELIHOOD_UNSPECIFIED setzen, gibt der Schutz sensibler Daten nur die Ergebnisse mit einer Wahrscheinlichkeit von POSSIBLE und höher zurück.