Mengukur risiko identifikasi ulang dan pengungkapan

Analisis risiko identifikasi ulang, atau hanya analisis risiko, adalah proses analisis data sensitif untuk menemukan properti yang mungkin meningkatkan risiko teridentifikasinya subjek. Anda dapat menggunakan metode analisis risiko sebelum de-identifikasi untuk membantu menentukan strategi de-identifikasi yang efektif atau setelah de-identifikasi untuk memantau perubahan atau nilai ekstrem.

Sensitive Data Protection dapat menghitung empat metrik risiko identifikasi ulang: k-anonymity, l-diversity, k-map, dan δ-presence. Jika Anda belum memahami analisis risiko atau metrik ini, lihat topik konsep analisis analisis risiko sebelum melanjutkan.

Bagian ini memberikan ringkasan tentang cara menggunakan Sensitive Data Protection untuk analisis risiko data terstruktur menggunakan salah satu metrik ini, serta topik terkait lainnya.

Menghitung risiko identifikasi ulang

Sensitive Data Protection dapat menganalisis data terstruktur yang disimpan dalam tabel BigQuery dan menghitung metrik risiko identifikasi ulang berikut. Klik link untuk metrik yang ingin Anda hitung untuk mempelajari lebih lanjut.

Metrik Deskripsi
k-anonymity Properti set data yang menunjukkan kemampuan identifikasi ulang kumpulan datanya. Set data bersifat k-anonim jika pengidentifikasi semu untuk setiap orang dalam set data identik dengan setidaknya k – 1 orang lain dalam set data itu.
l-diversity Perpanjangan dari k-anonymity yang mengukur keragaman nilai sensitif untuk setiap kolom tempat nilai tersebut muncul. Set data memiliki l-diversity jika, untuk setiap set baris dengan quasi-ID yang identik, setidaknya ada nilai l yang berbeda untuk setiap atribut sensitif.
k-map Menghitung risiko identifikasi ulang dengan membandingkan set data subjek yang telah di-de-identifikasi dengan set data identifikasi ulang—atau "serangan"—yang lebih besar.
δ-presence Memperkirakan probabilitas bahwa pengguna tertentu dalam populasi yang lebih besar ada dalam set data. Hal ini digunakan saat keanggotaan dalam set data itu sendiri merupakan informasi sensitif.

Menghitung statistik lainnya

Sensitive Data Protection juga dapat menghitung statistik numerik dan kategoris untuk data yang disimpan dalam tabel BigQuery menggunakan resource DlpJob yang sama dengan API analisis risiko.

Metrik Deskripsi
Statistik numerik Menentukan nilai minimum, maksimum, dan kuantil untuk kolom BigQuery individual.
Statistik numerik kategoris Menghitung statistik numerik kategoris untuk bucket histogram individual dalam kolom BigQuery.

Untuk mengetahui informasi selengkapnya, lihat Menghitung statistik numerik dan kategoris.

Memvisualisasikan risiko identifikasi ulang

Anda dapat memvisualisasikan metrik risiko yang dihitung Sensitive Data Protection langsung di Google Cloud konsol menggunakan Sensitive Data Protection (k-anonymity atau l-diversity), atau menggunakan Google Cloud produk lain.

Produk Deskripsi
Data Studio Setelah menghitung nilai k-anonymity untuk set data menggunakan Sensitive Data Protection, Anda dapat memvisualisasikan hasilnya di Data Studio. Dengan melakukannya, Anda juga akan dapat lebih memahami risiko identifikasi ulang dan membantu mengevaluasi pertukaran dalam utilitas yang mungkin Anda lakukan jika Anda menyamarkan atau melakukan de-identifikasi data.