差分プライバシー
ノイズで個人を統計に埋もれさせる。
これは何?
統計や集計の結果に数学的に制御されたノイズを加え、特定の個人がデータに含まれていたかどうかを結果から見分けられなくする枠組みです。プライバシーの損失量を「予算」として定量的に扱えるのが特徴です。
仕組み
各集計に対し、結果への一人分の影響(感度)に見合ったランダムノイズを加えます。ノイズの大きさは ε(イプシロン)というパラメータで調整し、小さいほど強い保護、大きいほど高い精度になります。
たとえば
大手のOS・キーボードやセンサス(国勢調査)が、利用傾向の集計や統計公表に差分プライバシーを採用し、全体の傾向を得ながら個々のユーザーを守っています。
トレードオフ
プライバシーと精度は本質的にトレードオフで、強く守るほど結果が粗くなります。プライバシー予算は使うほど減り、少人数のグループや外れ値の分析には特に不利です。