メニュー

GDPR テストデータ: 開発環境で個人情報を扱う

GDPR テストデータの考え方として、氏名や証明書番号や生年月日が個人データに当たることを前提に、開発環境とテスト環境で実データを持たない理由、仮名化と匿名化の違いを整理します。

公開日

  • テストデータ
  • プライバシー

GDPR テストデータとは、欧州の個人データ保護の枠組みを意識して、開発や検証の場面で扱うデータをどう選ぶかというテーマです。氏名、証明書番号、生年月日、住所、電話番号、メールアドレスは、いずれも個人データに当たり得ます。この記事では、テスト環境で実データを持たない理由と、似て見える三つの手法の違いを確認します。

開発環境に実データを置くと何が問題なのか

個人データの保護では、集める目的を決めること、必要な分だけ集めること、正しく保つこと、必要がなくなったら消すこと、誰が何をしたかを説明できることが求められます。テスト環境に本番のデータを持ち込むと、このうち複数の原則が同時に崩れます。

  • 目的。テストは元の収集目的とは別の使い方になります。
  • 最小化。テストに必要のない項目まで複製されます。
  • 保存期間。テスト環境のデータは消されにくく、長く残ります。
  • 説明責任。どこに何が複製されたかを把握しきれません。

さらに、テスト環境は本番ほど厳しく守られていないことが多く、参照できる人の範囲も広くなりがちです。開発端末に写された時点で、管理の外に出たと同じ状態になります。

仮名化と匿名化は何が違うのか?

似た言葉ですが、指す状態が異なります。

手法 内容 元の個人に戻せるか
削除 項目そのものを取り除く できない
仮名化 識別子を別の値に置き換える 対応表があれば戻せる
匿名化 個人を特定できない状態にする 原則として戻せない
マスキング 一部の文字を伏せ字にする 元の値が推測できることがある

仮名化は、対応表が別に保管されている限り個人データのままです。マスキングは見た目を変えるだけで、元の値が残っている箇所もあれば、桁数の情報から推測できる場合もあります。「名前を消したから匿名になった」とは言えません。

名前を消せば匿名になるのか?

なりません。残った項目の組み合わせが、特定の一人を指してしまうことがあるためです。生年月日と郵便番号と性別の三つがそろうと、対象の範囲がかなり狭まることが知られています。まれな職種や珍しい姓が加われば、さらに絞られます。

匿名かどうかは、どの項目を消したかではなく、残った情報から誰かを言い当てられないかで判断します。判断のためには、手元のデータだけでなく、公開されている情報と突き合わせる視点も必要です。この違いは合成データと匿名化の違いで詳しく扱っています。

テストデータはどこから用意すればよいのか

現実的な選択肢は三つです。本番のデータを複製して加工する方法、合成したデータを生成する方法、そして最小限の値だけを手で用意する方法です。

複製して加工する方法は、元のデータが実在するため分布が自然ですが、加工の漏れが残ります。合成する方法は、元の一件が存在しないため漏えいの対象になりませんが、分布が実際とずれることがあります。手で用意する方法は、件数が少ない確認には十分ですが、大量の確認には向きません。

テストの目的が「形式の確認」であれば、合成した値で足ります。実データの分布そのものを確かめたい場合だけ、加工したデータを検討します。その場合も、作業の記録を残し、加工の規則を再現できるようにしておく必要があります。

ツールで合成の身元情報を用意する

当サイトの身元生成ツールは、実在の記録を使わずに身元情報を生成します。ブラウザ内で組み立てるため、外部への送信を伴いません。テストの入力値として、実データを持ち込まずに済ませたい場面で使えます。

生成される身元情報はテスト専用の合成データであり、実在の人物になりすます目的には使えません。

開発者向け: 環境を分けるときに見る点

第一に、本番のデータをそのまま複製する経路を作らないことです。経路があれば、遅かれ早かれ誰かが使います。テスト用のデータを別に用意する仕組みを先に整えます。

第二に、仮名化したデータを扱う場合の対応表の置き場所を決めます。テスト環境の中に置けば、その環境が漏れた時点で仮名化の意味がなくなります。

第三に、ログと画面の記録に目を向けます。入力値がそのままログに出ていたり、確認のための画像に個人データが写っていたりすると、データベースをきれいにしても同じ情報が残ります。保存期間を決め、自動で消える仕組みを入れておくのが現実的です。

最後に、匿名化を名乗るための根拠を用意します。どの項目をどう扱い、何を根拠に特定できないと言えるのかを書き残しておきます。この記録がないまま「匿名化済み」と表示する運用は、後から説明できなくなります。扱う項目の洗い出しは身元データの整合性の考え方と重なります。

次のステップ

まず、手元のテスト環境に本番由来のデータが残っていないかを確認してください。見つかった場合は、用途ごとに置き換えの優先度を決めます。次に、ログと資料に残った個人データを洗い出します。どちらも一度で終わる作業ではありませんが、最初の一回で見通しが立ちます。身元生成ツールを使えば、置き換え用の値を実データに触れずに用意できます。

続けて読む

オンライン身元・テストデータ生成ツールの関連記事