תפריט

בדיוני מול אנונימי: הבחנה שקובעת מה מותר לעשות עם הנתונים

בדיוני מול אנונימי אינו הבדל של ניסוח: האחד מומצא, האחר היה נתונים אמיתיים שעברו עיבוד. ההבחנה הזאת קובעת מה מותר לעשות בהם.

פורסם

  • נתוני בדיקה
  • זהות
  • פרטיות

בדיוני מול אנונימי נשמע כמו בחירה בין שני טעמים של אותו דבר, והתייחסות כזאת לשניהם מייצרת צרות אמיתיות. אחד מהשניים מעולם לא היה של איש; האחר היה של מישהו ועבר עיבוד כדי להסיר אותו. ההבחנה קובעת מי רשאי לראות את הנתונים, כמה זמן מותר לשמור אותם, והאם אפשר לשתף אותם מחוץ לארגון בכלל.

המאמר הזה מציג את ארבע הגישות שמשתמשים בהן בפועל לנתוני בדיקה, מה כל אחת מבטיחה ומה אינה מבטיחה, ומדוע שילוב של שדות הוא הפרט שמפיל בשקט את רוב הניסיונות להסיר זהות.

ארבע הגישות זו לצד זו

רוב מערכי נתוני הבדיקה נוצרים באחת מארבע דרכים, ולעיתים קרובות מתארים את כולן באותה מילה.

גישה כיצד היא נוצרת מה היא מבטיחה
בדיוני ערכים מופקים מכללים ומאקראיות דבר במערך מעולם לא תיאר אדם אמיתי
אנונימי רשומות אמיתיות עוברות עיבוד כך שאי אפשר לזהות יחידים הנתונים המקוריים היו קיימים, ואת התהליך יש להוכיח
פסידונימי מזהים ישירים מוחלפים בקודים, ונשמר מיפוי הנתונים עוד ניתנים לקישור לאנשים דרך המיפוי
מוסווה תווים רגישים מוחלפים לצורך תצוגה הערך שמתחת בדרך כלל עוד קיים

רק הראשונה מתחילה מכלום. שלוש האחרות מתחילות כולן ברשומות אמיתיות, ולכן כל אחת מהן יורשת חובה שלעולם לא היתה לראשונה.

מדוע הסרת שמות אינה הופכת מערך נתונים לאנונימי?

מפני ששם הוא רק אחת מדרכים רבות לייחד אדם, ובדרך כלל לא האמינה שבהן. טבלה שהוסרה ממנה עמודת השם עדיין מספרת שאישה בשנות השלושים לחייה עובדת אצל מעסיק קטן מסוים בעיירה קטנה מסוימת, ובאוכלוסייה הזאת אולי יש בדיוק אדם אחד כזה. שום דבר לא הפך לאנונימי; המזהה פשוט הוחלף בקבוצת מזהים שדורשת מעט יותר מאמץ.

הגרסה הסטטיסטית של אותה בעיה היא שכל מערך נתונים נושא מזהים עקיפים, כלומר ערכים שאינם ייחודיים בעצמם אך נעשים ייחודיים בשילוב. תאריך לידה, מיקוד, מין ומשלח יד הם הקבוצה הקלאסית, והחשבון אינו סלחני: שילוב שנראה רחב על פני מדינה שלמה עשוי להיות ייחודי בתוך עיר, ומסד נתוני בדיקה הוא בדרך כלל פרוסה של שוק אחד ולא דגימה של כל העולם.

זיהוי מחדש אינו אפוא עיסוק אקזוטי. הוא התוצאה הרגילה של שילוב כמה עמודות מול מידע זמין לציבור, והוא נעשה קל יותר עם כל מערך נתונים נוסף שנעשה זמין. זו הסיבה שטענת אנונימיזציה ישרה חייבת להתייחס למה שנשאר, ולא רק למה שנמחק.

מה באמת נחשב אנונימי?

נתונים אנונימיים כאשר את היחידים שבהם איש אינו יכול לזהות, בכל אמצעי שסביר להניח שישמש, וזהו תנאי חזק יותר ממה שרוב הצוותים מניחים, מפני שהוא כולל מידע שנמצא במקום אחר. באופן מעשי פירושו שטענת אנונימיזציה תקינה נשענת על הערכה מתועדת: אילו שדות הוסרו או הוכללו, כיצד נראית האוכלוסייה המתקבלת, מה נשאר בשילוב, ומדוע זיהוי אינו סביר.

שתי השלכות ראויות לתשומת לב. הראשונה היא שההערכה ספציפית למערך נתונים ולקשרו, ולכן גישה שעבדה עבור מהדורה אחת עשויה שלא לעבוד עבור הבאה אם נוספו עמודות. השנייה היא שההערכה קשה באמת, מפני שלהוכיח שלילה בנוגע לזיהוי קשה בהרבה מהוכחה שעמודת טקסט נמחקה.

במקום שבו הקושי גבוה, התשובה הישרה היא בדרך כלל להפסיק לכנות את הנתונים אנונימיים. פסידונימי, מוגבל, ולשימוש פנימי בלבד הם תיאורים שאפשר להגן עליהם; אנונימי היא טענה שצריך להרוויח.

איזו גישה מתאימה לסביבת בדיקות?

נתונים בדיוניים, ברוב המוחלט של המקרים, מפני שהם מסירים את החובה במקום לנהל אותה. למערך שמופק מכללים ומקלט קבוע אין יחידים בו כלל, ולכן אין שעון שמירה, אין שאלת הסכמה, אין בקשת הסרה למלא, ואין דיווח על פרצה אם הוא דולף. אפשר להעלות אותו למאגר בדיקות, לשלוח אותו בדואר בין צוותים ולהדביק אותו לכרטיס בלי מחשבה שנייה על המידע של מי נמצא בו.

הוא גם עוקף בעיה מעשית שנתונים מוסווים ממשיכים לייצר: המיפוי. נתונים פסידונימיים זקוקים למיפוי שנשמר במקום כלשהו, והמיפוי הזה הוא בעצמו מערך נתונים רגיש שיש להגן עליו, להחליף ולבקר. צוותים משקיעים באופן שגרתי יותר מאמץ בהגנה על המיפוי מאשר היו משקיעים בהפקה של הנתונים.

מה שדווקא אין בנתונים בדיוניים הוא שחזור אוטומטי של כל תכונה של נתונים אמיתיים. אם בדיקה תלויה בהתפלגות, בשכיחות של מקרה קצה נדיר, במתאם בין שני שדות, או בצורת הזנב הארוך, יש למדל אותה במכוון ולא לרשת אותה. דרישות עקביות בין שדות הן דוגמה לכך: מחולל חייב להיבנות כך שישמור שדות קשורים בהסכמה, מפני שאקראיות לבדה לא תעשה זאת.

כיצד שומרים על מערך נתונים מופק כניתן לשחזור?

הופכים אותו לפונקציה של קלט שנשלט, ולא של השעון או של מקור אקראי שאי אפשר לשחזר. הסידור המקובל הוא זרע: ערך קצר שאדם יכול לרשום, שמניע כל החלטה של המחולל, כך שאותו זרע מפיק את אותן רשומות בכל מחשב ובכל יום.

יכולת שחזור חשובה משלוש סיבות שקל לשכוח תחת לחץ זמן. בדיקה אוטומטית יכולה להחזיק דוגמה קבועה ולטעון טענה מולה, כך שכשל ניתן לאבחון ולא להטלת מטבע. דוח תקלה יכול לנקוב בשם הרשומה המדויקת שהוא ראה, כך שכל אחד יכול לבנות אותה מחדש במחשב שלו. וסקירה יכולה לשחזר הדגמה במדויק, וזה חשוב כאשר מערך נתונים מוצע כראיה לכך שאין בו רשומות אמיתיות.

רשומות שמופקות ממחולל הזהות ונתוני הבדיקה עובדות בדרך הזאת, והערכים בהן נשמעים לכללי התבנית האמיתיים של כל מדינה בעודם מומצאים לחלוטין. אלה רשומות בדיוניות המיועדות לבדיקות תוכנה בלבד; הן אינן מתארות אדם אמיתי, ואי אפשר להשתמש בהן כמייצגות אדם או כדי לעבור אימות אמיתי כלשהו.

כיצד מוכיחים שמערך נתוני בדיקה אינו מכיל רשומות אמיתיות?

בכך שאפשר לתאר מהיכן הגיע כל ערך. זו שאלה של מקור, והיא נענית בזמן ההפקה ולא בזמן הביקורת. למערך שהופק בהרצת מחולל עם זרע ידוע, ממחולל שאינו קורא משום מקור ייצור, יש תשובה של שורה אחת. למערך שהופק בהמרה של ייצוא מייצור יש תשובה שתלויה בכך שההמרה נכונה, והנטל להוכיח זאת אינו נעלם לגמרי.

שני מנהגים הופכים את המקור לעמיד. יש לסמן את הנתונים עצמם, עמודה או כותרת שמציינת שהשורות בדיוניות, כך שגם העתק שנודד לכרטיס, לגיליון או לצילום מסך עוד מצהיר מה הוא. וכדאי להחזיק את שלב ההפקה בבקרת גרסאות, כך שהפקה מחדש של אותו מערך היא פקודה ולא מסורת שבעל פה.

יש בדיקה אחרונה שראויה להיעשות לכל מערך שטוען שהוא בטוח: לנסות לזהות בו אדם אחד. אם הניסיון מצליח ולו פעם אחת, הטענה הוגזמה, והתגובה הנכונה היא טענה מצומצמת יותר ולא טענה רועשת יותר.

למפתחים: זרעים, התפלגויות וטענות ישרות

יש לתכנן את המחולל כך שכל החלטה אקראית תזרום מהזרע במסלול מתועד אחד. שני מחוללים שמקבלים זרע אך צורכים אקראיות בסדרים שונים יחלקו ביניהם, והמחלוקת תיראה כמו תקלה בבדיקה ולא במחולל.

יש למדל את ההתפלגות במכוון. בנתונים אמיתיים כל דבר מופיע בכמויות לא אחידות, והגרלה אחידה מפיקה מערך מסודר מדי: בלי שמות נדירים, בלי גילאים חריגים, בלי שדות חסרים. אם הבדיקה זקוקה לזנב ארוך, המחולל חייב להפיק אותו בכוונה, וזו שאלה של אפיון הנתונים ולא תכונה שמתהווה מעצמה.

יש להשאיר את הטענה על הנתונים צרה ואמתית. בדיוני ומופק לצורכי בדיקה היא טענה שאפשר לאמת בקריאת שלב ההפקה. היא שווה למבקר הרבה יותר מטענה רחבה על אנונימיות שאיש אינו יכול לשחזר. וכדאי להעביר את המגבלה גם להערות נתוני הבדיקה הקבועים: רשומות שמופקות בדרך הזאת קיימות כדי להפעיל תוכנה, לא כדי להתחזות לאיש ולא כדי להיות מוצעות במקום כלשהו כזהות אמיתית.

הצעדים הבאים

יש למצוא מערך נתונים אחד בסביבות הבדיקה שאיש אינו יכול לומר מהיכן הגיע, ולעקוב אחריו; התשובה הזאת מעניינת בדרך כלל יותר מהמערך עצמו. לאחר מכן יש להחליף אותו באצווה מופקת ולתעד את הזרע לצד הנתונים, כך שכל אחד יוכל לבנות אותה מחדש. אם שוקלים את החלופות, המאמר על כללי פרטיות לנתוני בדיקה מכסה למה מחייב כל בחירה לאחר מכן.

המשך קריאה

מדריכים בנושא מחולל זהויות ונתוני בדיקה