القائمة

البيانات الوهمية مقابل البيانات المجهولة: ما الذي يقرره الفرق

البيانات الوهمية مقابل البيانات المجهولة ليس اختيار صياغة: إحداهما ملفقة، والأخرى بيانات حقيقية محولة. والفرق يقرر ما يجوز أن تفعله بها.

تاريخ النشر

  • بيانات اختبار
  • هوية
  • الخصوصية

البيانات الوهمية مقابل البيانات المجهولة تبدو خيارا بين طعمين للشيء نفسه، ومعاملتها كذلك تسبب مشكلات حقيقية. فواحدة منهما لم تكن ملكا لأحد قط، والأخرى كانت ملكا لأحد ثم عولجت لإزالته. والفرق يقرر من يجوز له رؤية البيانات، وكم يجوز الاحتفاظ بها، وهل يمكن مشاركتها خارج المؤسسة أصلا.

يعرض هذا المقال المقاربات الأربع التي يستخدمها الناس فعلا في بيانات الاختبار، وما يضمنه كل منها وما لا يضمنه، ولماذا يكون دمج الحقول هو التفصيل الذي يهزم معظم محاولات الإزالة بصمت.

المقاربات الأربع جنبا إلى جنب

تنتج معظم مجموعات بيانات الاختبار بإحدى أربع طرق، وكثيرا ما توصف كلها بالكلمة نفسها.

الوهمية. تُنتج قيمها من قواعد ومن عشوائية، وتضمن أن شيئا في المجموعة لم يصف إنسانا حقيقيا قط.

المجهولة الهوية. تُعالج سجلات حقيقية حتى لا يمكن التعرف على أفرادها، وهنا وُجدت البيانات الأصلية، ويجب إثبات التحويل.

المرمزة بديلا. تُستبدل المعرفات المباشرة برموز مع الاحتفاظ بخريطة ربط، وتبقى البيانات قابلة للربط بأشخاص من خلال تلك الخريطة.

المموهة. تُستبدل محارف حساسة بغرض العرض، وتبقى القيمة الأصلية موجودة عادة.

والأولى وحدها تبدأ من لا شيء. أما الثلاث الأخرى فتبدأ كلها من سجلات حقيقية، ولهذا يرث كل منها التزاما لم ترثه الأولى قط.

لماذا لا يؤدي حذف الأسماء إلى إخفاء الهوية؟

لأن الاسم واحد فقط من طرق كثيرة لتمييز شخص، وليس أعلاها موثوقية في العادة. فجدول أسقط عمود الاسم ما زال يخبرك بأن امرأة في الثلاثينيات تعمل لدى صاحب عمل صغير معين في بلدة صغيرة معينة، وقد يوجد في ذلك السكان شخص واحد بهذه الصفات بالضبط. لم يُخف شيء؛ استُبدل المعرّف فحسب بمجموعة معرفات تكلف جهدا أكبر قليلا.

والصورة الإحصائية للمشكلة نفسها أن أية مجموعة بيانات تحمل شبه معرفات، أي قيم ليست فريدة بمفردها لكنها تصبح فريدة بالتركيب. وتاريخ الميلاد والرمز البريدي والجنس والمهنة هي المجموعة الكلاسيكية، والحساب غير رحيم: فتركيبة تبدو واسعة عبر بلد كامل قد تكون فريدة داخل مدينة واحدة، وقاعدة بيانات اختبار هي عادة شريحة من سوق واحدة لا عينة من العالم.

ولذلك ليس إعادة التعرف أمرا غريبا. إنه النتيجة العادية لدمج بضعة أعمدة مع معلومات متاحة علنا، وهو يصبح أسهل مع كل مجموعة بيانات إضافية تتاح. ولهذا يجب أن يعالج ادعاء إخفاء الهوية الصادق ما تبقى، لا ما حُذف فقط.

ما الذي يعد مجهولا فعلا؟

تكون البيانات مجهولة حين لا يستطيع أحد التعرف على الأفراد فيها بأي وسيلة يرجح استخدامها، وهذا شرط أقوى مما تفترضه معظم الفرق، لأنه يشمل معلومات محفوظة في مكان آخر. وعمليا يعني ذلك أن ادعاء إخفاء الهوية السليم يقوم على تقييم موثق: أي الحقول حُذفت أو عُممت، وكيف تبدو مجموعة السكان الناتجة، وما تبقى منها بالتركيب، ولماذا يكون التعرف غير ممكن بشكل معقول.

وثمت نتيجتان تستحقان الأخذ بجدية. الأولى أن التقييم خاص بمجموعة بيانات وسياق، فمقاربة تصلح لإصدار قد لا تصلح للتالي إن أضيفت أعمدة جديدة. والثانية أن التقييم صعب حقا، لأن إثبات أمر سلبي بشأن التعرف جهد أكبر بكثير من إظهار أن عمودا نصيا قد أُسقط.

وحيث تكون الصعوبة عالية، يكون الجواب الصادق عادة التوقف عن تسمية البيانات مجهولة. فالمرمزة بديلا والمقيدة والداخلية فقط أوصاف يمكن الدفاع عنها؛ أما مجهولة فهي ادعاء يجب أن يُستحق.

أي مقاربة ينبغي أن تستخدمها بيئة الاختبار؟

البيانات الوهمية في الغالبية العظمى من الحالات، لأنها تزيل الالتزام بدلا من إدارته. فمجموعة منتجة من قواعد ومن مدخل ثابت لا تحوي أفرادا على الإطلاق، فلا ساعة احتفاظ، ولا سؤال موافقة، ولا طلب إزالة يجب الوفاء به، ولا حادث يجب الإبلاغ عنه إن تسربت. ويمكن إيداعها في مستودع اختبار، وإرسالها بين الفرق، ولصقها في تذكرة من دون تفكير ثان في معلومات من تحوي.

وهي تتجاوز أيضا مشكلة عملية لا تنفك البيانات المتنكرة عن توليدها: خريطة الربط. فالبيانات المرمزة بديلا تحتاج خريطة تحفظ في مكان ما، وتلك الخريطة نفسها مجموعة بيانات حساسة يجب حمايتها وتدويرها وتدقيقها. والفرق تنفق عادة جهدا في حماية الخريطة أكثر مما كانت ستنفقه على إنشاء البيانات أصلا.

وما لا تفعله السجلات الوهمية أنها لا تعيد إنتاج كل خصائص البيانات الحقيقية تلقائيا. فإن كان اختبار يعتمد على التوزيع—تكرار حالة حدية نادرة، أو الارتباط بين حقلين، أو شكل ذيل طويل—فيجب نمذجة ذلك عن قصد بدلا من وراثته. ومتطلبات اتساق حقول الهوية مثال واضح: فيجب بناء أداة الإنشاء بحيث تبقي الحقول المرتبطة متفقة، لأن العشوائية وحدها لا تفعل ذلك.

كيف تجعل مجموعة بيانات منتجة قابلة للإعادة؟

بأن تجعلها دالة لمدخل تتحكم فيه، لا للساعة ولا لمصدر عشوائي لا يمكنك إعادته. والترتيب المعتاد بذرة: قيمة قصيرة قابلة للتسجيل البشري تقود كل قرار تتخذه أداة الإنشاء، فتنتج البذرة نفسها السجلات نفسها على أي جهاز وفي أي يوم.

وقابلية الإعادة تهم لثلاثة أسباب يسهل نسيانها تحت ضغط الوقت. فاختبار آلي يستطيع حمل عينة ثابتة والتأكيد عليها، فيكون الفشل قابلا للتشخيص لا رمية نقد. وتقرير عيب يستطيع تسمية السجل الذي رآه بالضبط، فيعيده أي أحد على جهازه. ومراجعة تستطيع إعادة إنتاج عرض توضيحي بالضبط، وهذا يهم حين تُقدَّم مجموعة بيانات كدليل على عدم وجود سجلات حقيقية.

والسجلات المنتجة من أداة الهوية وبيانات الاختبار تعمل بهذه الطريقة، وتتبع القيم أعراف التنسيق الحقيقية في كل بلد مع بقائها ملفقة بالكامل. وهي سجلات وهمية مخصصة لاختبار البرمجيات فقط؛ لا تصف إنسانا حقيقيا، ولا يمكن استخدامها للنيابة عنه أو لاجتياز أي تحقق حقيقي.

كيف تثبت أن مجموعة اختبار لا تحوي سجلات حقيقية؟

بأن تستطيع وصف مصدر كل قيمة. فهذا سؤال مصدر، ويُجاب عنه وقت الإنشاء لا وقت التدقيق. فمجموعة أنتجت بتشغيل أداة إنشاء ببذرة معلومة، من أداة لا تقرأ أي مصدر إنتاجي، لها جواب من سطر واحد. أما مجموعة أنتجت بتحويل نسخة من الإنتاج فلها جواب يعتمد على صحة التحويل، وعبء إثبات ذلك لا يزول تماما.

وعادتان تجعلان المصدر صامدا. الأولى وسم البيانات نفسها—عمود أو ترويسة يعلن الصفوف وهمية—كي تظل النسخة التي تسافر إلى تذكرة أو جدول أو لقطة شاشة تعلن عن نفسها. والثانية إبقاء خطوة الإنشاء في نظام إدارة الإصدارات، كي تصبح إعادة إنتاج المجموعة نفسها أمرا لا رواية شفهية.

وثمة فحص أخير يستحق التطبيق على أي مجموعة تدعي السلامة: حاول التعرف على شخص واحد فيها. فإن نجحت المحاولة مرة واحدة فقد بولغ في الادعاء، والاستجابة الصحيحة ادعاء أضيق لا ادعاء أعلى صوتا.

للمطورين: البذور والتوزيعات والادعاءات الصادقة

صمم أداة الإنشاء بحيث تتدفق كل قراراتها العشوائية من البذرة عبر مسار واحد موثق. فأداتان تقبلان بذرة لكنهما تستهلكان العشوائية بترتيب مختلف ستختلفان، وسيبدو الاختلاف عيبا في الاختبار لا في الأداة.

وانمذج التوزيع عن قصد. فالبيانات الحقيقية متفاوتة الكميات في كل شيء، والسحب المنتظم ينتج مجموعة أكثر ترتيبا من الواقع: لا أسماء نادرة، ولا أعمار غير معتادة، ولا حقول غائبة. وإن كان الاختبار يحتاج ذيلا طويلا فيجب أن تنتجه الأداة عن قصد، وهذه مسألة مواصفة تخص البيانات لا خاصية تنشأ من نفسها.

وأبق الادعاء بشأن البيانات ضيقا وصادقا. فالقول إنها وهمية ومنتجة للاختبار ادعاء يمكن التحقق منه بقراءة خطوة الإنشاء، وهو أنفع لمدقق من ادعاء أوسع عن إخفاء الهوية لا يستطيع أحد إعادة إنتاجه. واحمل القيد إلى ملاحظات ملفات التجهيز: فالسجلات المنتجة بهذه الطريقة موجودة لتمرين البرمجيات، لا لانتحال شخصية أحد ولا لتُقدَّم في أي موضع كهوية حقيقية. ولمن يعمل داخل مجموعات اختبار قائمة، تشرح مقالة سجلات الهوية في ملفات التجهيز كيف توضع هذه السجلات في المجموعة من دون إفساد قابلية التكرار.

الخطوات التالية

ابحث في بيئات اختبارك عن مجموعة بيانات لا يستطيع أحد بيان مصدرها، وتتبعها؛ فالجواب عادة أكثر إثارة من المجموعة نفسها. ثم استبدلها بدفعة منتجة وسجل البذرة بجانب البيانات، كي يستطيع أي أحد إعادة بنائها. وإن كنت توازن بين البدائل، فتعرض مقالة قواعد الخصوصية في بيانات اختبار GDPR ما يلزمك فعله بعد كل اختيار من الاختيارات، وكيف تصبح البيئة نفسها معزولة لا مفلترة.

تابع القراءة

أدلة أداة إنشاء الهويات وبيانات الاختبار