คำว่า ข้อมูลสังเคราะห์ ถูกใช้ปนกับคำอย่างการปิดบังและการทำให้ไม่ระบุตัวบุคคลอยู่บ่อยครั้ง ทั้งที่ทั้งสามวิธีให้ผลลัพธ์ต่างกันมาก และมีความเสี่ยงที่ต่างกันด้วย บทความนี้จะพาคุณแยกสี่เส้นทางที่ข้อมูลทดสอบมักมาจาก พร้อมอธิบายว่าทำไมเส้นทางที่ดูปลอดภัยที่สุดจึงไม่ใช่เส้นทางที่ใช้กันมากที่สุด
ข้อมูลทดสอบมีสี่เส้นทางที่มา อะไรบ้าง?
เส้นทางแรกคือข้อมูลที่สร้างขึ้นใหม่ทั้งหมด หรือที่เรียกว่าข้อมูลสังเคราะห์ ค่าทุกช่องถูกสร้างตามรูปแบบและความน่าจะเป็นที่กำหนดไว้ โดยไม่มีระเบียนจริงเป็นต้นทางแม้แต่ระเบียนเดียว
เส้นทางที่สองคือการปิดบังข้อมูลจริง โดยซ่อนบางส่วนของค่าก่อนนำออกมาใช้ ข้อมูลต้นทางยังอยู่ครบและยังชี้กลับไปหาบุคคลได้
เส้นทางที่สามคือการใช้ชื่อแทน คือแทนตัวระบุด้วยรหัสและแยกกุญแจถอดกลับไว้ที่อื่น ข้อมูลยังเชื่อมกลับหาบุคคลได้ถ้ามีกุญแจ
เส้นทางที่สี่คือการทำให้ไม่ระบุตัวบุคคลได้ ซึ่งเป็นเป้าหมายที่ยากที่สุด เพราะต้องทำให้ข้อมูลชี้กลับหาบุคคลไม่ได้จริงแม้จะมีข้อมูลอื่นประกอบ
สี่เส้นทางที่ข้อมูลทดสอบมักมาจาก:
- เส้นทางแรกคือข้อมูลที่สร้างขึ้นใหม่ทั้งหมด หรือที่เรียกว่าข้อมูลสังเคราะห์
- เส้นทางที่สองคือการปิดบังข้อมูลจริง โดยซ่อนบางส่วนของค่าก่อนนำออกมาใช้
- เส้นทางที่สามคือการใช้ชื่อแทน คือแทนตัวระบุด้วยรหัสและแยกกุญแจถอดกลับไว้ที่อื่น
- เส้นทางที่สี่คือการทำให้ไม่ระบุตัวบุคคลได้ ซึ่งเป็นเป้าหมายที่ยากที่สุด
ทำไมการตัดชื่อออกจึงไม่เท่ากับการทำให้ไม่ระบุตัวบุคคล?
เพราะข้อมูลที่เหลือยังชี้กลับหาคนได้เสมอเมื่อมีข้อมูลอื่นประกอบ ตัวอย่างที่ชัดเจนคืองานวิจัยที่แสดงว่าวันเกิด เพศ และรหัสไปรษณีย์รวมกันก็แยกคนออกจากกันได้ในระดับที่แคบมาก แม้จะไม่มีชื่ออยู่ในชุดข้อมูลเลย
ข้อมูลอื่นที่ช่วยในการชี้กลับได้แก่รหัสลูกค้าที่คงที่ข้ามระบบ หมายเลขอุปกรณ์ หมายเลขโทรศัพท์ที่เคยปรากฏที่อื่น และเวลาที่เกิดเหตุการณ์ซึ่งตรงกันกับข้อมูลที่เปิดเผยอยู่แล้ว
ยิ่งข้อมูลแต่ละช่องถูกเก็บไว้นานเท่าใด โอกาสที่จะมีข้อมูลอื่นมาประกอบก็ยิ่งมากขึ้นเท่านั้น ความเสี่ยงจึงไม่ได้คงที่ แต่เพิ่มขึ้นตามเวลา
การปิดบังข้อมูลจริงเพียงพอสำหรับงานทดสอบหรือไม่?
การปิดบังช่วยลดการมองเห็นจากหน้าจอและลดความเสียหายเมื่อระบบถูกเข้าถึงอย่างไม่ได้รับอนุญาต จึงมีประโยชน์ในระบบจริง แต่สำหรับงานทดสอบยังมีข้อจำกัดสำคัญสามข้อ
ข้อแรกคือข้อมูลยังมีต้นทางเป็นคนจริง จึงต้องอยู่ภายใต้การคุ้มครองตลอดเวลาที่อยู่ในระบบทดสอบ และเมื่อระบบทดสอบหลุด ข้อมูลที่ปิดบังก็ยังเป็นข้อมูลของคนจริง
ข้อที่สองคือการปิดบังทำให้ข้อมูลไม่เหมือนจริงในจุดที่การทดสอบต้องการความเหมือนจริง เช่นการทดสอบฟังก์ชันที่ต้องใช้ค่าทั้งค่าจะพังทันทีถ้าค่าถูกตัดครึ่ง
ข้อที่สามคือการปิดบังต้องได้รับการดูแลอย่างต่อเนื่อง เมื่อมีช่องใหม่เพิ่มขึ้นในระบบ แต่การปิดบังยังไม่ครอบคลุมช่องนั้น ข้อมูลจะหลุดออกไปแบบไม่ตั้งใจและไม่มีใครรู้
วิธีใดเหมาะกับงานทดสอบมากที่สุด?
สำหรับงานทดสอบส่วนใหญ่ ข้อมูลที่สร้างขึ้นใหม่ให้ความสมดุลที่ดีที่สุดระหว่างความเหมือนจริงกับความปลอดภัย เพราะไม่มีระเบียนจริงอยู่ในชุดข้อมูลเลย จึงไม่ต้องกังวลเรื่องการรั่วไหลของข้อมูลบุคคล
ข้อมูลสังเคราะห์ยังช่วยในเรื่องที่ข้อมูลจริงทำได้ยาก คือการสร้างกรณีขอบเขตที่หายาก เช่นผู้ใช้อายุมากมาก ชื่อยาวผิดปกติ หรือระเบียนที่ไม่มีค่าบางช่อง ซึ่งข้อมูลจริงมีไม่พอให้ทดสอบครบ
ข้อจำกัดที่ต้องรู้คือข้อมูลที่สร้างขึ้นใหม่จะเหมือนจริงได้เท่ากับแบบจำลองที่ใช้สร้าง ถ้าแบบจำลองไม่สะท้อนความหลากหลายของข้อมูลจริง การทดสอบก็จะครอบคลุมไม่ครบ และนี่คือเหตุผลที่การกระจายของข้อมูลต้องถูกออกแบบอย่างตั้งใจ ไม่ใช่ใช้ค่าคงที่ซ้ำ ๆ
สำหรับนักพัฒนา: เลือกเมล็ดพันธุ์ให้ทำซ้ำได้ และพิสูจน์ว่าไม่มีข้อมูลจริง
ข้อแรกคือให้ตัวสร้างข้อมูลรับเมล็ดพันธุ์ที่ระบุได้ เมล็ดพันธุ์เดียวกันต้องให้ผลลัพธ์เดิมทุกครั้ง เมล็ดพันธุ์ต่างกันต้องให้ผลลัพธ์ที่ต่างกันจริง การทำซ้ำได้คือสิ่งที่ทำให้ข้อบกพร่องถูกตามหาเจอ
ข้อที่สองคือตรวจว่าการกระจายของค่าที่สร้างขึ้นสมเหตุสมผลตามประเทศที่เลือก ไม่ใช่ใช้ค่าเดียวกับทุกประเทศ เพราะข้อมูลที่ทุกประเทศเหมือนกันจะไม่กระตุ้นข้อบกพร่องที่เกี่ยวกับความหลากหลายเลย
ข้อที่สามคือแยกให้ชัดระหว่างการจำลองความน่าจะเป็นกับการคัดลอกระเบียน การดึงค่าที่พบบ่อยที่สุดจากข้อมูลจริงมาใช้ซ้ำ ๆ เป็นการคัดลอกที่ปลอมแปลงขึ้นมา ไม่ใช่การสร้างใหม่
ข้อที่สี่คือเก็บหลักฐานว่าชุดข้อมูลนี้ไม่มีระเบียนจริงปนอยู่ วิธีที่ตรงไปตรงมาที่สุดคือพิสูจน์ว่าสร้างขึ้นใหม่ได้จากเมล็ดพันธุ์เพียงค่าเดียว ไม่ใช่จากการนำเข้าข้อมูลจากที่ใด แนวคิดเรื่องเมล็ดพันธุ์และความคงที่ของผลลัพธ์มีอธิบายเพิ่มเติมในข้อมูลทดสอบในระบบทดสอบประจำ
ข้อที่ห้าคือทำเครื่องหมายระเบียนทดสอบไว้ที่ข้อมูลเอง เพื่อให้ลบได้ทั้งหมดในคราวเดียวและตรวจสอบย้อนหลังได้ว่าชุดใดถูกใช้ในสภาพแวดล้อมใด
ข้อที่ควรคำนึงเมื่อใช้เมล็ดพันธุ์และพิสูจน์ว่าไม่มีข้อมูลจริง:
- ข้อแรกคือให้ตัวสร้างข้อมูลรับเมล็ดพันธุ์ที่ระบุได้
- ข้อที่สองคือตรวจว่าการกระจายของค่าที่สร้างขึ้นสมเหตุสมผลตามประเทศที่เลือก
- ข้อที่สามคือแยกให้ชัดระหว่างการจำลองความน่าจะเป็นกับการคัดลอกระเบียน
- ข้อที่สี่คือเก็บหลักฐานว่าชุดข้อมูลนี้ไม่มีระเบียนจริงปนอยู่
- ข้อที่ห้าคือทำเครื่องหมายระเบียนทดสอบไว้ที่ข้อมูลเอง
ก้าวต่อไป
ลองถามทีมของคุณว่าชุดข้อมูลทดสอบชุดปัจจุบันสร้างขึ้นใหม่ได้จากเมล็ดพันธุ์หรือไม่ ถ้าคำตอบคือไม่ นั่นหมายความว่าชุดข้อมูลนั้นมีต้นทางจากที่อื่น และควรตรวจว่าต้นทางนั้นคืออะไร
ในเครื่องมือสร้างข้อมูลตัวตนของเว็บไซต์นี้ ทุกช่องถูกสร้างขึ้นใหม่ตามรูปแบบของประเทศที่เลือก และใช้คีย์ตัวตนหนึ่งคีย์เพื่อให้ได้ระเบียนเดิมซ้ำได้ทุกครั้ง ถ้าคุณอยากเห็นภาพรวมของวิธีสร้างข้อมูลแบบอื่น เทียบได้ที่วิธีสร้างข้อมูลทดสอบแบบต่างๆ และถ้าประเด็นคือการเก็บข้อมูลส่วนบุคคลในระบบทดสอบ อ่านต่อได้ที่ข้อมูลส่วนบุคคลในระบบทดสอบ
ข้อมูลทุกชุดที่กล่าวถึงในบทความนี้เป็นข้อมูลที่สังเคราะห์ขึ้นเพื่อการทดสอบเท่านั้น ไม่ตรงกับบุคคล ที่อยู่ หรือบัญชีจริงใด และไม่สามารถใช้ผ่านการยืนยันตัวตนได้