เมนู

ข้อมูลสังเคราะห์ การปิดบัง และข้อมูลนิรนาม ต่างกันอย่างไร

ข้อมูลทดสอบมีหลายเส้นทางที่มา ทั้งการสร้างขึ้นใหม่ การปิดบังข้อมูลจริง และการทำให้ไม่ระบุตัวบุคคล บทความนี้อธิบายความต่างของแต่ละวิธี ข้อจำกัดที่มักถูกมองข้าม และเหตุใดข้อมูลที่สร้างขึ้นใหม่จึงเหมาะกับงานทดสอบที่สุด

เผยแพร่เมื่อ

  • ข้อมูลทดสอบ
  • ความเป็นส่วนตัว

คำว่า ข้อมูลสังเคราะห์ ถูกใช้ปนกับคำอย่างการปิดบังและการทำให้ไม่ระบุตัวบุคคลอยู่บ่อยครั้ง ทั้งที่ทั้งสามวิธีให้ผลลัพธ์ต่างกันมาก และมีความเสี่ยงที่ต่างกันด้วย บทความนี้จะพาคุณแยกสี่เส้นทางที่ข้อมูลทดสอบมักมาจาก พร้อมอธิบายว่าทำไมเส้นทางที่ดูปลอดภัยที่สุดจึงไม่ใช่เส้นทางที่ใช้กันมากที่สุด

ข้อมูลทดสอบมีสี่เส้นทางที่มา อะไรบ้าง?

เส้นทางแรกคือข้อมูลที่สร้างขึ้นใหม่ทั้งหมด หรือที่เรียกว่าข้อมูลสังเคราะห์ ค่าทุกช่องถูกสร้างตามรูปแบบและความน่าจะเป็นที่กำหนดไว้ โดยไม่มีระเบียนจริงเป็นต้นทางแม้แต่ระเบียนเดียว

เส้นทางที่สองคือการปิดบังข้อมูลจริง โดยซ่อนบางส่วนของค่าก่อนนำออกมาใช้ ข้อมูลต้นทางยังอยู่ครบและยังชี้กลับไปหาบุคคลได้

เส้นทางที่สามคือการใช้ชื่อแทน คือแทนตัวระบุด้วยรหัสและแยกกุญแจถอดกลับไว้ที่อื่น ข้อมูลยังเชื่อมกลับหาบุคคลได้ถ้ามีกุญแจ

เส้นทางที่สี่คือการทำให้ไม่ระบุตัวบุคคลได้ ซึ่งเป็นเป้าหมายที่ยากที่สุด เพราะต้องทำให้ข้อมูลชี้กลับหาบุคคลไม่ได้จริงแม้จะมีข้อมูลอื่นประกอบ

สี่เส้นทางที่ข้อมูลทดสอบมักมาจาก:

  • เส้นทางแรกคือข้อมูลที่สร้างขึ้นใหม่ทั้งหมด หรือที่เรียกว่าข้อมูลสังเคราะห์
  • เส้นทางที่สองคือการปิดบังข้อมูลจริง โดยซ่อนบางส่วนของค่าก่อนนำออกมาใช้
  • เส้นทางที่สามคือการใช้ชื่อแทน คือแทนตัวระบุด้วยรหัสและแยกกุญแจถอดกลับไว้ที่อื่น
  • เส้นทางที่สี่คือการทำให้ไม่ระบุตัวบุคคลได้ ซึ่งเป็นเป้าหมายที่ยากที่สุด

ทำไมการตัดชื่อออกจึงไม่เท่ากับการทำให้ไม่ระบุตัวบุคคล?

เพราะข้อมูลที่เหลือยังชี้กลับหาคนได้เสมอเมื่อมีข้อมูลอื่นประกอบ ตัวอย่างที่ชัดเจนคืองานวิจัยที่แสดงว่าวันเกิด เพศ และรหัสไปรษณีย์รวมกันก็แยกคนออกจากกันได้ในระดับที่แคบมาก แม้จะไม่มีชื่ออยู่ในชุดข้อมูลเลย

ข้อมูลอื่นที่ช่วยในการชี้กลับได้แก่รหัสลูกค้าที่คงที่ข้ามระบบ หมายเลขอุปกรณ์ หมายเลขโทรศัพท์ที่เคยปรากฏที่อื่น และเวลาที่เกิดเหตุการณ์ซึ่งตรงกันกับข้อมูลที่เปิดเผยอยู่แล้ว

ยิ่งข้อมูลแต่ละช่องถูกเก็บไว้นานเท่าใด โอกาสที่จะมีข้อมูลอื่นมาประกอบก็ยิ่งมากขึ้นเท่านั้น ความเสี่ยงจึงไม่ได้คงที่ แต่เพิ่มขึ้นตามเวลา

การปิดบังข้อมูลจริงเพียงพอสำหรับงานทดสอบหรือไม่?

การปิดบังช่วยลดการมองเห็นจากหน้าจอและลดความเสียหายเมื่อระบบถูกเข้าถึงอย่างไม่ได้รับอนุญาต จึงมีประโยชน์ในระบบจริง แต่สำหรับงานทดสอบยังมีข้อจำกัดสำคัญสามข้อ

ข้อแรกคือข้อมูลยังมีต้นทางเป็นคนจริง จึงต้องอยู่ภายใต้การคุ้มครองตลอดเวลาที่อยู่ในระบบทดสอบ และเมื่อระบบทดสอบหลุด ข้อมูลที่ปิดบังก็ยังเป็นข้อมูลของคนจริง

ข้อที่สองคือการปิดบังทำให้ข้อมูลไม่เหมือนจริงในจุดที่การทดสอบต้องการความเหมือนจริง เช่นการทดสอบฟังก์ชันที่ต้องใช้ค่าทั้งค่าจะพังทันทีถ้าค่าถูกตัดครึ่ง

ข้อที่สามคือการปิดบังต้องได้รับการดูแลอย่างต่อเนื่อง เมื่อมีช่องใหม่เพิ่มขึ้นในระบบ แต่การปิดบังยังไม่ครอบคลุมช่องนั้น ข้อมูลจะหลุดออกไปแบบไม่ตั้งใจและไม่มีใครรู้

วิธีใดเหมาะกับงานทดสอบมากที่สุด?

สำหรับงานทดสอบส่วนใหญ่ ข้อมูลที่สร้างขึ้นใหม่ให้ความสมดุลที่ดีที่สุดระหว่างความเหมือนจริงกับความปลอดภัย เพราะไม่มีระเบียนจริงอยู่ในชุดข้อมูลเลย จึงไม่ต้องกังวลเรื่องการรั่วไหลของข้อมูลบุคคล

ข้อมูลสังเคราะห์ยังช่วยในเรื่องที่ข้อมูลจริงทำได้ยาก คือการสร้างกรณีขอบเขตที่หายาก เช่นผู้ใช้อายุมากมาก ชื่อยาวผิดปกติ หรือระเบียนที่ไม่มีค่าบางช่อง ซึ่งข้อมูลจริงมีไม่พอให้ทดสอบครบ

ข้อจำกัดที่ต้องรู้คือข้อมูลที่สร้างขึ้นใหม่จะเหมือนจริงได้เท่ากับแบบจำลองที่ใช้สร้าง ถ้าแบบจำลองไม่สะท้อนความหลากหลายของข้อมูลจริง การทดสอบก็จะครอบคลุมไม่ครบ และนี่คือเหตุผลที่การกระจายของข้อมูลต้องถูกออกแบบอย่างตั้งใจ ไม่ใช่ใช้ค่าคงที่ซ้ำ ๆ

สำหรับนักพัฒนา: เลือกเมล็ดพันธุ์ให้ทำซ้ำได้ และพิสูจน์ว่าไม่มีข้อมูลจริง

ข้อแรกคือให้ตัวสร้างข้อมูลรับเมล็ดพันธุ์ที่ระบุได้ เมล็ดพันธุ์เดียวกันต้องให้ผลลัพธ์เดิมทุกครั้ง เมล็ดพันธุ์ต่างกันต้องให้ผลลัพธ์ที่ต่างกันจริง การทำซ้ำได้คือสิ่งที่ทำให้ข้อบกพร่องถูกตามหาเจอ

ข้อที่สองคือตรวจว่าการกระจายของค่าที่สร้างขึ้นสมเหตุสมผลตามประเทศที่เลือก ไม่ใช่ใช้ค่าเดียวกับทุกประเทศ เพราะข้อมูลที่ทุกประเทศเหมือนกันจะไม่กระตุ้นข้อบกพร่องที่เกี่ยวกับความหลากหลายเลย

ข้อที่สามคือแยกให้ชัดระหว่างการจำลองความน่าจะเป็นกับการคัดลอกระเบียน การดึงค่าที่พบบ่อยที่สุดจากข้อมูลจริงมาใช้ซ้ำ ๆ เป็นการคัดลอกที่ปลอมแปลงขึ้นมา ไม่ใช่การสร้างใหม่

ข้อที่สี่คือเก็บหลักฐานว่าชุดข้อมูลนี้ไม่มีระเบียนจริงปนอยู่ วิธีที่ตรงไปตรงมาที่สุดคือพิสูจน์ว่าสร้างขึ้นใหม่ได้จากเมล็ดพันธุ์เพียงค่าเดียว ไม่ใช่จากการนำเข้าข้อมูลจากที่ใด แนวคิดเรื่องเมล็ดพันธุ์และความคงที่ของผลลัพธ์มีอธิบายเพิ่มเติมในข้อมูลทดสอบในระบบทดสอบประจำ

ข้อที่ห้าคือทำเครื่องหมายระเบียนทดสอบไว้ที่ข้อมูลเอง เพื่อให้ลบได้ทั้งหมดในคราวเดียวและตรวจสอบย้อนหลังได้ว่าชุดใดถูกใช้ในสภาพแวดล้อมใด

ข้อที่ควรคำนึงเมื่อใช้เมล็ดพันธุ์และพิสูจน์ว่าไม่มีข้อมูลจริง:

  • ข้อแรกคือให้ตัวสร้างข้อมูลรับเมล็ดพันธุ์ที่ระบุได้
  • ข้อที่สองคือตรวจว่าการกระจายของค่าที่สร้างขึ้นสมเหตุสมผลตามประเทศที่เลือก
  • ข้อที่สามคือแยกให้ชัดระหว่างการจำลองความน่าจะเป็นกับการคัดลอกระเบียน
  • ข้อที่สี่คือเก็บหลักฐานว่าชุดข้อมูลนี้ไม่มีระเบียนจริงปนอยู่
  • ข้อที่ห้าคือทำเครื่องหมายระเบียนทดสอบไว้ที่ข้อมูลเอง

ก้าวต่อไป

ลองถามทีมของคุณว่าชุดข้อมูลทดสอบชุดปัจจุบันสร้างขึ้นใหม่ได้จากเมล็ดพันธุ์หรือไม่ ถ้าคำตอบคือไม่ นั่นหมายความว่าชุดข้อมูลนั้นมีต้นทางจากที่อื่น และควรตรวจว่าต้นทางนั้นคืออะไร

ในเครื่องมือสร้างข้อมูลตัวตนของเว็บไซต์นี้ ทุกช่องถูกสร้างขึ้นใหม่ตามรูปแบบของประเทศที่เลือก และใช้คีย์ตัวตนหนึ่งคีย์เพื่อให้ได้ระเบียนเดิมซ้ำได้ทุกครั้ง ถ้าคุณอยากเห็นภาพรวมของวิธีสร้างข้อมูลแบบอื่น เทียบได้ที่วิธีสร้างข้อมูลทดสอบแบบต่างๆ และถ้าประเด็นคือการเก็บข้อมูลส่วนบุคคลในระบบทดสอบ อ่านต่อได้ที่ข้อมูลส่วนบุคคลในระบบทดสอบ

ข้อมูลทุกชุดที่กล่าวถึงในบทความนี้เป็นข้อมูลที่สังเคราะห์ขึ้นเพื่อการทดสอบเท่านั้น ไม่ตรงกับบุคคล ที่อยู่ หรือบัญชีจริงใด และไม่สามารถใช้ผ่านการยืนยันตัวตนได้

อ่านต่อ

บทความเกี่ยวกับ เครื่องมือสร้างข้อมูลตัวตนและข้อมูลทดสอบออนไลน์

บทความเกี่ยวกับ เครื่องมือสร้างข้อมูลตัวตนและข้อมูลทดสอบออนไลน์

รายการนี้แสดงเฉพาะบทความในหัวข้อของหน้านี้