Data sintetis vs anonimisasi sering dibicarakan seolah keduanya sama saja, karena hasilnya sama-sama bukan identitas seseorang yang dapat ditunjuk. Perbedaannya bukan pada bentuk akhirnya, melainkan pada asal-usulnya, dan justru dari sanalah seluruh perbedaan risiko mengalir. Satu pendekatan menghapus keterkaitan dari catatan yang pernah ada, sedangkan yang lain tidak pernah memakai catatan seperti itu sama sekali. Tulisan ini membandingkan keduanya sebagai pilihan untuk bahan pengujian, bukan sebagai istilah hukum.
Apa perbedaan mendasar antara keduanya?
Perbedaannya terletak pada titik awal. Anonimisasi berangkat dari kumpulan data yang nyata, lalu berusaha menghilangkan kemungkinan data itu dikaitkan kembali kepada orang tertentu. Data sintetis tidak berangkat dari siapa pun: nilainya dihasilkan oleh aturan, model, atau pola yang disusun lebih dahulu, sehingga tidak ada orang yang perlu dilindungi karena tidak ada orang yang terwakili.
Perbedaan titik awal ini menentukan banyak hal lain. Anonimisasi membawa serta bentuk data yang sebenarnya, lengkap dengan sebaran nilai dan kasus ganjil yang sungguh terjadi. Data sintetis membawa serta kendali penuh, karena Anda dapat menentukan bentuk apa yang muncul, tetapi kendali itu sekaligus menjadi tanggung jawab: apa pun yang tidak Anda masukkan ke dalam aturan tidak akan pernah muncul di hasilnya.
Bisakah data yang sudah dianonimkan dikembalikan?
Bergantung pada seberapa jauh penghapusannya. Ada tindakan yang menyisakan penanda pengganti bersama kuncinya; tindakan seperti itu bukan anonimisasi, melainkan penyamaran berpindah nama, dan datanya masih dapat dikembalikan kepada orang asalnya oleh siapa pun yang memegang kuncinya. Ada juga tindakan yang benar-benar menghapus keterkaitan, misalnya dengan menggabungkan nilai menjadi rentang yang lebar.
Yang perlu disadari, penghapusan keterkaitan bukan sifat yang tetap. Data yang tampak tidak dapat dikembalikan bisa menjadi dapat dikembalikan ketika digabungkan dengan kumpulan data lain yang memuat sebagian ciri yang sama. Sebuah catatan yang telah dihilangkan namanya tetap dapat dipersempit sampai pada satu orang bila kode pos, usia, dan pekerjaan yang tercantum cukup khas. Karena itu, penilaian atas risiko harus mempertimbangkan data lain yang mungkin tersedia, bukan hanya isi satu berkas.
Risiko apa yang melekat pada masing-masing?
Pada data yang dianonimkan, risiko utamanya adalah pengembalian keterkaitan seperti di atas, ditambah pertanyaan tentang dasar pemakaian dan masa simpannya. Catatan yang berasal dari orang nyata juga menua seperti catatan aslinya, sehingga pengujian yang bergantung padanya bisa gagal karena alasan yang tidak berhubungan dengan kode.
Pada data sintetis, risikonya berbeda jenis. Yang paling sering muncul adalah ketidaksesuaian sebaran: nilainya wajar satu per satu, tetapi bersama-sama tidak menyerupai data yang sebenarnya, sehingga pengujian lolos pada keadaan yang tidak pernah terjadi. Risiko kedua adalah rasa percaya yang berlebihan, yaitu anggapan bahwa karena data dihasilkan oleh alat yang canggih, data itu pasti mewakili kenyataan.
Ada pula risiko yang sama pada keduanya, yaitu kehilangan jejak asal-usul. Bila tidak ada catatan tentang dari mana sebuah berkas berasal dan dengan aturan apa isinya dibuat, tidak ada yang dapat memutuskan apakah berkas itu masih boleh dipakai ketika kebutuhan berubah.
Apakah data sintetis selalu lebih baik?
Tidak, dan menganggapnya selalu lebih baik justru menutup pilihan yang berguna. Ada pekerjaan yang memang memerlukan bentuk sebaran nyata, misalnya pengujian beban yang ingin melihat bagaimana sistem berperilaku pada sebaran panjang nama, sebaran kota, dan sebaran tanggal lahir yang sesungguhnya. Untuk keperluan itu, data yang dianonimkan secara ringkas, misalnya berupa rentang dan hitungan, bisa lebih menolong daripada data sintetis yang belum tentu menyerupai kenyataan.
Sebaliknya, untuk pengujian sehari-hari yang berkaitan dengan formulir, format, dan aturan validasi, data sintetis hampir selalu lebih hemat dan lebih aman, karena tidak ada satu pun catatan orang yang perlu dijaga. Data seperti ini hanya untuk pengujian dan tidak boleh dipakai untuk menyamar sebagai orang lain; tidak ada yang mampu melewati verifikasi identitas sungguhan atau membuka akun nyata.
Kedua pendekatan juga dapat dipakai bersama, dan penggabungan itu sering merupakan jalan tengah yang paling masuk akal. Sebuah peninjauan menyeluruh memakai data nyata yang dianonimkan secara ketat untuk memahami sebaran, lalu peninjauan sehari-hari memakai data sintetis yang disetel agar mengikuti sebaran tersebut.
| Aspek | Data sintetis | Data teranonimkan |
|---|---|---|
| Asal | Dibuat oleh aturan atau model | Berasal dari catatan yang ada |
| Keterkaitan pada orang | Tidak ada sejak awal | Bergantung pada seberapa tuntas penghapusannya |
| Kesetiaan pada kenyataan | Bergantung mutu aturan | Mengikuti bentuk data asli |
| Biaya penyiapan | Perlu menyusun aturan lebih dahulu | Perlu menilai risiko setiap kali dipakai |
| Kapan dipakai | Pengujian harian dan pengembangan | Peninjauan sebaran dan pengujian beban |
Bagaimana memilih untuk kebutuhan Anda?
Mulailah dari pertanyaan apa yang sebenarnya sedang diuji. Bila yang diuji adalah aturan, format, dan keputusan sistem, bentuk catatannya tidak perlu menyerupai kenyataan, sehingga data sintetis sudah cukup. Bila yang diuji adalah perilaku terhadap kenyataan, misalnya sebaran ukuran data atau pola penggunaan, Anda memerlukan bahan yang menyerupai sebaran asli dan mungkin perlu memakai data teranonimkan secara ketat.
Pertanyaan kedua adalah siapa yang akan melihat bahannya. Semakin luas kalangan yang memakainya, semakin besar manfaat memilih bahan yang tidak berasal dari catatan orang, karena tidak ada yang perlu dijaga kerahasiaannya. Sebaliknya, bila peninjauan hanya dilakukan oleh sekelompok kecil orang dengan keperluan yang jelas, membuka catatan teranonimkan secara terbatas bisa dibenarkan.
Pertanyaan ketiga adalah berapa lama bahannya akan dipakai. Bahan yang berasal dari catatan nyata menuntut pemeriksaan ulang secara berkala, sebab dasar pemakaian dan sebaran data dapat berubah. Bahan yang dihasilkan ulang dari aturan cukup diperbarui aturannya, dan seluruh hasilnya mengikuti tanpa perlu menilai ulang isinya.
Untuk pengembang: mencatat asal-usul bahan uji
Beri nama yang membedakan keduanya, jangan biarkan satu berkas memuat campuran yang tidak dijelaskan. Sebuah berkas sebaiknya jelas menyatakan apakah isinya dihasilkan atau berasal dari catatan nyata, dan bila berasal dari catatan nyata, catat dasar pemakaian serta siapa yang menyetujuinya.
Untuk bahan yang dihasilkan, simpan aturan dan kuncinya sebagai bagian dari kode, sehingga catatan yang sama dapat dihasilkan ulang kapan saja. Cara ini sejalan dengan penjelasan pada pengantar data identitas pengujian dan pada catatan tetap untuk pengujian, karena hasil yang dapat diulang jauh lebih mudah ditelusuri daripada hasil yang berubah setiap kali.
Untuk bahan yang berasal dari catatan nyata, pisahkan dari repositori kode dan simpan di tempat dengan akses terbatas. Sertakan catatan penilaian risiko dan tanggal peninjauan berikutnya, agar keberadaannya tidak berlanjut tanpa ada yang menilainya lagi. Penjelasan tentang kewajiban yang menyertai data pribadi, termasuk pembatasannya, ada pada pembahasan GDPR dan data uji.
Langkah berikutnya
Daftarkan semua bahan pengujian yang dipakai tim Anda, lalu tandai setiap bahan sebagai dihasilkan atau berasal dari catatan nyata. Untuk yang berasal dari catatan nyata, tetapkan tanggal peninjauan berikutnya; untuk yang dihasilkan, pastikan aturan dan kuncinya tersimpan sehingga hasilnya dapat dibuat ulang. Bila Anda memerlukan bahan baru yang konsisten antar bidang, generator data identitas menghasilkan catatan yang tidak mewakili siapa pun dan siap dipakai untuk pengujian sehari-hari.