GDPR dan data uji sering dianggap dua hal yang tidak bertemu, seolah aturan perlindungan data hanya berlaku untuk sistem yang melayani pengguna sungguhan. Anggapan itu keliru, dan akibatnya cukup mahal. Nama, nomor dokumen, tanggal lahir, alamat, dan nomor telepon tetap merupakan data pribadi di lingkungan pengujian, di komputer pengembang, maupun di berkas cadangan yang sudah lama terlupakan. Tulisan ini menjelaskan mengapa hal itu penting dan bagaimana menyiapkan pengujian tanpa memikul risiko yang tidak perlu.
Apakah data di lingkungan pengujian juga diatur?
Ya. Aturan perlindungan data pada umumnya tidak membedakan antara lingkungan produksi dan lingkungan pengujian; yang menjadi ukuran adalah apakah datanya menunjuk atau dapat menunjuk pada orang tertentu. Salinan basis data produksi yang dipakai untuk pengujian berisi data yang sama, sehingga perlakuannya pun sama.
Masalahnya, lingkungan pengujian biasanya jauh lebih longgar. Kata sandi dibagi lewat obrolan, akses diberikan kepada seluruh tim tanpa pembatasan, cadangan disimpan di laptop pribadi, dan tangkapan layar berisi data asli beredar untuk keperluan laporan kutu. Setiap kelemahan itu memperbesar kemungkinan data pribadi terlihat oleh orang yang tidak seharusnya.
Mengapa tidak menyalin basis data produksi saja?
Karena salinan itu membawa seluruh isi, bukan hanya kolom yang Anda butuhkan. Kalimat yang sering diucapkan, “hanya untuk pengujian, jadi tidak apa-apa”, mengabaikan dua hal. Pertama, orang yang datanya tersalin tidak pernah menyetujui pemakaian tersebut. Kedua, begitu data berada di lingkungan yang lebih longgar, Anda tidak lagi mengendalikan siapa yang melihatnya.
Alasan praktis lain adalah kedaluwarsa. Data asli menjadi basi karena orang pindah rumah, berganti nomor, dan menutup akun. Data yang basi membuat pengujian gagal karena sebab yang tidak ada hubungannya dengan kode, lalu menghabiskan waktu tim untuk menelusuri masalah yang tidak ada.
Bagaimana salinan seperti itu biasanya menyebar? Bayangkan seorang pengembang perlu memperbaiki kutu yang hanya muncul pada data dengan nama pendek berkarakter khusus. Cara tercepat, menurut kebiasaan lama, adalah menyalin sebagian tabel ke lingkungan pengujian. Salinan itu lalu dipakai untuk membuktikan perbaikannya, lalu dilampirkan ke laporan, lalu ikut tersimpan di folder cadangan malam itu. Dalam satu hari, data pribadi sudah berada di tiga tempat dengan tingkat pengamanan yang berbeda, dan tidak seorang pun merasa telah melakukan sesuatu yang besar.
Pola itu menjelaskan mengapa kebijakan yang hanya mengatur basis data utama tidak cukup. Yang perlu ditutup adalah jalur perpindahannya, bukan hanya wadah penyimpanannya. Bila tidak ada jalur otomatis dari produksi ke lingkungan lain, perpindahan seperti itu memerlukan langkah manual yang disadari dan lebih mudah dipertanggungjawabkan. Bila kebutuhan pengujian dapat dipenuhi oleh alat penghasil data, tidak akan ada alasan untuk menempuh langkah manual tersebut.
Anonimisasi dan pseudonimisasi: apa bedanya?
Dua istilah ini sering dipakai bergantian, padahal akibatnya berbeda jauh. Menyamakan keduanya adalah kesalahan yang paling berbahaya dalam pembahasan data uji.
| Pendekatan | Asalnya | Sifat hasil | Perlakuan aturan |
|---|---|---|---|
| Anonimisasi | Data asli, lalu dihilangkan keterkaitannya | Tidak dapat dikembalikan kepada orangnya | Di luar jangkauan aturan data pribadi bila benar-benar tuntas |
| Pseudonimisasi | Data asli, lalu penanda diganti | Masih dapat dikembalikan, karena ada kunci | Tetap diperlakukan sebagai data pribadi |
| Penyamaran | Data asli, sebagian kolom ditutup | Sebagian masih dapat dikembalikan | Tergantung kasus, sering tetap data pribadi |
| Data sintetis | Dibuat algoritma, bukan dari catatan asli | Tidak ada orang asal sama sekali | Bukan data pribadi |
Baris terakhir adalah alasan data sintetis dipakai untuk pengujian. Karena tidak ada catatan asli yang menjadi asalnya, tidak ada orang yang datanya perlu dilindungi. Ini bukan berarti bebas dari segala kewajiban, tetapi bebannya jauh lebih ringan daripada menyalin data produksi.
Apakah menghapus nama sudah cukup untuk membuat data aman?
Belum, dan inilah inti persoalannya. Nama biasanya bukan satu-satunya penunjuk identitas. Gabungan beberapa bidang seperti kode pos, tanggal lahir, jenis kelamin, dan pekerjaan sering sudah cukup untuk mempersempit kemungkinan sampai pada satu orang, terutama di wilayah yang penduduknya tidak padat. Penghapusan nama justru bisa memberi rasa aman yang tidak berdasar.
Selain kolom yang jelas, ada tempat lain yang sering terlupakan: catatan sistem berisi alamat surat elektronik, riwayat perubahan berisi nilai sebelum diperbaiki, berkas ekspor yang tertinggal di folder unduhan, dan lampiran pada laporan kutu. Membatasi pengumpulan sejak awal jauh lebih efektif daripada membersihkan data yang sudah tersebar.
Data yang kami hasilkan hanya untuk pengujian dan tidak boleh dipakai untuk menyamar sebagai orang lain. Tidak ada catatan yang berasal dari orang nyata, dan tidak ada yang dirancang untuk lolos verifikasi identitas, verifikasi usia, atau pembukaan akun sungguhan.
Apa saja yang boleh keluar dari produksi?
Pertanyaan ini lebih berguna daripada pertanyaan apakah boleh menyalin data, karena jawabannya berbeda untuk setiap jenis nilai. Ada nilai yang tidak pernah perlu keluar dari produksi, ada yang boleh keluar setelah diubah, dan ada yang boleh keluar apa adanya. Membedakan ketiganya membuat kebijakan jauh lebih mudah dipatuhi daripada larangan menyeluruh yang akhirnya dilanggar diam-diam.
| Jenis nilai | Boleh keluar dari produksi? | Alasan |
|---|---|---|
| Kata sandi dan kunci akses | Tidak pernah, dalam bentuk apa pun | Tidak ada gunanya untuk pengujian dan risikonya langsung |
| Nama, surel, nomor telepon | Tidak, ganti dengan data sintetis | Menunjuk langsung pada orang tertentu |
| Nomor dokumen dan tanggal lahir | Tidak, kecuali panjang dan bentuknya saja | Kombinasi keduanya mudah mempersempit orang |
| Kode negara, mata uang, daftar wilayah | Boleh apa adanya | Bukan data pribadi siapa pun |
| Struktur tabel dan nama kolom | Boleh apa adanya | Tidak berisi nilai orang |
Baris terakhir sering diabaikan, padahal justru paling menolong. Yang biasanya dibutuhkan tim pengujian bukan isinya, melainkan bentuknya: kolom mana yang ada, sepanjang apa, dan bagaimana hubungan antartabel. Sebagian besar kebutuhan itu dapat dipenuhi tanpa membawa satu pun nilai pribadi.
Berapa lama data uji boleh disimpan?
Prinsip penyimpanan terbatas menuntut agar data tidak disimpan lebih lama daripada yang diperlukan untuk tujuannya. Untuk keperluan pengujian, umur simpan yang wajar biasanya sesingkat mungkin: berkas sementara dihapus setelah pengujian selesai, dan basis data pratinjau disegarkan ulang secara berkala dari alat penghasil, bukan diperlihara bertahun-tahun.
Yang paling sering bocor justru berkas cadangan. Basis data pengujian yang dibersihkan setiap bulan tetap menyisakan data lama di dalam cadangannya, dan cadangan biasanya jauh lebih longgar pengamanannya. Tentukan kebijakan untuk salinan cadangan sekaligus, bukan hanya untuk basis datanya.
Untuk pengembang: pemisahan yang bisa diperiksa
Pisahkan lingkungan sejak awal dan buat pemisahan itu dapat diperiksa, bukan hanya dijanjikan. Batasi akses ke data pratinjau sesuai kebutuhan, catat siapa yang menyegarkan isinya, dan pastikan tidak ada jalur otomatis yang menyalin data dari produksi ke lingkungan lain tanpa pemeriksaan.
Perlakukan catatan sistem dan tangkapan layar sebagai tempat data pribadi. Sebelum mengirim laporan kutu, periksa apakah ada nama, surel, atau nomor telepon yang ikut terlihat. Bila data yang dipakai berasal dari alat penghasil, tidak akan ada yang perlu dihapus.
Untuk urusan hukum yang menyangkut kebijakan situs ini sendiri, halaman kebijakan privasi adalah rujukan yang tepat. Bahasan tentang cara memilih antara data sintetis dan data yang hanya disamarkan ada pada perbandingan data sintetis dan data teranonimkan.
Langkah berikutnya
Periksa dari mana data di lingkungan pengujian Anda berasal. Bila ada satu saja proses yang menyalin data produksi, ganti sumbernya dengan generator data identitas yang menghasilkan catatan sintetis, lalu hapus salinan lama yang masih tersimpan di luar basis data. Teks resmi peraturan perlindungan data Eropa tersedia di EUR-Lex.