Keandalan jawaban sebuah AI agent sangat bergantung pada kualitas dan keamanan data dasar (ground truth) yang diberikan kepadanya. Fenomena Garbage In, Garbage Out sangat berlaku dalam adopsi Large Language Model (LLM). Kerap kali, kendala utama dalam adopsi AI di perusahaan bukan terletak pada pemilihan model, melainkan pada kesiapan dan sanitasi data internal.
Tanpa audit kesiapan data yang terstruktur, perusahaan berisiko memaparkan informasi sensitif (PII/PHI), memberikan jawaban berbasis dokumen usang, atau memicu kebocoran data rahasia ke publik. Artikel ini memberikan kerangka audit data sebelum AI dihubungkan ke repositori dokumen perusahaan.
Matriks Kategorisasi Data Internal
Sebelum melakukan indexing data ke Vector Store atau RAG (Retrieval-Augmented Generation), kelompokkan seluruh aset dokumen perusahaan ke dalam empat tingkatan privasi:
- Publik (Tier 1): Katalog produk publik, brosur pemasaran, artikel blog, dan dokumentasi API publik. Akses AI: Bebas digunakan tanpa pembatasan.
- Internal Bisnis (Tier 2): SOP operasional, pedoman karyawan, template proposal, dan basis pengetahuan layanan pelanggan. Akses AI: Terbatas untuk penggunaan internal staf.
- Rahasia / Terbatas (Tier 3): Laporan keuangan belum diaudit, strategi harga B2B, klausul kontrak klien, dan data kinerja individu. Akses AI: Wajib menggunakan kontrol akses berbasis peran (RBAC).
- Sangat Terlarang (Tier 4): Kata sandi, kunci enkripsi, nomor identitas pribadi (NIK/KTP), data kartu kredit, dan rekam medis. Akses AI: Dilarang keras dimasukkan ke dalam pipeline data AI.
Langkah Audit & Sanitasi Data (Data Redaction Pipeline)
Untuk memastikan data siap diproses oleh LLM secara aman, terapkan empat langkah pembersihan data berikut:
1. Pembersihan Dokumen Usang (Stale Document Scrubbing)
Hapus atau arsipkan versi dokumen yang sudah tidak berlaku (misalnya pricelist tahun lalu atau SOP lama) dari indeks RAG agar AI tidak memberikan informasi kontradiktif.
2. Anonomisasi Data Pribadi (PII Masking)
Gunakan modul deteksi pola (seperti Regex atau model Named Entity Recognition) untuk menyamarkan nomor telepon, email pribadi, dan NIK sebelum teks dikirimkan ke provider LLM eksternal.
3. Pembagian Dokumen Berbasis Granularitas (Chunking Strategy)
Potong dokumen panjang menjadi segmen (chunk) berukuran 500–1000 token dengan overlap yang memadai. Pastikan metadata (seperti nomor halaman, versi dokumen, dan tanggal pembaruan) melekat pada setiap chunk.
4. Penerapan Hak Akses Berbasis Pengguna (Contextual Access Control)
Saat pengguna mengajukan pertanyaan kepada AI agent, AI hanya boleh melakukan pencarian vektor pada chunk dokumen yang hak aksesnya dimiliki oleh pengguna tersebut secara eksplisit.
Menyelaraskan Tata Kelola Data dengan Standar Keamanan
Penerapan audit data ini sejalan dengan prinsip tata kelola AI internasional seperti NIST AI Risk Management Framework dan kerangka kerja OWASP Top 10 for LLM Applications. Dengan membangun sanitasi data yang disiplin sejak awal, perusahaan dapat menikmati efisiensi AI tanpa mengorbankan keamanan aset digital.
Diskusi lebih lanjut mengenai arsitektur keamanan AI dan konsultasi tata kelola data perusahaan dapat dimulai bersama tim ahli kami melalui halaman kontak.