Menguji fitur AI sebelum digunakan pelanggan
Tentukan kriteria kualitas, keamanan, akses, biaya, dan kegagalan fitur AI. Uji skenario nyata, catat hasil, serta siapkan penghentian dan pemeriksaan ulang saat berubah.
Di halaman ini
Tentukan keputusan yang akan dibuat dari hasil uji
Evaluasi fitur AI dimulai dari pekerjaan yang akan dibantu, orang yang terdampak, dan akibat jika hasilnya salah. Ringkasan dokumen internal berbeda risikonya dari fitur yang mengubah transaksi atau memberi informasi kepada pelanggan.
Tuliskan apa yang boleh dilakukan, apa yang dilarang, kapan hasil perlu diperiksa manusia, dan bagaimana fitur dihentikan. Jangan hanya mengukur apakah jawabannya terdengar lancar.
Susun kasus uji yang mewakili risiko
| Kelompok | Contoh yang perlu dicoba |
|---|---|
| Kualitas | Pertanyaan biasa, informasi tidak tersedia, konteks ambigu, dan rujukan yang keliru |
| Data dan akses | Pengguna meminta dokumen organisasi lain atau informasi di luar haknya |
| Instruksi berbahaya | Dokumen sumber mencoba mengubah aturan atau meminta pengiriman data |
| Tindakan | Agen mencoba mengirim, mengubah, atau menghapus tanpa persetujuan yang sesuai |
| Operasi | Batas waktu, biaya, kegagalan alat, pengulangan, dan pemulihan |
Gunakan data uji yang aman dan dapat dipertanggungjawabkan. Pisahkan kasus yang dipakai memperbaiki fitur dari kasus penilaian agar hasil tidak sekadar mencerminkan hafalan contoh. Tentukan siapa menilai dan bagaimana perbedaan penilaian diselesaikan.
Jangan menyembunyikan kesalahan di dalam rata-rata
Catat hasil per kelompok dan tingkat dampak. Seratus jawaban biasa yang benar tidak menghapus satu kegagalan yang membuka data pelanggan lain. Tentukan kegagalan yang menghentikan rilis dan masalah yang masih dapat ditangani dengan pembatasan yang nyata.
Contoh fiktif: asisten dukungan menjawab sebagian besar pertanyaan dengan baik, tetapi menampilkan tiket dari organisasi lain ketika diminta merangkum riwayat. Rilis ditahan; tim memperbaiki pemeriksaan akses pada pengambilan data lalu menguji ulang. Menambah larangan dalam prompt saja tidak cukup.
Simpan konfigurasi bersama hasil
Catat versi model yang diketahui, instruksi sistem, sumber pencarian, izin alat, parameter penting, dataset, penilai, dan waktu uji. Bila layanan tidak membuka versi model, tulis batas keterulangan tersebut. Gunakan inventaris AI.
Sesudah rilis
Siapkan pemantauan, umpan balik, pembatasan, dan penghentian yang dapat dijalankan petugas. Uji ulang saat model, sumber data, alat, atau hak tindakan berubah. Periksa kebutuhan DPIA serta aturan sektor untuk keputusan berisiko tinggi.
Lanjutkan ke keamanan fitur AI. Rujukan NIST/OWASP adalah panduan pengelolaan risiko, bukan pengesahan hukum atau jaminan semua jawaban benar.
Sumber rujukan
- NIST AI 100-1: AI Risk Management Framework 1.0 (2023) ↗NIST; kerangka pengelolaan risiko sukarela · Measure dan Manage: evaluasi kontekstual, keterbatasan dan pemantauan.
- AI Agent Security Cheat Sheet ↗OWASP Foundation; panduan teknis · Batas izin, persetujuan tindakan, observabilitas dan kegagalan agen.
- RAG Security Cheat Sheet ↗OWASP Foundation; panduan teknis · Batas akses sumber, kontaminasi dan pengujian pipeline RAG.
Baca naskah lengkap untuk melihat syarat dan pengecualiannya. Sesuaikan dengan layanan dan bidang usaha Anda.
Perlu membahas kebutuhan tim Anda?
Ceritakan penggunaan AI di tim Anda dan hal yang ingin dipersiapkan.
Konsultasikan kebutuhan Anda