Validasi model adalah proses terstruktur untuk menentukan apakah model machine learning (ML) cocok untuk penggunaan yang dimaksudkan.
Alih-alih hanya bertanya, “Apakah model menghasilkan jawaban?”, validasi model menanyakan apakah desain, asumsi, data, implementasi, output, keterbatasan, dan perilaku berkelanjutan model cukup andal untuk keputusan yang akan dibuat orang dengannya.
Validasi model memungkinkan bisnis untuk mengurangi risiko model—risiko bahwa model menghasilkan hasil yang tidak akurat, bias, tidak stabil, tidak aman, atau disalahgunakan—dengan secara proaktif menilai seberapa baik model melakukan tugasnya.
Untuk validasi sederhana, pengembang model hanya dapat mengevaluasi model kandidat terhadap kumpulan validasi—kumpulan contoh yang digunakan insinyur ML dan ilmuwan data untuk memeriksa seberapa baik model belajar—selama pengembangan.
Namun, pada tingkat manajemen risiko model, validasi model jauh lebih luas. Biasanya, validasi model perusahaan adalah penilaian independen dari seluruh siklus hidup model. Model ML ditinjau oleh orang yang tidak membuat model ini dan tinjauan mencakup bagaimana model dibangun, diluncurkan, digunakan, dipantau, diubah, dan akhirnya dihentikan penggunaannya.
Proses validasi yang sukses menetapkan lima hal.
Keketatan proses validasi model biasanya cocok dengan tujuan model. Alat perkiraan internal berdampak rendah tidak perlu diteliti sedalam model yang menyetujui hipotek atau mendeteksi penipuan dalam transaksi perbankan.
Yang terpenting, validasi model bukanlah tindakan persetujuan satu kali. Meski awalnya berkinerja baik, model dapat menyimpang dan menurun setelah rilis, sehingga validasi model ML yang berkelanjutan sering dimasukkan ke dalam praktik tata kelola kecerdasan buatan (AI) perusahaan.
Menurut Kerangka Kerja Manajemen Risiko AI NIST, pilar kepercayaan model meliputi validitas dan keandalan, keselamatan, keamanan dan ketahanan, akuntabilitas dan transparansi, kemampuan menjelaskan dan menafsirkan, peningkatan privasi serta manajemen keadilan dan bias.
Validasi model machine learning membantu membangun dan mempertahankan kepercayaan model (tingkat kepercayaan yang dibenarkan bahwa model akan berperilaku dengan tepat). Bisnis membuat keputusan berdasarkan output model ML, sehingga kepercayaan model bukan hanya tujuan untuk menjaga reputasi. Ini adalah dasar untuk penggunaan AI yang aman, efektif, dan dapat diskalakan. Faktanya, tujuan kepercayaan model sering menunjukkan praktik validasi model.
Selain itu, model AI tidak dapat dianggap dapat dipercaya hanya karena pengembangnya menyebutnya “AI yang bertanggung jawab.” Model AI harus dapat melakukan tugas mereka dengan andal, melindungi orang dan data, tahan penyalahgunaan, serta dapat dipahami dan diatur. Tingkat kepercayaan itu harus diperoleh melalui kontrol yang dapat dibuktikan dan pengumpulan bukti yang terus-menerus selama validasi model AI.
Cara yang diadopsi secara luas untuk memahami pilar kepercayaan model adalah Kerangka Kerja Manajemen Risiko AI Institut Standar dan Teknologi Nasional (NIST). Kerangka kerja ini mengidentifikasi tujuh karakteristik yang saling bergantung dari AI yang dapat dipercaya.
Model yang dapat dipercaya harus valid untuk tugasnya dan dapat diandalkan dari waktu ke waktu, di seluruh kondisi yang diperkirakan. Validitas menanyakan apakah model benar-benar mengukur, memprediksi, mengklasifikasikan, atau menghasilkan apa yang diklaimnya.
Keandalan menanyakan apakah model bekerja secara konsisten dan dapat diandalkan ketika diberikan input yang sebanding, termasuk input dari pengguna, lingkungan, sumber data, dan periode waktu yang berbeda.
Pilar keselamatan berfokus pada apakah model dapat menyebabkan kerusakan pada orang, properti, organisasi, atau masyarakat—bahkan ketika secara teknis berfungsi sesuai rancangannya.
Sebuah model bisa jadi akurat dan tidak aman. Sebagai contoh, chatbot layanan pelanggan mungkin dapat mengambil informasi akun dengan benar, tetapi jika dapat dimanipulasi untuk mengekspos data sensitif, alat ini tetap tidak aman untuk penerapan. Keselamatan mengharuskan tim untuk mengidentifikasi bahaya yang dapat diperkirakan sebelum penerapan dan mengatasinya secara proaktif melalui desain sistem.
Keamanan melindungi model, data, antarmuka, dan aplikasi di sekitarnya dari akses atau manipulasi berbahaya. Untuk sistem AI modern, permukaan serangan meluas melampaui bobot model. Permukaan serangan juga mencakup data pelatihan, sumber pengambilan, prompt, antarmuka pemrograman aplikasi (API), plug-in, identitas pengguna, infrastruktur penerapan, log, dan rantai pasokan model. Kontrol keamanan harus mampu mengelola seluruh permukaan serangan.
Ketahanan mengacu pada kemampuan model untuk terus berjalan dengan aman, pulih dengan benar, atau dapat mempertahankan fungsi dasar jika terjadi kesalahan. Ini berarti memvalidasi bahwa model dapat menangani gangguan tidak berbahaya serta serangan siber. Di lingkungan berdampak tinggi, kegagalan aman sering kali lebih penting daripada hanya tetap tersedia.
Akuntabilitas berarti bahwa pemilik yang disebutkan bertanggung jawab atas desain, penerapan, hasil, dan remediasi model. Tanpa akuntabilitas, bisnis dapat mengatakan “itu keputusan AI” ketika terjadi kesalahan.
Transparansi berarti bahwa semua informasi yang relevan tentang sistem, output, keterbatasan, dan tata kelola tersedia bagi orang yang membutuhkannya. Transparansi tidak mengharuskan bisnis untuk mengungkapkan kode sumber eksklusif atau detail keamanan sensitif. Ini berarti mengungkapkan informasi yang cukup akurat dan dapat digunakan bagi para pemangku kepentingan untuk memahami seluruh cakupan sistem.
Kemampuan menjelaskan dan menafsirkan membantu orang memahami bagaimana model bekerja dan apa arti output dalam konteks keputusan nyata. Dalam bahasa sederhana, kemampuan menjelaskan bertanya, “Faktor atau proses apa yang menyebabkan output ini?” sedangkan kemampuan menafsirkan bertanya, “Apa arti output ini dan bagaimana seharusnya seseorang menggunakannya?”
Pilar ini paling penting ketika keputusan bersifat konsekuensial, diperdebatkan, diatur, atau sulit untuk dibalik (misalnya pemodelan risiko kredit).
Privasi terkait erat dengan keamanan, tetapi konsepnya berbeda. Keamanan mencegah pihak yang tidak berwenang mengakses data, sementara privasi membantu memastikan bahwa data dikumpulkan, digunakan, disimpan, dan dibagikan dengan tepat.
Model dapat menciptakan risiko privasi bahkan ketika mereka tidak dirancang secara eksplisit untuk memproses data pribadi. Kumpulan pelatihan model mungkin berisi informasi sensitif, dan log mungkin menyimpan data pengguna yang hanya dimaksudkan untuk disimpan sementara. Praktik validasi model membantu bisnis memastikan bahwa alat AI aman dan mematuhi aturan privasi.
Keadilan membutuhkan organisasi untuk mengidentifikasi, mengukur, mengurangi, dan memantau bias berbahaya. Ini tidak berarti bahwa setiap orang harus selalu menerima output yang sama. Sebaliknya, perbedaan dalam perlakuan atau hasil harus dibenarkan, sah, relevan dengan tugas, dan tidak didorong oleh bias yang dapat dihindari atau berbahaya.
Dapatkan kurasi insight tentang berita AI yang paling penting dan menarik. Berlangganan buletin Think mingguan. Lihat Pernyataan Privasi IBM.
Validasi model biasanya mencakup berbagai pemeriksaan dan teknik validasi yang berbeda.
Kesesuaian konseptual menilai logika dan desain yang mendasari model. Pilar ini mengevaluasi apakah metodologi, input, asumsi, penilaian kualitatif, dan pilihan desain sesuai untuk keputusan yang dimaksudkan untuk didukung model. Pemeriksaan kesesuaian meliputi:
Validasi data membantu tim menentukan apakah data yang digunakan untuk membangun, tuning, menguji, dan menjalankan model dapat dipercaya. Validasi data meliputi:
Analisis hasil memenuhi dua tujuan utama. Pertama, analisis menentukan apakah output model sesuai dengan kondisi dunia nyata yang diklaim diprediksinya. Kedua, analisis menanyakan apakah menggunakan output benar-benar membantu bisnis mencapai tujuan yang dimaksudkan tanpa menciptakan kerugian, biaya, atau risiko yang tidak dapat diterima. Analisis hasil mungkin mengharuskan tim untuk:
Memvalidasi ketangguhan dan sensitivitas model membantu memastikan bahwa model terus berperilaku andal ketika kondisinya tidak sempurna, abnormal, atau sengaja dibuat agresif.
Sensitivitas bukanlah sesuatu yang pada dasarnya buruk. Beberapa input harus sangat memengaruhi output model. Perubahan terbaru pada akun istimewa, misalnya, secara wajar mengubah skor risiko keamanan siber akun tersebut. Masalahnya adalah sensitivitas yang tidak dapat dibenarkan, di mana perubahan kecil, tidak relevan, atau rutin berdampak sangat besar pada perilaku model.
Tim dapat menguji model dengan:
Pembandingan dan pengujian tantangan menilai apakah suatu model benar-benar menambah nilai dengan membandingkannya dengan alternatif yang kredibel. Organisasi menggunakan semua praktik ini untuk memahami apakah suatu model berkinerja jauh lebih baik daripada metode yang lebih sederhana, model sebelumnya, proses manusia, atau model penantang yang dikembangkan secara independen (model yang dibangun atau dipilih secara khusus untuk memvalidasi perilaku model kandidat).
Pemeriksaan keselamatan, keamanan, dan privasi mengevaluasi berbagai risiko yang dapat dibuat model, tetapi banyak kelemahan terdapat dalam integrasi di seputar model ML, bukan pada model itu sendiri.
Model mungkin memiliki kebijakan internal yang kuat terhadap pengungkapan informasi rahasia, misalnya, tetapi aplikasi masih dapat mengekspos dokumen pribadi jika sistem pengambilannya gagal memberlakukan izin dokumen. Demikian pula, model mungkin tahan terhadap jailbreak dasar, tetapi agen yang dibangun di sekitarnya masih dapat mengambil tindakan yang tidak aman karena halaman web yang diambil berisi injeksi prompt tidak langsung.
Oleh karena itu, validasi yang efektif mengharuskan tim untuk menilai model dan seluruh ekosistem di sekitarnya.
Dokumentasi dan reprodusibilitas menjadikan validasi sebagai kumpulan bukti yang dapat diaudit, bukan klaim informal bahwa sebuah model “berfungsi.”
Dokumentasi mengikuti seluruh siklus proses model ML, dari kasus bisnis awal hingga pengembangan, validasi, penerapan, pemantauan, perubahan material, dan terakhir penghentian penggunaan. Ini termasuk mencatat garis keturunan model dan mempertahankan kontrol versi yang jelas, sehingga peninjau dapat memahami bagaimana model berubah dari waktu ke waktu.
Reprodusibilitas membantu memastikan bahwa peninjau independen yang memenuhi syarat dapat menggunakan materi yang didokumentasikan untuk mengulangi pengembangan model atau proses validasi dan mendapatkan hasil yang lebih kurang sama.
Validasi model, pengujian model, dan pemantauan model adalah praktik penjaminan kualitas terkait, tetapi mereka menjawab pertanyaan yang berbeda pada titik yang berbeda dalam siklus proses model machine learning:
Pengujian model terjadi selama proses pengembangan, tetapi evaluasi formal dengan kumpulan pengujian biasanya terjadi setelah tim menyelesaikan pilihan desain utama dan keputusan penyetelan. Pengujian sering dilakukan oleh seseorang yang tidak terlibat dalam keputusan pengembangan model. Dalam kasus teknik train_test_split, pengujian juga menggunakan kumpulan data pengujian terpisah yang tidak digunakan untuk pelatihan, penyetelan hyperparameter, pemilihan ambang batas atau pemilihan model untuk mendapatkan perkiraan yang kredibel dan tidak bias tentang bagaimana model akhir akan berkinerja pada data yang benar-benar tidak terlihat.
Bisnis dapat memilih berbagai pendekatan evaluasi model.
Kumpulan data yang dipisahkan, misalnya, memisahkan sebagian data dari data pelatihan dan pengembangan model, kemudian menggunakan data yang dipisahkan tersebut untuk mengevaluasi seberapa baik kinerja model akhir pada kasus yang belum pernah dilihat sebelumnya. Tim dapat menggunakan validasi silang k-fold, di mana model dilatih dan diuji pada bagian data yang berbeda k kali, kemudian merata-ratakan hasilnya. Atau, untuk bentuk validasi silang k-fold yang lebih ketat, tim mungkin melakukan validasi silang leave-one-out (LOOCV), di mana model diuji pada setiap titik data secara bersamaan. Terlepas dari metodenya, pengujian model bertujuan untuk memprediksi kualitas dunia nyata dari model ML sebelum diterapkan.
Sementara pengujian berfokus pada penilaian kualitas, pemantauan model berfokus untuk memastikan bahwa model terlatih dan ekosistem di sekitarnya berperilaku sesuai harapan setelah penerapan. Pemantauan—yang dapat diimplementasikan secara terus menerus atau pada jadwal yang telah ditentukan—mengamati input, output, dan perilaku operasional model langsung sehingga tim manajemen risiko dapat mendeteksi perubahan sebelum menjadi regresi penuh, atau lebih buruk lagi, kegagalan.
Pemantauan memberi bisnis sistem peringatan dini untuk perilaku model yang bermasalah, tetapi tidak menggantikan validasi. Validasi model adalah proses evaluasi berulang yang biasanya dilakukan saat tim pengembangan membangun model, tetapi tim juga dapat memvalidasi model sebagai proses independen sebelum persetujuan dan secara berkala sesudahnya.
Meskipun validasi, pengujian, dan pemantauan adalah proses yang terpisah, bisnis umumnya membutuhkan ketiganya untuk mengoptimalkan kinerja dan keandalan model ML sepanjang masa pakainya.
AI generatif (gen AI) dan agen AI memerlukan praktik validasi inti yang sama dengan sistem ML lainnya. Namun, alat ini dapat menciptakan risiko yang tidak dapat sepenuhnya diperhitungkan oleh validasi model prediktif. Sistem Gen AI menghasilkan output terbuka dan agen dapat menggunakan output tersebut untuk merencanakan dan melakukan tindakan dalam sistem yang saling berhubungan.
Dengan ML standar, hasil model sering dapat dievaluasi langsung terhadap label kebenaran dasar. Jika model penipuan memprediksi “penipuan” untuk sebuah transaksi dan penyelidikan selanjutnya mengonfirmasi penipuan, berarti prediksi itu benar. Jika model perkiraan permintaan memprediksi 1.150 unit dan permintaan aktual adalah 1.600, tim dapat menggunakan kesalahan kuadrat rata-rata—metrik regresi yang menilai seberapa dekat prediksi model dengan nilai aktual—untuk mengukur perbedaan secara tepat.
Output Gen AI umumnya tidak memiliki satu kata pun yang benar dan mungkin tidak memiliki satu “jawaban tepat” yang lengkap. Beberapa tugas terbatas (ekstraksi terstruktur, pemilihan alat) masih dapat dievaluasi terhadap output eksplisit yang diharapkan. Tetapi secara umum, perilaku model sangat bergantung pada konteks waktu proses yang dapat berubah di antara interaksi. Gen AI juga bisa berhalusinasi, dengan percaya diri menyajikan informasi yang salah atau mengandung kesalahan sebagai respons terhadap sebuah prompt.
Oleh karena itu, validasi gen AI mengharuskan tim untuk menggunakan kumpulan evaluasi yang berisi prompt realistis, bahan sumber yang disetujui, elemen jawaban yang diharapkan, dan rubrik penilaian. Rubrik memungkinkan model untuk menghasilkan berbagai respons yang dapat diterima sekaligus mengharuskan setiap respons untuk berisi fakta tertentu, menghindari pernyataan yang tidak didukung dan mengungkapkan ketidakpastian, jika ada.
Agen AI dapat membentuk rencana, memberikan akses, memodifikasi catatan, mengirim pesan, dan meluncurkan alur kerja yang sama sekali baru (dengan agen baru). Dengan demikian, agen AI memerlukan semua pemeriksaan yang berfokus pada output yang sama seperti AI generatif, tetapi mereka juga mengharuskan pengembang untuk memvalidasi keputusan dan tindakan sebagai konsekuensi dari output. Setiap perubahan materi—misalnya, perubahan pada model fondasi atau koneksi repositori pengambilan baru—harus memicu validasi ulang.
Atur model AI generatif dari mana saja dan terapkan di cloud atau on premises dengan IBM® watsonx.governance.
Lihat bagaimana tata kelola AI dapat membantu meningkatkan kepercayaan karyawan Anda terhadap AI, mempercepat adopsi dan inovasi, serta meningkatkan kepercayaan pelanggan.
Persiapkan Undang-Undang AI UE dan membangun pendekatan tata kelola AI yang bertanggung jawab dengan bantuan IBM® Consulting.