Ilustrasi digital tampilan samping seorang wanita memegang iPad dengan ikon dasbor di depan dan belakangnya

Memperkenalkan VAKRA: Tolok ukur untuk mengevaluasi kemampuan panggilan alat multi-hop dan multi-sumber di Agen AI

Jelajahi bagaimana VAKRA dapat mengevaluasi perilaku agen menyeluruh, di mana tugas multi-langkah mencakup beragam sumber data dan memerlukan kepatuhan terhadap pedoman penggunaan alat.

Vakra—API eValuating dan Agen Pengambilan Pengetahuan menggunakan dialog multi-hop dan multi-sumber—adalah tolok ukur yang dapat dieksekusi berbasis alat yang dirancang untuk mengevaluasi seberapa baik agen AI bernalar secara menyeluruh dalam pengaturan seperti perusahaan. 

Alih-alih menguji keterampilan yang terisolasi, VAKRA mengukur penalaran komposisi di seluruh API dan dokumen, menggunakan jejak eksekusi penuh untuk menilai apakah agen dapat menyelesaikan alur kerja multi-langkah dengan andal, bukan hanya langkah individu.

VAKRA menyediakan lingkungan yang dapat dieksekusi di mana agen berinteraksi dengan lebih dari 8.000 API yang dihosting secara lokal yang didukung oleh basis data nyata yang mencakup 62 domain, bersama dengan koleksi dokumen yang selaras dengan domain. Tugas dapat memerlukan rantai penalaran 3-7 langkah yang menggabungkan interaksi API terstruktur dengan pengambilan tidak terstruktur di bawah batasan penggunaan alat bahasa alami.

  • Alat yang dihosting secara lokal dan didukung basis data memastikan respons yang deterministik dan dapat diverifikasi pada saat evaluasi.
  • Pengambilan dokumen disediakan via indeks khusus domain, memungkinkan grounding dan ekstraksi lintas sumber.
  • Verifikasi tingkat lintasan putar ulang jejak agen penuh terhadap alat langsung, mendukung beberapa jalur eksekusi yang valid—penting untuk alur kerja.

Penalaran multi-hop, multi-sumber penting

Lingkungan Enterprise tidak menyerupai panggilan fungsi T&J satu putaran atau satu kali. Alur kerja di bidang-bidang seperti dukungan pelanggan, intelijen bisnis, dan kepatuhan mengharuskan agen untuk merangkai keputusan, merekonsiliasi skema yang tidak cocok, dan mengikuti kebijakan penggunaan alat yang dinyatakan dalam bahasa alami. Kegagalan muncul tidak hanya selama pemanggilan alat, tetapi juga dalam penalaran yang dimediasi bahasa antara alat—termasuk disambiguasi entitas, landasan lintas sumber dan penyelarasan parameter atau skema.

Pertimbangkan keluhan pesanan yang tertunda dalam operasi e-commerce. Untuk mengatasinya, agen harus menghubungkan informasi dengan benar di seluruh sistem—menghubungkan catatan pelanggan, menafsirkan dokumentasi operator, menyelaraskan pengidentifikasi di seluruh API logistik, dan menerapkan kebijakan yang dinyatakan dalam bahasa alami. Setiap keputusan bergantung pada keputusan sebelumnya, membutuhkan penalaran berkelanjutan di seluruh alat, sumber data, dan kendala.

VAKRA dirancang untuk muncul dengan tepat di mana penalaran multi-langkah tersebut berhasil atau rusak, mencerminkan realitas yang dihadapi agen di lingkungan produksi.

Contoh penggunaan: Tiga pengaturan yang semakin kompleks

Terinspirasi oleh skenario seperti contoh keluhan pesanan tertunda dari sebelumnya, VAKRA mengatur tugas menjadi tiga tingkatan:

  1. Beragam gaya interaksi API: Agen harus mampu beradaptasi dengan berbagai abstraksi antarmuka, mulai dari API bergaya business intelligence yang menyediakan fungsi komposisional atau diperluas—yang memerlukan perencanaan dan pemilihan tool secara cermat—hingga titik akhir yang selaras dengan query yang mengenkapsulasi komputasi, namun tetap membutuhkan interpretasi query yang akurat dan parameterisasi yang tepat.
  2. Penalaran multi-hop di atas API terstruktur: Tugas memerlukan 3—7 panggilan API dependen, di mana output dari langkah-langkah sebelumnya harus ditafsirkan, diubah, dan digunakan kembali dengan benar untuk membuat parameter tindakan berikutnya.
  3. Penalaran multi-hop, multi-sumber dengan kebijakan penggunaan alat: Tugas memerlukan penalaran multi-hop di seluruh dokumen tidak terstruktur dan API terstruktur, di mana agen harus memutuskan kapan harus mengambil, bagaimana memasukkan informasi yang diambil ke dalam panggilan alat hilir, dan mematuhi kebijakan penggunaan alat bahasa alami.

Dibangun untuk evaluasi yang dapat dieksekusi dan diverifikasi

VAKRA berjalan di lingkungan yang di-hosting sendiri: API yang didukung oleh database persisten dan indeks pengambilan diekspos melalui antarmuka standar, dan agen hanya dapat berinteraksi melalui alat ini. Evaluasi putar ulang seluruh lintasan untuk memverifikasi setiap langkah perantara—bukan hanya jawaban akhir—sehingga Anda dapat menentukan di mana penalaran rusak: disambiguasi entitas, pemetaan lintas sumber, atau interpretasi kebijakan.

VAKRA dirancang untuk tiga pengguna yang berbeda:

  • Para peneliti mempelajari penalaran agenik, perencanaan multi-alat, dan penguatan diri
  • Tim Pengembang dan Teknik mengevaluasi model dasar untuk alur kerja agen produksi
  • Pemimpin mencari tolok ukur yang mencerminkan kompleksitas perusahaan, bukan tugas mainan

Memulai dan ketersediaan

VAKRA tersedia untuk umum hari ini. Kode sumber, spesifikasi tugas, dan harness evaluasi bersumber terbuka di Github, yang mencakup semua yang diperlukan untuk mereproduksi hasil dan menjalankan agen baru menyeluruh, termasuk:

  • Lingkungan API yang dihosting secara lokal dan dapat dieksekusi didukung oleh basis data nyata
  • Koleksi dokumen khusus domain untuk penalaran yang ditingkatkan dengan kemampuan pengambilan informasi
  • Runner evaluasi mandiri yang memutar ulang dan memverifikasi lintasan agen yang lengkap
  • Skrip untuk membandingkan model baru di seluruh pengaturan tugas khusus API, multi-hop, dan multi-sumber

Kami juga meluncurkan Hugging Face Space yang akan menjadi tuan rumah papan peringkat publik VAKRA. Kami mengundang peneliti, praktisi, dan pengembang untuk mengirimkan hasil, dan menyumbangkan masukan serta ekstensi.

Jelajahi di GitHub

Ankita Rajaram Naik

Research Data Scientist

Penulis tambahan:

Ucapan Terima Kasih

Para penulis berterima kasih kepada rekan-rekan di seluruh tim riset dan teknik atas masukan, diskusi, dan dukungan mereka yang berharga dalam mengembangkan tolok ukur ini.

Kami terutama mengakui pekerja magang kami, Raavi Gupta dan Abhinav Jain, atas upaya mereka dalam pembuatan dan pengembangan tolok ukur. Kami juga mengakui Chulaka Gunasekara, Hamid Adebayo, Harold Ship, Himanshu Gupta, Huaiyu Zhu, Jaydeep Sen, Renuka Sindhgatta, Sameep Mehta, Sara Rosenthal dan Segev Shlomov atas kontribusi dan insight mereka.