Evaluasi adalah alat penting untuk menguji performa agen Anda dan memastikan agen tersebut berperilaku sesuai harapan dalam situasi tertentu. Evaluasi memungkinkan Anda mengotomatiskan pengujian, menangkap regresi setelah melakukan perubahan, dan mengukur kualitas respons agen untuk meningkatkan kualitas agen Anda.
Untuk memulai, klik tombol Evaluasi di bagian atas pembuat agen.
Konsep evaluasi
Kasus pengujian: Setiap kasus pengujian adalah skenario atau perintah pengujian spesifik dan mandiri yang dirancang untuk menilai performa agen. Anda dapat membuat dua jenis kasus pengujian yang berbeda:
- Skenario: Fitur berteknologi AI untuk mem-bootstrap pengujian dan memastikan cakupan pengujian yang komprehensif. Anda menjelaskan sasaran pengguna, lalu sistem akan otomatis menyimulasikan pengguna dan membuat percakapan untuk menguji kemampuan agen dalam menangani skenario dengan cara yang efektif. Skenario adalah cara yang berguna untuk bereksperimen dan membantu menentukan percakapan golden.
- Golden: Ideal untuk pengujian regresi. Anda menyediakan jalur percakapan "ideal" tertentu, kemudian evaluasi akan memeriksa apakah perilaku agen cocok dengan jalur ideal ini, termasuk panggilan alat.
Operasi: Operasi evaluasi mewakili eksekusi lengkap dan tunggal dari serangkaian kasus pengujian golden dan skenario terhadap performa agen yang Anda uji. Setiap operasi dapat menyertakan satu atau beberapa kasus pengujian.
Hasil: Hasil kasus pengujian mengacu pada satu eksekusi kasus pengujian tertentu dalam satu operasi. Jika kasus pengujian dijalankan beberapa kali selama satu operasi evaluasi (misalnya, untuk memeriksa konsistensi, ketidakstabilan, dan sebagainya), setiap eksekusi individual adalah hasil individual. Hasil ditampilkan sebagai ikon persegi panjang di kolom dalam setiap baris kasus pengujian, yang menampilkan X merah jika operasi gagal dan tanda centang hijau jika berhasil.
Tag: Kasus pengujian dapat dikelompokkan dengan tag untuk memudahkan pengelolaan.
Membuat kasus pengujian
Untuk membuat dan mengakses kasus pengujian untuk agen Anda, klik tombol Evaluasi di bagian atas pembuat agen. Anda dapat membuat dan mengelola kasus pengujian berbasis golden atau skenario.
Skenario
Kasus pengujian berbasis skenario menggunakan AI untuk otomatis membuat berbagai percakapan berdasarkan sasaran pengguna tingkat tinggi yang Anda tentukan. Dengan kasus pengujian ini, Anda tidak perlu memberikan percakapan golden tertentu, tetapi memilih skenario yang dibuat atau menjelaskan skenario tertentu yang harus diuji. Ini adalah alat yang canggih untuk membantu Anda menjelajahi kasus ekstrem dan menguji ketahanan agen tanpa harus menulis setiap kemungkinan jalur percakapan secara manual.
Setelah skenario ini berfungsi dengan baik, Anda dapat menyimpannya sebagai percakapan golden.
Untuk membuat skenario:
- Klik Buat skenario. Beberapa skenario akan disarankan untuk Anda.
- Anda dapat membuat skenario berdasarkan pilihan atau membuat skenario baru dari awal.
Saat melihat daftar skenario, Anda dapat mencantumkan detail dan daftar percakapan untuk setiap skenario dengan mengklik skenario.
Untuk menyimpan skenario sebagai percakapan golden:
- Pilih skenario.
- Klik tombol menu di sudut kanan atas.
- Pilih Simpan sebagai percakapan golden.
Sasaran pengguna skenario
Setiap skenario memiliki sasaran pengguna, yang menjelaskan sasaran pengguna akhir saat menggunakan aplikasi agen. Contoh:
Securely book a specific room at a chosen hotel and receive a confirmation.
Berdasarkan sasaran pengguna, CX Agent Studio akan otomatis membuat percakapan yang digunakan untuk evaluasi.
Variabel skenario
Saat menentukan skenario, Anda dapat memberikan variabel yang harus digunakan untuk skenario tersebut.
Ekspektasi skenario
Untuk melakukan evaluasi, Anda harus menentukan ekspektasi untuk kasus pengujian.
Ekspektasi dapat berupa salah satu dari dua jenis berikut:
- Pesan: Respons agen yang diharapkan.
- Panggilan alat: Panggilan alat dengan input dan output yang diharapkan.
Ekspektasi dapat memiliki kondisi berikut:
- Harus mengandung
- Tidak boleh mengandung
- Setelah panggilan alat
- Nilai variabel
Untuk membuat ekspektasi:
- Klik skenario tertentu untuk membuka detailnya.
- Di bagian Ekspektasi, klik Lihat semua.
- Ikuti petunjuk antarmuka untuk membuat ekspektasi untuk skenario.
Golden
Kasus pengujian ini digunakan untuk menentukan jalur percakapan ideal untuk pengujian regresi sehingga jalur percakapan inti yang penting tidak rusak saat Anda memperbarui agen. Ada beberapa opsi untuk membuat percakapan golden:
Untuk mengimpor percakapan dari simulator:
- Mulai percakapan menggunakan simulator.
- Klik tiga titik vertikal di sudut kanan atas simulator untuk membuka menu simulator.
- Klik Simpan sebagai golden.
- Masukkan nama untuk kasus pengujian golden, lalu klik Simpan. Kasus pengujian tersebut akan muncul di tab Evaluasi.
Untuk membuat kasus pengujian dari histori percakapan:
- Buka tab Evaluasi.
- Klik + Tambahkan kasus pengujian.
- Pilih Golden.
- Klik Berikutnya.
- Klik Pilih dari histori percakapan.
- Di jendela yang muncul, pilih percakapan yang ingin Anda simpan sebagai kasus pengujian golden. Anda memiliki opsi untuk menelusuri berdasarkan ID percakapan.
- Jika Anda telah mengaktifkan penghapusan informasi pribadi, periksa respons dan variabel agen untuk penghapusan informasi pribadi sebelum melanjutkan dengan informasi yang tidak ada.
- Klik Tambahkan.
Untuk membuat Kasus Pengujian dari awal:
- Buka tab Evaluasi.
- Klik + Tambahkan kasus pengujian.
- Pilih Golden.
- Klik Berikutnya.
- Klik Buat dari awal.
- Di jendela yang muncul, tambahkan Nama tampilan untuk kasus pengujian.
- Tambahkan teks untuk input pengguna dan ekspektasi agen sesuai kebutuhan. Klik + Tambahkan input pengguna dan + Tambahkan ekspektasi agen untuk menambahkan respons. Klik + Tambahkan giliran untuk menambahkan giliran percakapan baru ke kasus pengujian.
- Klik Buat untuk menambahkan kasus pengujian golden ke daftar kasus pengujian Anda.
Untuk membuat kasus pengujian dari percakapan simulasi dalam kasus pengujian skenario:
- Buka halaman hasil operasi evaluasi.
- Klik ikon menu (tiga titik vertikal) di sebelah kanan percakapan yang dipilih, lalu klik Simpan sebagai percakapan golden.
Untuk mengupload banyak kasus pengujian dari file:
Untuk mengetahui detail tentang format file dan template CSV, lihat halaman Format CSV kasus pengujian golden.
Ekspektasi keemasan
Untuk melakukan evaluasi, Anda harus menentukan ekspektasi untuk kasus pengujian golden. Ekspektasi adalah hasil spesifik yang Anda harapkan dari agen pada titik tertentu dalam percakapan. Selama evaluasi, perilaku agen sebenarnya dibandingkan dengan ekspektasi ini.
Ekspektasi dapat berupa salah satu jenis berikut:
- Pesan: Respons teks yang diharapkan dari agen kepada pengguna akhir. Evaluasi akan memeriksa apakah respons agen secara semantik cocok dengan ekspektasi ini.
- Panggilan alat: Ekspektasi bahwa agen memanggil alat dan respons tertentu. Anda juga dapat menentukan argumen input yang diharapkan untuk panggilan alat.
- Pengalihan Agen: Ekspektasi bahwa agen mengalihkan percakapan ke agen manusia atau bot lain.
Untuk membuat ekspektasi:
- Klik kasus pengujian golden tertentu untuk membuka detailnya.
- Di bagian Detail, klik Lihat golden.
- Ikuti petunjuk antarmuka untuk menambahkan atau mengubah ekspektasi.
Setelan evaluasi
Di baris judul daftar kasus pengujian, Anda dapat mengonfigurasi setelan evaluasi:
- Golden:
- Kriteria lulus/gagal golden: Tetapkan logika untuk menentukan apakah percakapan simulasi lulus atau gagal.
- Tingkat giliran:
Aturan ini menilai setiap giliran individual.
Jika salah satu dari nilai minimum ini tidak terpenuhi, metrik tertentu akan diberi kode warna merah sebagai kegagalan.
- Kemiripan semantik: Nilai minimum untuk kemiripan semantik.
- Ketepatan alat: Nilai minimum untuk ketepatan alat.
- Halusinasi: Jika dinonaktifkan, halusinasi akan dikecualikan dari lulus/gagal.
- Tingkat ekspektasi:
Aturan ini menilai ekspektasi dalam satu giliran.
Jika salah satu dari nilai minimum ini tidak terpenuhi, metrik tertentu akan diberi kode warna merah sebagai kegagalan.
- Ketepatan alat: Nilai minimum untuk ketepatan alat.
- Metode operasi golden: Pilih antara validasi replay sederhana atau stabil.
- Alat palsu: Gunakan data tiruan, bukan panggilan API produksi yang sebenarnya.
- Scenarios:
- Kriteria lulus/gagal skenario: Tetapkan logika untuk menentukan apakah percakapan simulasi lulus atau gagal.
- Inisiator percakapan: Tetapkan siapa yang memulai percakapan, pengguna atau model.
- Alat palsu: Gunakan data tiruan, bukan panggilan API produksi yang sebenarnya.
- Evaluasi audio
- Rekaman evaluasi audio
Menjalankan evaluasi
Untuk menjalankan evaluasi, Anda dapat mengklik tombol jalankan di baris kasus pengujian, atau memilih beberapa kasus pengujian dan menjalankannya.
Jika telah menyimpan beberapa versi, Anda dapat memilih versi agen yang akan digunakan, atau otomatis menyimpan agen draf sebagai versi baru untuk operasi.
Setelah operasi evaluasi, metrik akan diperbarui dan hasilnya akan ditampilkan.
Jika mengklik evaluasi operasi tertentu, Anda dapat melihat hasil mendetail untuk operasi. Selain metrik standar, hal berikut akan ditampilkan:
- Giliran yang gagal
- Daftar terpaginasi dari semua detail giliran, yang mencakup respons agen sebenarnya dan yang diharapkan.
Untuk kasus pengujian golden, Anda mungkin melihat istilah "replay stabil" yang menjelaskan bahwa pengujian dijalankan di lingkungan yang konsisten (yaitu tanpa mengubah konteks/input).
Menggunakan AI untuk meningkatkan kualitas kasus pengujian (PRATINJAU)
Anda dapat menggunakan AI untuk membantu memecahkan masalah operasi dan menyarankan cara meningkatkan kualitas agen. Saran AI optimal jika jumlah operasi (jumlah operasi) adalah 3 atau lebih. Untuk mengaktifkan AI, pilih kasus pengujian yang ingin Anda evaluasi, lalu klik Jalankan yang dipilih. Di jendela pop-up, centang kotak di samping Temukan masalah dengan AI.
Setelah operasi selesai, Anda akan melihat saran berbasis AI di halaman hasil.
Gemini otomatis membuat loss_report yang dapat didownload dan merangkum aspek performa agen serta menyoroti area yang dapat ditingkatkan.
Setiap pengguna dapat melihat perbaikan yang disarankan AI, tetapi hanya orang yang memulai operasi yang dapat mengambil tindakan berdasarkan hasil.
Klik Tanya Gemini untuk berinteraksi dengan agen pembantu. Anda akan melihat laporan kerugian yang menjelaskan masalah tingkat tinggi dengan model atau agen. Anda dapat meminta agen pembantu untuk menjelaskan laporan tersebut, yang akan meringkas laporan dan mungkin menyarankan perbaikan. Setelah perbaikan diterapkan, Anda dapat meminta agen pembantu untuk menjalankan evaluasi lagi.
Mengimpor dan mengekspor
Anda dapat mengimpor dan mengekspor kasus pengujian, operasi, dan hasil evaluasi dalam format YAML atau JSON. Saat mengimpor, pastikan agen penerima berisi semua resource (alat, variabel, dan sub-agen) yang ditentukan dalam data yang diekspor.
Untuk mengekspor kasus pengujian:
- Pilih satu atau beberapa kasus pengujian.
- Klik Ekspor kasus pengujian.
- Pilih format.
- File zip akan didownload.
Untuk mengimpor kasus pengujian:
- Klik + Tambahkan kasus pengujian.
- Pilih Golden.
- Klik Berikutnya.
- Upload file zip.
- Jika ada konflik dengan impor, Anda akan dipandu cara menanganinya.
- Klik Buat.
Untuk mengekspor operasi dan hasil evaluasi:
- Pilih satu atau beberapa operasi evaluasi.
- Klik Ekspor operasi.
- Pilih format.
- File zip akan didownload.
Metrik
Setiap hasil kasus pengujian mencakup serangkaian metrik yang mengukur performa agen terhadap kasus pengujian yang Anda pilih. Metrik dihitung di tingkat giliran atau tingkat ekspektasi (percakapan) seperti yang ditunjukkan di konsol.
Dalam semua kasus, Anda dapat menyesuaikan nilai yang diperlukan agar operasi lulus di menu Setelan di tab Evaluasi.
Ketepatan alat
Dihitung untuk kasus pengujian golden dan skenario. Metrik ini mencerminkan persentase parameter yang diharapkan yang cocok dengan panggilan alat yang diharapkan dan nilai parameter yang diharapkan. Panggilan alat yang terlewat diberi skor 0, panggilan alat tanpa parameter input diberi skor 1 jika ada. Jika panggilan alat yang tidak terduga dilakukan selama evaluasi golden, hasilnya akan dianggap gagal, tetapi hal ini tidak berdampak pada nilai ketepatan alat.
Kepuasan target pengguna
Dihitung untuk skenario. Kepuasan sasaran pengguna adalah metrik biner yang dirancang untuk evaluasi simulasi pengguna. Metrik ini mengukur apakah pengguna simulasi yakin bahwa sasarannya tercapai (0=tidak, 1=ya). Inputnya adalah user_goal seperti yang ditentukan oleh konfigurasi pengguna simulasi dan transkrip percakapan. Jika user_goal yang diberikan tidak menentukan sasaran eksplisit atau tersirat, skor outputnya adalah -1.
Halusinasi
Tersedia untuk kasus pengujian golden dan skenario. Skor halusinasi dihitung untuk setiap giliran yang dibuat. Metrik ini mencerminkan apakah agen membuat klaim yang tidak dibenarkan oleh konteks agen (0=tidak, 1=ya). Konteks terdiri dari giliran sebelumnya dalam percakapan, variabel sesi, panggilan alat, dan petunjuk agen. Metrik ini hanya dihitung untuk giliran yang berisi panggilan alat. Metrik ini tidak mendeteksi halusinasi dalam panggilan alat; panggilan alat yang diberikan sebagai konteks dianggap benar. Untuk meminimalkan positif palsu, metrik mungkin menampilkan skor N/A jika respons tidak berisi klaim faktual atau hanya pengetahuan umum yang sudah ditetapkan.
Anda dapat mengaktifkan dan menonaktifkan halusinasi di setelan evaluasi.
Pencocokan semantik
Dihitung untuk kasus pengujian golden. Metrik ini mengukur sejauh mana ucapan agen yang diamati cocok dengan ucapan agen yang diharapkan. Pencocokan semantik dihitung di tingkat giliran. Nilai yang ditampilkan berkisar dari 0 (sepenuhnya tidak konsisten atau kontradiktif) hingga 4 (sepenuhnya konsisten).
Ekspektasi skenario
Dihitung untuk skenario. Metrik ini adalah ukuran apakah perilaku agen seperti yang diharapkan oleh pengguna simulasi memuaskan atau tidak (0=tidak, 1=ya). Dua jenis ekspektasi pengguna simulasi didukung:
- Ekspektasi panggilan alat: Dihitung mirip dengan ketepatan panggilan alat
dengan pengecualian berikut:
- Hasilnya adalah 0 (tidak) atau 1 (ya).
- Panggilan alat yang tidak terduga tidak dikenai penalti. Ekspektasi dimaksudkan untuk menentukan kumpulan panggilan alat yang penting agar percakapan memenuhi ekspektasi pengguna simulasi.
- Saat ekspektasi input panggilan alat terpenuhi, panggilan akan dicegat dan diganti dengan nilai pengembalian tiruan saat runtime.
- Ekspektasi respons agen: Memeriksa apakah respons agen dalam percakapan berisi string yang diharapkan.
Penyelesaian tugas
Dihitung untuk skenario. Penyelesaian tugas adalah ukuran kualitas percakapan. Metrik ini mengukur secara bersama-sama apakah sasaran pengguna tercapai DAN perilaku agen benar. Metrik ini didefinisikan sebagai:
User_Goal_Satisfied AND no_hallucinations_detected AND Expectations Satisfied
Persona
Persona adalah persona pengguna simulasi yang dapat Anda sesuaikan dan gunakan untuk pengujian agen dengan kasus pengujian skenario. Fitur ini berguna untuk memastikan bahwa agen berinteraksi dengan tepat dengan jenis pengguna manusia yang mungkin ditemui saat runtime.
Jika Anda tidak memilih persona, persona acak akan dipilih untuk setiap hasil skenario.
Fitur ini dapat digunakan dengan input teks dan audio.
Membuat persona
- Untuk membuat persona, buka tab Evaluasi , lalu klik Pengelolaan persona (di samping ikon Setelan).
- Klik + Tambahkan persona.
- Di menu pop-up, masukkan Nama, Kepribadian pengguna, dan Konteks pengguna tambahan (seperti usia, lokasi, alasan mereka menelepon, dan sebagainya).
- Klik + Tambahkan.
Untuk menjalankan evaluasi menggunakan persona:
- Kembali ke halaman Evaluasi utama, lalu pilih satu atau beberapa kasus pengujian skenario. Klik Jalankan yang dipilih.
- Di jendela pop-up, pilih persona yang baru Anda buat dari menu drop-down Persona , lalu klik Jalankan.