Panduan ini menjelaskan cara menggunakan fitur evaluasi bawaan di konsol Dialogflow CX untuk memverifikasi fungsi agen Anda dan mencegah regresi setelah pembaruan. Dialogflow CX menyediakan metrik siap pakai untuk membantu mengevaluasi performa agen Anda.
Semua metrik kecuali latensi memerlukan setidaknya satu kasus pengujian, yaitu "respons ideal" yang dibandingkan dengan performa agen oleh Dialogflow CX untuk menghitung performanya. Setiap kasus pengujian dapat diukur dalam konteks dari lingkungan, yang memungkinkan Anda menentukan versi playbook, alur, dan alat yang berbeda untuk digunakan dalam evaluasi performa agen.
(Opsional) Membuat lingkungan
Membuat lingkungan bersifat opsional. Jika Anda tidak membuatnya, nilai defaultnya adalah Draf.
- Untuk membuat lingkungan, klik Environments di menu sebelah kiri, lalu pilih + Create.
- Pilih versi playbook, alur, dan alat yang ingin Anda gunakan untuk mengukur performa agen.
- Klik Save untuk menyimpan lingkungan.
Membuat kasus pengujian
Anda memiliki opsi untuk membuat kasus pengujian dari percakapan yang ada di histori percakapan, membuat percakapan baru untuk disimpan sebagai kasus pengujian, atau mengimpor kasus pengujian ke Dialogflow CX.
Membuat kasus pengujian di konsol
- Buka Conversation history di menu sebelah kiri.
- Untuk membuat percakapan baru, aktifkan agen Anda (misalnya, dengan memanggil nomor telepon agen) untuk membuat percakapan di histori percakapan. Jika Anda memiliki percakapan yang ingin digunakan sebagai kasus pengujian, pilih percakapan tersebut.
- Lihat percakapan dan verifikasi respons agen, alat yang dipanggil, dan suara setiap respons. Jika Anda puas, klik Create test case di sudut kanan atas jendela.
- Berikan nama tampilan untuk kasus pengujian dan tentukan ekspektasi Anda terhadap peristiwa yang seharusnya terjadi di tingkat percakapan. Hal ini dapat mencakup alat, playbook, dan alur yang Anda harapkan akan dipanggil dalam percakapan. Klik +Add expectation untuk menambahkan ekspektasi lainnya. Untuk mengevaluasi ekspektasi dalam urutan berurutan seperti yang tercantum (dari atas ke bawah), aktifkan Sequential validation.
- Klik Save untuk menyimpan kasus pengujian Anda.
Mengupload kasus pengujian
- Kasus pengujian harus dalam format CSV berikut.
- Untuk mengupload kasus pengujian ke sistem, klik Import di bagian atas menu kasus pengujian.
- Di menu yang muncul, pilih file yang disimpan secara lokal atau masukkan jalur ke bucket Cloud Storage-nya.
- Kasus pengujian Anda akan muncul di menu kasus pengujian.
Menjalankan kasus pengujian
- Klik Test cases di menu sebelah kiri, lalu pilih kasus pengujian yang ingin Anda bandingkan dengan agen Anda. Kasus pengujian dapat berupa satu kasus pengujian atau beberapa kasus pengujian.
- Klik Run selected test cases.
Hasil pengujian
- Mengakses hasil: Hasil eksekusi pengujian terbaru ditampilkan untuk setiap
kasus pengujian dalam tampilan Test Case setelah selesai:
- Kemiripan semantik: Mengukur seberapa mirip percakapan agen dengan "respons ideal" (respons dalam Kasus Pengujian). Respons ideal diperlukan untuk menerima metrik ini. Nilai dapat berupa 0 (tidak konsisten), 0,5 (agak konsisten), atau 1 (sangat konsisten).
- Akurasi panggilan alat: Nilai yang mencerminkan seberapa akurat
percakapan menyertakan alat yang diharapkan akan dipanggil selama
percakapan. Nilai berkisar antara 0-1. Jika tidak ada alat yang digunakan dalam percakapan, akurasi akan ditampilkan sebagai
--(Tidak Ada). - Latensi: Total waktu yang dibutuhkan agen untuk memproses permintaan pengguna akhir dan merespons pengguna (perbedaan antara akhir ucapan pengguna dan awal respons agen). Unit dalam detik.
- Perbarui kasus pengujian emas: Jika pengujian terbaru mencerminkan perubahan yang diharapkan karena pembaruan agen, Anda dapat mengklik "Simpan sebagai emas" untuk menimpa Kasus Pengujian asli.
- Filter and sort results: Anda dapat memfilter dan mengurutkan hasil evaluasi berdasarkan metrik yang dihasilkan atau berdasarkan Lingkungan tertentu. Hal ini berguna untuk melacak perubahan performa setelah setiap pembaruan.
Memformat kasus pengujian impor batch
Bagian ini menjelaskan cara memformat file CSV untuk mengimpor kasus pengujian batch untuk agen Anda. Sistem membaca file ini untuk membuat kumpulan kasus pengujian terstruktur, yang masing-masing berisi satu atau beberapa giliran percakapan.
Satu kasus pengujian dapat mencakup beberapa baris dalam file CSV. Baris pertama kasus pengujian menentukan properti keseluruhannya (seperti nama dan bahasa). Setiap baris berikutnya untuk kasus pengujian tersebut menentukan satu giliran percakapan bolak-balik (pengguna mengatakan sesuatu, agen diharapkan membalas).
Header
File CSV harus memiliki baris header sebagai baris pertama. Header ini menentukan data di setiap kolom.
Header yang wajib diisi
Dua header yang wajib diisi harus dalam urutan yang ditampilkan. Keduanya wajib diisi untuk baris pertama kasus pengujian baru. Anda dapat memulai kasus pengujian baru dengan memberikan nilai DisplayName dan LanguageCode baru.
DisplayName: Nama kasus pengujian Anda. Kolom ini hanya diisi untuk baris pertama kasus pengujian baru.LanguageCode: Kode bahasa untuk pengujian (misalnya,en,en-US,es).
Header opsional
Anda dapat menyertakan salah satu header opsional berikut untuk memberikan detail selengkapnya untuk kasus pengujian Anda. Header opsional dapat berada dalam urutan apa pun setelah dua kolom pertama yang wajib diisi.
Metadata kasus pengujian
- Tags: Tag yang dipisahkan spasi untuk mengatur pengujian (misalnya, "payments onboarding").
- Notes: Catatan teks bebas atau deskripsi tujuan kasus pengujian.
TestCaseConfigV2.StartResource: Tentukan alur atau playbook untuk memulai pengujian.
Input pengguna
UserInput.Input.Text: Teks yang "diketik" pengguna untuk giliran tertentu.UserInput.InjectedParameters: Parameter yang akan dimasukkan ke dalam percakapan pada awal giliran, diformat sebagai string JSON.
Output agen
AgentOutput.QueryResult.ResponseMessages.Text: Teks persis yang Anda tetapkan sebagai balasan agen.AgentOutput.QueryResult.Parameters: Parameter yang Anda tetapkan diekstrak oleh agen, diformat sebagai string JSON.
Ekspektasi
OrderedExpectations.ExpectedFlow: Alur yang Anda harapkan aktif setelah giliran.OrderedExpectations.ExpectedIntent: Intent yang Anda harapkan cocok untuk giliran.OrderedExpectations.ExpectedAgentReply: Teks yang Anda harapkan sebagai balasan agen. Dapat berupa substring dari balasan lengkap.OrderedExpectations.ExpectedOutputParameter: Parameter yang Anda harapkan akan ditetapkan pada akhir giliran, diformat sebagai string JSON.
Metadata audio
AudioTurnMetadataMetadata untuk pengujian berbasis audio, diformat sebagai string JSON.
Membuat kasus pengujian
Kasus pengujian diatur berdasarkan baris data.
- Untuk memulai kasus pengujian baru, isi baris metadatanya.
- Rule: Baris ini harus memiliki nilai di kolom
DisplayName. - Tindakan: Masukkan nilai untuk
DisplayNamedanLanguageCode. Anda juga dapat menambahkan tag, catatan, atauTestCaseConfigV2.StartResourcedi baris ini. Kolom giliran percakapan (sepertiUserInput.Input.Text) harus dibiarkan kosong di baris ini. Jika menggunakan tag, pisahkan setiap tag dengan spasi. Contoh:tag1 tag2 tag3. Jika menggunakanTestCaseConfigV2.StartResource, tambahkan awalanstart_flow:ataustart_playbook:ke nama resource. Contoh:start_flow:projects/p/locations/l/agents/a/flows/f.
- Rule: Baris ini harus memiliki nilai di kolom
- Tambahkan giliran percakapan ke kasus pengujian yang baru Anda mulai dengan menambahkan baris baru tepat di bawahnya.
- Rule: Kolom
DisplayNameharus kosong. Hal ini memberi tahu parser bahwa itu adalah giliran yang termasuk dalam kasus pengujian sebelumnya. - Tindakan: Isi kolom yang menjelaskan tindakan pengguna dan
respons agen yang diharapkan untuk giliran ini, seperti
UserInput.Input.TextdanOrderedExpectations.ExpectedAgentReply. Untuk kolom yang memerlukan JSON, Anda harus memberikan objek JSON yang valid sebagai string. Contoh:{"param_name": "param_value", "number_param": 123}.
- Rule: Kolom