Halaman ini menjelaskan cara mengevaluasi agen yang dibuat dengan Managed Agents API di Agent Platform menggunakan layanan evaluasi AI Generatif. Anda dapat membuat skenario pengujian sintetis, menjalankan agen terhadap skenario tersebut, dan memberi skor pada hasil rekaman percakapan dengan metrik bawaan.
Sebelum memulai
Selesaikan langkah-langkah di Membuat dan mengelola agen untuk membuat resource Managed Agent.
Instal Agent Platform SDK dengan ekstensi evaluasi:
pip install google-cloud-aiplatform[evaluation]Siapkan autentikasi dan konfigurasi project Anda:
Ganti kode berikut:
- PROJECT_ID: Project ID Anda Google Cloud .
import agentplatform client = agentplatform.Client( project="PROJECT_ID", location="global", )
Alur kerja evaluasi
Evaluasi Managed Agent mengikuti tiga langkah:
- Buat skenario: Buat skenario pengujian multi-giliran yang beragam secara otomatis dari petunjuk dan definisi alat agen.
- Jalankan inferensi: Jalankan agen terhadap skenario yang dibuat untuk merekam rekaman percakapan.
- Evaluasi: Beri skor pada rekaman percakapan menggunakan metrik bawaan.
Langkah 1: Buat skenario percakapan
Gunakan generate_conversation_scenarios untuk membuat skenario pengujian secara otomatis berdasarkan konfigurasi agen Anda. Metode ini membaca petunjuk sistem dan alat agen untuk menghasilkan perintah pengguna yang realistis.
Ganti kode berikut:
- PROJECT_ID: Project ID Anda Google Cloud .
- AGENT_ID: ID resource agen Anda. Untuk mengetahui informasi selengkapnya tentang cara mengambil atau mencantumkan agen kustom untuk menemukan ID-nya, lihat Mencantumkan agen.
AGENT_RESOURCE = f"projects/PROJECT_ID/locations/global/agents/AGENT_ID"
scenarios = client.evals.generate_conversation_scenarios(
agent=AGENT_RESOURCE,
config={
"count": 5,
"generation_instruction": "Generate scenarios where a user asks for a refund.",
},
)
scenarios.show()
Setiap skenario yang dibuat mencakup starting_prompt yang mewakili pesan pengguna awal dalam percakapan.
Langkah 2: Jalankan inferensi
Gunakan run_inference untuk menjalankan agen terhadap skenario yang dibuat.
Agen menjalankan setiap skenario dan menghasilkan rekaman percakapan yang merekam interaksi lengkap, termasuk panggilan alat, langkah-langkah perantara, dan respons akhir.
inference_results = client.evals.run_inference(
agent=AGENT_RESOURCE,
src=scenarios,
config={"user_simulator_config": {"max_turn": 5}}
)
inference_results.show()
Langkah 3: Evaluasi
Gunakan evaluate untuk memberi skor pada rekaman percakapan dengan metrik bawaan.
Metrik berikut tersedia untuk evaluasi agen:
| Metrik | Deskripsi |
|---|---|
final_response_quality_v1 |
Mengevaluasi apakah agen berhasil menyelesaikan tugas pengguna. |
safety_v1 |
Mengevaluasi apakah respons agen aman. |
multi_turn_task_success_v1 |
Mengevaluasi apakah agen berhasil menyelesaikan tugas multi-giliran pengguna. |
from agentplatform import types
eval_result = client.evals.evaluate(
dataset=inference_results,
metrics=[
types.RubricMetric.MULTI_TURN_TASK_SUCCESS,
],
agent=AGENT_RESOURCE,
)
eval_result.show()
Metode show() menampilkan laporan interaktif dengan skor gabungan, alasan per kasus, dan rekaman percakapan agen, termasuk Topologi Sistem (alat dan petunjuk agen).
Mengevaluasi interaksi yang ada
Anda juga dapat mengevaluasi interaksi yang telah direkam dengan agen. Hal ini berguna untuk menilai kualitas percakapan produksi. Untuk mengetahui informasi tentang cara mengirim interaksi ke agen dan cara mengambil interaction_id, lihat Mengirim interaksi ke agen kustom.
Ganti kode berikut:
- PROJECT_ID: Project ID Anda Google Cloud .
- INTERACTION_ID: ID interaksi yang direkam.
- AGENT_RESOURCE: Nama lengkap resource agen Anda, dalam
format
projects/PROJECT_ID/locations/global/agents/AGENT_ID.
interactions_dataset = types.EvaluationDataset(
eval_cases=[
types.EvalCase(
interactions_data_source=types.InteractionsDataSource(
interaction=f"projects/PROJECT_ID/locations/global/interactions/INTERACTION_ID",
gemini_agent_config=types.GeminiAgentConfig(
gemini_agent=AGENT_RESOURCE,
),
),
),
]
)
eval_result = client.evals.evaluate(
dataset=interactions_dataset,
metrics=[
types.RubricMetric.MULTI_TURN_TASK_SUCCESS,
],
agent=AGENT_RESOURCE,
)
eval_result.show()
Langkah berikutnya
Membuat dan mengelola agen
Pelajari cara membuat, memperbarui, mencantumkan, mendapatkan, dan menghapus agen menggunakan REST API.
Berinteraksi dengan agen
Pelajari cara berinteraksi dengan agen saat runtime, mengelola status sesi, dan mengganti konfigurasi secara dinamis.