Mengevaluasi agen yang dibuat dengan Managed Agents API di Agent Platform

Halaman ini menjelaskan cara mengevaluasi agen yang dibuat dengan Managed Agents API di Agent Platform menggunakan layanan evaluasi AI Generatif. Anda dapat membuat skenario pengujian sintetis, menjalankan agen terhadap skenario tersebut, dan memberi skor pada hasil rekaman percakapan dengan metrik bawaan.

Sebelum memulai

  1. Selesaikan langkah-langkah di Membuat dan mengelola agen untuk membuat resource Managed Agent.

  2. Instal Agent Platform SDK dengan ekstensi evaluasi:

    pip install google-cloud-aiplatform[evaluation]
    
  3. Siapkan autentikasi dan konfigurasi project Anda:

    Ganti kode berikut:

    • PROJECT_ID: Project ID Anda Google Cloud .
    import agentplatform
    
    client = agentplatform.Client(
        project="PROJECT_ID",
        location="global",
    )
    

Alur kerja evaluasi

Evaluasi Managed Agent mengikuti tiga langkah:

  1. Buat skenario: Buat skenario pengujian multi-giliran yang beragam secara otomatis dari petunjuk dan definisi alat agen.
  2. Jalankan inferensi: Jalankan agen terhadap skenario yang dibuat untuk merekam rekaman percakapan.
  3. Evaluasi: Beri skor pada rekaman percakapan menggunakan metrik bawaan.

Langkah 1: Buat skenario percakapan

Gunakan generate_conversation_scenarios untuk membuat skenario pengujian secara otomatis berdasarkan konfigurasi agen Anda. Metode ini membaca petunjuk sistem dan alat agen untuk menghasilkan perintah pengguna yang realistis.

Ganti kode berikut:

  • PROJECT_ID: Project ID Anda Google Cloud .
  • AGENT_ID: ID resource agen Anda. Untuk mengetahui informasi selengkapnya tentang cara mengambil atau mencantumkan agen kustom untuk menemukan ID-nya, lihat Mencantumkan agen.
AGENT_RESOURCE = f"projects/PROJECT_ID/locations/global/agents/AGENT_ID"

scenarios = client.evals.generate_conversation_scenarios(
    agent=AGENT_RESOURCE,
    config={
        "count": 5,
        "generation_instruction": "Generate scenarios where a user asks for a refund.",
    },
)

scenarios.show()

Setiap skenario yang dibuat mencakup starting_prompt yang mewakili pesan pengguna awal dalam percakapan.

Langkah 2: Jalankan inferensi

Gunakan run_inference untuk menjalankan agen terhadap skenario yang dibuat. Agen menjalankan setiap skenario dan menghasilkan rekaman percakapan yang merekam interaksi lengkap, termasuk panggilan alat, langkah-langkah perantara, dan respons akhir.

inference_results = client.evals.run_inference(
    agent=AGENT_RESOURCE,
    src=scenarios,
    config={"user_simulator_config": {"max_turn": 5}}
)

inference_results.show()

Langkah 3: Evaluasi

Gunakan evaluate untuk memberi skor pada rekaman percakapan dengan metrik bawaan. Metrik berikut tersedia untuk evaluasi agen:

Metrik Deskripsi
final_response_quality_v1 Mengevaluasi apakah agen berhasil menyelesaikan tugas pengguna.
safety_v1 Mengevaluasi apakah respons agen aman.
multi_turn_task_success_v1 Mengevaluasi apakah agen berhasil menyelesaikan tugas multi-giliran pengguna.
from agentplatform import types

eval_result = client.evals.evaluate(
    dataset=inference_results,
    metrics=[
        types.RubricMetric.MULTI_TURN_TASK_SUCCESS,
    ],
    agent=AGENT_RESOURCE,
)

eval_result.show()

Metode show() menampilkan laporan interaktif dengan skor gabungan, alasan per kasus, dan rekaman percakapan agen, termasuk Topologi Sistem (alat dan petunjuk agen).

Mengevaluasi interaksi yang ada

Anda juga dapat mengevaluasi interaksi yang telah direkam dengan agen. Hal ini berguna untuk menilai kualitas percakapan produksi. Untuk mengetahui informasi tentang cara mengirim interaksi ke agen dan cara mengambil interaction_id, lihat Mengirim interaksi ke agen kustom.

Ganti kode berikut:

  • PROJECT_ID: Project ID Anda Google Cloud .
  • INTERACTION_ID: ID interaksi yang direkam.
  • AGENT_RESOURCE: Nama lengkap resource agen Anda, dalam format projects/PROJECT_ID/locations/global/agents/AGENT_ID.
interactions_dataset = types.EvaluationDataset(
    eval_cases=[
        types.EvalCase(
            interactions_data_source=types.InteractionsDataSource(
                interaction=f"projects/PROJECT_ID/locations/global/interactions/INTERACTION_ID",
                gemini_agent_config=types.GeminiAgentConfig(
                    gemini_agent=AGENT_RESOURCE,
                ),
            ),
        ),
    ]
)

eval_result = client.evals.evaluate(
    dataset=interactions_dataset,
    metrics=[
        types.RubricMetric.MULTI_TURN_TASK_SUCCESS,
    ],
    agent=AGENT_RESOURCE,
)

eval_result.show()

Langkah berikutnya

Panduan

Pelajari cara membuat, memperbarui, mencantumkan, mendapatkan, dan menghapus agen menggunakan REST API.

Panduan

Pelajari cara berinteraksi dengan agen saat runtime, mengelola status sesi, dan mengganti konfigurasi secara dinamis.

Ringkasan

Pelajari evaluasi agen di Google Agent Platform.

Panduan

Pelajari cara mengelola metrik evaluasi di Google Agent Platform.