Alat: get_evaluation
Mendapatkan detail evaluasi yang ditentukan.
Contoh kode berikut menunjukkan cara menggunakan curl untuk memanggil alat MCP get_evaluation.
| Permintaan Curl |
|---|
curl --location 'https://ces.googleapis.com/mcp' \ --header 'content-type: application/json' \ --header 'accept: application/json, text/event-stream' \ --data '{ "method": "tools/call", "params": { "name": "get_evaluation", "arguments": { // provide these details according to the tool's MCP specification } }, "jsonrpc": "2.0", "id": 1 }' |
Skema Input
Pesan permintaan untuk EvaluationService.GetEvaluation.
GetEvaluationRequest
| Representasi JSON |
|---|
{ "name": string } |
| Kolom | |
|---|---|
name |
Wajib. Nama resource evaluasi yang akan diambil. |
Skema Output
Evaluasi merepresentasikan semua informasi yang diperlukan untuk menyimulasikan dan mengevaluasi agen.
Evaluasi
| Representasi JSON |
|---|
{ "name": string, "displayName": string, "description": string, "tags": [ string ], "evaluationDatasets": [ string ], "createTime": string, "createdBy": string, "updateTime": string, "lastUpdatedBy": string, "evaluationRuns": [ string ], "etag": string, "aggregatedMetrics": { object ( |
| Kolom | |
|---|---|
name |
ID. ID unik evaluasi ini. Format: |
displayName |
Wajib. Nama tampilan evaluasi yang ditentukan pengguna. Unik dalam Aplikasi. |
description |
Opsional. Deskripsi evaluasi yang ditentukan pengguna. |
tags[] |
Opsional. Tag yang ditentukan pengguna untuk mengategorikan evaluasi. |
evaluationDatasets[] |
Hanya output. Daftar set data evaluasi yang termasuk dalam evaluasi. Format: |
createTime |
Hanya output. Stempel waktu saat evaluasi dibuat. Menggunakan RFC 3339 yang outputnya akan selalu dinormalisasi Z dan menggunakan 0, 3, 6, atau 9 digit pecahan. Offset selain "Z" juga diterima. Contoh: |
createdBy |
Hanya output. Pengguna yang membuat evaluasi. |
updateTime |
Hanya output. Stempel waktu saat evaluasi terakhir diperbarui. Menggunakan RFC 3339 yang outputnya akan selalu dinormalisasi Z dan menggunakan 0, 3, 6, atau 9 digit pecahan. Offset selain "Z" juga diterima. Contoh: |
lastUpdatedBy |
Hanya output. Pengguna yang terakhir memperbarui evaluasi. |
evaluationRuns[] |
Hanya output. EvaluationRun yang terkait dengan Evaluasi ini. |
etag |
Hanya output. ETag yang digunakan untuk memastikan objek tidak berubah selama operasi baca-ubah-tulis. Jika etag kosong, pembaruan akan menimpa perubahan serentak. |
aggregatedMetrics |
Hanya output. Metrik gabungan untuk evaluasi ini di semua proses. |
lastCompletedResult |
Hanya output. Hasil evaluasi terbaru untuk evaluasi ini. |
invalid |
Hanya output. Apakah evaluasi tidak valid. Hal ini dapat terjadi jika evaluasi mereferensikan alat, toolset, atau agen yang telah dihapus. |
lastTenResults[] |
Hanya output. 10 hasil evaluasi terakhir untuk evaluasi ini. Ini hanya diisi jika include_last_ten_results disetel ke benar (true) di ListEvaluationsRequest atau GetEvaluationRequest. |
evaluationMetricsThresholdOverride |
Opsional. Mengganti nilai minimum metrik untuk evaluasi tertentu ini. |
evaluationMetricsConfigOverride |
Opsional. Mengganti konfigurasi metrik untuk evaluasi spesifik ini. |
Kolom union inputs. Input untuk evaluasi inputs hanya dapat berupa salah satu dari berikut: |
|
golden |
Opsional. Langkah-langkah ideal yang akan dievaluasi. |
scenario |
Opsional. Konfigurasi untuk skenario. |
Golden
| Representasi JSON |
|---|
{
"turns": [
{
object ( |
| Kolom | |
|---|---|
turns[] |
Wajib. Jumlah putaran emas yang diperlukan untuk memutar ulang percakapan emas. Jumlah maksimum giliran yang diizinkan adalah 100. |
evaluationExpectations[] |
Opsional. Ekspektasi evaluasi untuk mengevaluasi percakapan yang diputar ulang. Format: |
GoldenTurn
| Representasi JSON |
|---|
{ "steps": [ { object ( |
| Kolom | |
|---|---|
steps[] |
Wajib. Langkah-langkah yang diperlukan untuk memutar ulang percakapan emas. |
rootSpan |
Opsional. Rentang root dari giliran emas untuk memproses dan mempertahankan informasi audio. URI untuk audio harus berisi audio yang disimpan dalam frekuensi sampel 16 Khz. |
turnLevelMetricsThresholdsOverride |
Opsional. Penggantian untuk nilai minimum metrik tingkat giliran bicara. |
hallucinationMetricBehaviorOverride |
Opsional. Penggantian untuk perilaku metrik halusinasi tingkat giliran bicara. |
Langkah
| Representasi JSON |
|---|
{ // Union field |
| Kolom | |
|---|---|
Kolom union step. Langkah yang akan dilakukan. step hanya ada berupa salah satu diantara berikut: |
|
userInput |
Opsional. Input pengguna untuk percakapan. |
agentTransfer |
Opsional. Mentransfer percakapan ke agen lain. |
expectation |
Opsional. Mengeksekusi ekspektasi pada giliran saat ini. |
SessionInput
| Representasi JSON |
|---|
{ "willContinue": boolean, // Union field |
| Kolom | |
|---|---|
willContinue |
Opsional. Flag untuk menunjukkan apakah pesan saat ini adalah fragmen input yang lebih besar dalam sesi streaming bidi. Jika disetel ke CATATAN: Kolom ini tidak berlaku untuk input audio dan DTMF, karena keduanya selalu diproses secara otomatis berdasarkan sinyal pengakhiran. |
Kolom union input_type. Jenis input. input_type hanya ada berupa salah satu diantara berikut: |
|
text |
Opsional. Data teks dari pengguna akhir. |
dtmf |
Opsional. Digit DTMF dari pengguna akhir. |
audio |
Opsional. Data audio dari pengguna akhir. String berenkode base64. |
toolResponses |
Opsional. Hasil eksekusi untuk panggilan alat dari klien. |
image |
Opsional. Data gambar dari pengguna akhir. |
blob |
Opsional. Data blob dari pengguna akhir. |
variables |
Opsional. Variabel kontekstual untuk sesi, yang dikelompokkan berdasarkan nama. Hanya variabel yang dideklarasikan di aplikasi yang akan digunakan oleh agen CES. Variabel yang tidak dikenali akan tetap dikirim ke [agen Dialogflow][Agent.RemoteDialogflowAgent] sebagai parameter sesi tambahan. |
event |
Opsional. Input acara. |
ToolResponses
| Representasi JSON |
|---|
{
"toolResponses": [
{
object ( |
| Kolom | |
|---|---|
toolResponses[] |
Opsional. Daftar hasil eksekusi alat. |
ToolResponse
| Representasi JSON |
|---|
{ "id": string, "displayName": string, "response": { object }, "parentToolCallId": string, "agentName": string, // Union field |
| Kolom | |
|---|---|
id |
Opsional. ID yang cocok dari |
displayName |
Hanya output. Nama tampilan alat. |
response |
Wajib. Hasil eksekusi alat dalam format objek JSON. Gunakan kunci "output" untuk menentukan respons alat dan kunci "error" untuk menentukan detail error (jika ada). Jika kunci "output" dan "error" tidak ditentukan, seluruh "respons" akan diperlakukan sebagai hasil eksekusi alat. |
parentToolCallId |
Hanya output. ID panggilan alat yang menyebabkan panggilan ini, saat dikeluarkan oleh sub-agen yang bekerja atas nama panggilan induk. Kosong untuk panggilan tingkat teratas. Memungkinkan klien mengelompokkan pekerjaan sub-agen dalam panggilan yang memulainya, bukan merender setiap langkah sebagai saudara. |
agentName |
Hanya output. Nama agen yang dapat dibaca manusia yang mengeluarkan panggilan ini, misalnya "Arsitek Kontrak". Kosong saat dikeluarkan oleh agen root. |
Kolom union tool_identifier. ID alat yang dieksekusi. Alat ini bisa berupa alat yang tetap ada atau alat dari set alat. tool_identifier hanya ada berupa salah satu diantara berikut: |
|
tool |
Opsional. Nama alat yang akan dieksekusi. Format: |
toolsetTool |
Opsional. Alat toolset yang dieksekusi. |
ToolsetTool
| Representasi JSON |
|---|
{ "toolset": string, "toolId": string } |
| Kolom | |
|---|---|
toolset |
Wajib. Nama resource Toolset dari mana alat ini berasal. Format: |
toolId |
Opsional. ID alat untuk memfilter alat yang akan diambil skemanya. |
Struct
| Representasi JSON |
|---|
{ "fields": { string: value, ... } } |
| Kolom | |
|---|---|
fields |
Peta tidak berurutan dari nilai yang diketik secara dinamis. Objek yang berisi daftar pasangan |
FieldsEntry
| Representasi JSON |
|---|
{ "key": string, "value": value } |
| Kolom | |
|---|---|
key |
|
value |
|
Nilai
| Representasi JSON |
|---|
{ // Union field |
| Kolom | |
|---|---|
Kolom union kind. Jenis nilai. kind hanya ada berupa salah satu diantara berikut: |
|
nullValue |
Mewakili JSON |
numberValue |
Mewakili angka JSON. Tidak boleh |
stringValue |
Mewakili string JSON. |
boolValue |
Mewakili boolean JSON (literal |
structValue |
Mewakili objek JSON. |
listValue |
Mewakili array JSON. |
ListValue
| Representasi JSON |
|---|
{ "values": [ value ] } |
| Kolom | |
|---|---|
values[] |
Kolom berulang dari nilai yang diketik secara dinamis. |
Gambar
| Representasi JSON |
|---|
{ "mimeType": string, "data": string } |
| Kolom | |
|---|---|
mimeType |
Wajib. Jenis MIME standar IANA dari data sumber. Jenis gambar yang didukung meliputi: * image/png * image/jpeg * image/webp |
data |
Wajib. Byte mentah gambar. String berenkode base64. |
Blob
| Representasi JSON |
|---|
{ "mimeType": string, "data": string } |
| Kolom | |
|---|---|
mimeType |
Wajib. Jenis MIME standar IANA dari data sumber. |
data |
Wajib. Byte mentah blob. String berenkode base64. |
Acara
| Representasi JSON |
|---|
{ "event": string } |
| Kolom | |
|---|---|
event |
Wajib. Nama acara. |
AgentTransfer
| Representasi JSON |
|---|
{ "targetAgent": string, "displayName": string } |
| Kolom | |
|---|---|
targetAgent |
Wajib. Agen yang menjadi tujuan pengalihan percakapan. Agen akan menangani percakapan mulai saat ini. Format: |
displayName |
Hanya output. Nama tampilan agen. |
GoldenExpectation
| Representasi JSON |
|---|
{ "note": string, "skipEvaluation": boolean, "expectationLevelMetricsThresholdsOverride": { object ( |
| Kolom | |
|---|---|
note |
Opsional. Catatan untuk persyaratan ini, berguna dalam pelaporan saat pemeriksaan tertentu gagal. Misalnya, "Check_Payment_Tool_Called". |
skipEvaluation |
Opsional. Jika disetel ke benar (true), ekspektasi khusus ini tidak akan dievaluasi. |
expectationLevelMetricsThresholdsOverride |
Opsional. Mengganti metrik di tingkat langkah. |
agentResponseSemanticSimilarityMetricsConfigOverride |
Opsional. Penggantian untuk metrik kesamaan semantik agent_response. |
agentResponseHallucinationMetricsConfigOverride |
Opsional. Penggantian untuk metrik halusinasi agent_response. |
comparisonType |
Opsional. Jenis perbandingan yang akan digunakan untuk pemeriksaan ekspektasi. |
Kolom union condition. Pemeriksaan sebenarnya yang akan dilakukan. condition hanya ada berupa salah satu diantara berikut: |
|
toolCall |
Opsional. Periksa apakah alat tertentu dipanggil dengan parameter. |
toolResponse |
Opsional. Periksa apakah alat tertentu memberikan respons yang diharapkan. |
agentResponse |
Opsional. Periksa apakah agen merespons dengan respons yang benar. Peran "agen" tersirat. |
agentTransfer |
Opsional. Periksa apakah agen mengalihkan percakapan ke agen lain. |
updatedVariables |
Opsional. Pastikan agen memperbarui variabel sesi ke nilai yang diharapkan. Juga digunakan untuk merekam pembaruan variabel agen untuk evaluasi emas. |
mockToolResponse |
Opsional. Respons alat untuk meniru, dengan parameter yang diinginkan ditentukan. Parameter yang tidak ditentukan akan dihalusinasi oleh LLM. |
noToolCalls |
Opsional. Periksa apakah tidak ada alat yang dipanggil selama giliran ini. |
ToolCall
| Representasi JSON |
|---|
{ "id": string, "displayName": string, "args": { object }, "parentToolCallId": string, "agentName": string, // Union field |
| Kolom | |
|---|---|
id |
Opsional. ID unik panggilan alat. Jika diisi, klien harus menampilkan hasil eksekusi dengan ID yang cocok di |
displayName |
Hanya output. Nama tampilan alat. |
args |
Opsional. Parameter dan nilai input untuk alat dalam format objek JSON. |
parentToolCallId |
Hanya output. ID panggilan alat yang menyebabkan panggilan ini, saat dikeluarkan oleh sub-agen yang bekerja atas nama panggilan induk. Kosong untuk panggilan tingkat teratas. Memungkinkan klien mengelompokkan pekerjaan sub-agen dalam panggilan yang memulainya, bukan merender setiap langkah sebagai saudara. |
agentName |
Hanya output. Nama agen yang dapat dibaca manusia yang mengeluarkan panggilan ini, misalnya "Arsitek Kontrak". Kosong saat dikeluarkan oleh agen root. |
Kolom union tool_identifier. ID alat yang akan dieksekusi. Alat ini bisa berupa alat yang tetap ada atau alat dari set alat. tool_identifier hanya ada berupa salah satu diantara berikut: |
|
tool |
Opsional. Nama alat yang akan dieksekusi. Format: |
toolsetTool |
Opsional. Alat toolset yang akan dieksekusi. |
Pesan
| Representasi JSON |
|---|
{
"role": string,
"chunks": [
{
object ( |
| Kolom | |
|---|---|
role |
Opsional. Peran dalam percakapan, misalnya, pengguna, agen. |
chunks[] |
Opsional. Konten pesan sebagai serangkaian bagian. |
eventTime |
Opsional. Stempel waktu saat pesan dikirim atau diterima. Tidak boleh digunakan jika pesan adalah bagian dari Menggunakan RFC 3339 yang outputnya akan selalu dinormalisasi Z dan menggunakan 0, 3, 6, atau 9 digit pecahan. Offset selain "Z" juga diterima. Contoh: |
Chunk
| Representasi JSON |
|---|
{ // Union field |
| Kolom | |
|---|---|
Kolom union data. Data potongan. data hanya ada berupa salah satu diantara berikut: |
|
text |
Opsional. Data teks. |
transcript |
Opsional. Transkrip yang terkait dengan audio. |
blob |
Opsional. Data blob. |
payload |
Opsional. Data payload kustom. |
image |
Opsional. Data gambar. |
toolCall |
Opsional. Permintaan eksekusi alat. |
toolResponse |
Opsional. Respons eksekusi alat. |
agentTransfer |
Opsional. Peristiwa transfer agen. |
updatedVariables |
Struct merepresentasikan variabel yang diperbarui dalam percakapan, yang dikelompokkan berdasarkan nama variabel. |
defaultVariables |
Struct merepresentasikan variabel default di awal percakapan, yang dikelompokkan berdasarkan nama variabel. |
Stempel waktu
| Representasi JSON |
|---|
{ "seconds": string, "nanos": integer } |
| Kolom | |
|---|---|
seconds |
Mewakili detik waktu UTC sejak epoch Unix 1970-01-01T00:00:00Z. Harus antara -62135596800 dan 253402300799 inklusif (yang sesuai dengan 0001-01-01T00:00:00Z hingga 9999-12-31T23:59:59Z). |
nanos |
Pecahan detik non-negatif pada resolusi nanodetik. Kolom ini adalah bagian nanodetik dari durasi, bukan alternatif untuk detik. Nilai detik negatif dengan pecahan harus tetap memiliki nilai nanos non-negatif yang dihitung maju dalam waktu. Harus antara 0 dan 999.999.999 inklusif. |
ExpectationLevelMetricsThresholds
| Representasi JSON |
|---|
{ // Union field |
| Kolom | |
|---|---|
Kolom union
|
|
toolInvocationParameterCorrectnessThreshold |
Opsional. Ambang batas keberhasilan untuk kebenaran parameter pemanggilan alat individual. Harus berupa float antara 0 dan 1. Defaultnya adalah 1.0. |
SemanticSimilarityMetricsConfig
| Representasi JSON |
|---|
{ "enableSemanticSimilarityMetrics": boolean } |
| Kolom | |
|---|---|
enableSemanticSimilarityMetrics |
Opsional. Apakah akan menghitung metrik kemiripan semantik untuk evaluasi. |
HallucinationMetricsConfig
| Representasi JSON |
|---|
{ "enableHallucinationMetrics": boolean } |
| Kolom | |
|---|---|
enableHallucinationMetrics |
Opsional. Apakah akan menghitung metrik halusinasi untuk evaluasi. |
Span
| Representasi JSON |
|---|
{
"name": string,
"startTime": string,
"endTime": string,
"duration": string,
"attributes": {
object
},
"childSpans": [
{
object ( |
| Kolom | |
|---|---|
name |
Hanya output. Nama rentang. |
startTime |
Hanya output. Waktu mulai rentang. Menggunakan RFC 3339 yang outputnya akan selalu dinormalisasi Z dan menggunakan 0, 3, 6, atau 9 digit pecahan. Offset selain "Z" juga diterima. Contoh: |
endTime |
Hanya output. Waktu akhir rentang. Menggunakan RFC 3339 yang outputnya akan selalu dinormalisasi Z dan menggunakan 0, 3, 6, atau 9 digit pecahan. Offset selain "Z" juga diterima. Contoh: |
duration |
Hanya output. Durasi rentang. Durasi dalam detik dengan maksimal sembilan digit pecahan, yang diakhiri dengan ' |
attributes |
Hanya output. Atribut nilai kunci yang terkait dengan rentang. |
childSpans[] |
Hanya output. Span turunan yang bertingkat di bawah span ini. |
Durasi
| Representasi JSON |
|---|
{ "seconds": string, "nanos": integer } |
| Kolom | |
|---|---|
seconds |
Detik yang ditandatangani dari rentang waktu. Harus dari -315.576.000.000 hingga +315.576.000.000 inklusif. Catatan: batas ini dihitung dari: 60 dtk/mnt * 60 mnt/j * 24 j/hr * 365,25 hr/thn * 10.000 thn |
nanos |
Pecahan detik bertanda pada resolusi nanodetik rentang waktu. Durasi kurang dari satu detik ditampilkan dengan kolom |
TurnLevelMetricsThresholds
| Representasi JSON |
|---|
{ "semanticSimilarityChannel": enum ( |
| Kolom | |
|---|---|
semanticSimilarityChannel |
Opsional. Saluran kemiripan semantik yang akan digunakan untuk evaluasi. |
Kolom union
|
|
semanticSimilaritySuccessThreshold |
Opsional. Ambang batas keberhasilan untuk kemiripan semantik. Harus berupa bilangan bulat antara 0 dan 4. Defaultnya adalah >= 3. |
Kolom union
|
|
overallToolInvocationCorrectnessThreshold |
Opsional. Ambang batas keberhasilan untuk kebenaran pemanggilan alat secara keseluruhan. Harus berupa float antara 0 dan 1. Defaultnya adalah 1.0. |
Skenario
| Representasi JSON |
|---|
{ "task": string, "userFacts": [ { object ( |
| Kolom | |
|---|---|
task |
Wajib. Tugas yang akan ditargetkan oleh skenario. |
userFacts[] |
Opsional. Fakta pengguna yang akan digunakan oleh skenario. |
maxTurns |
Opsional. Jumlah maksimum giliran yang akan disimulasikan. Nilai maksimum yang diizinkan adalah 100. Nilai defaultnya adalah 100. |
rubrics[] |
Wajib. Rubrik untuk menilai skenario. |
scenarioExpectations[] |
Wajib. ScenarioExpectations untuk mengevaluasi percakapan yang dihasilkan oleh simulasi pengguna. |
variableOverrides |
Opsional. Variabel / Parameter Sesi sebagai konteks untuk sesi, yang dikelompokkan berdasarkan nama variabel. Anggota struct ini akan menggantikan nilai default yang ditetapkan oleh sistem. Perhatikan bahwa ini berbeda dengan fakta pengguna, yang merupakan fakta yang diketahui pengguna. Variabel adalah parameter yang diketahui oleh agen: yaitu MDN (nomor telepon) yang diteruskan oleh sistem telepon. |
taskCompletionBehavior |
Opsional. Tidak digunakan lagi. Gunakan user_goal_behavior sebagai gantinya. |
userGoalBehavior |
Opsional. Perilaku yang diharapkan dari sasaran pengguna. |
evaluationExpectations[] |
Opsional. Ekspektasi evaluasi untuk mengevaluasi percakapan yang dihasilkan oleh simulasi. Format: |
scenarioExecutionMode |
Opsional. Mode eksekusi untuk evaluasi skenario. |
UserFact
| Representasi JSON |
|---|
{ "name": string, "value": string } |
| Kolom | |
|---|---|
name |
Wajib. Nama fakta pengguna. |
value |
Wajib. Nilai fakta pengguna. |
ScenarioExpectation
| Representasi JSON |
|---|
{ // Union field |
| Kolom | |
|---|---|
Kolom union expectation. Ekspektasi untuk mengevaluasi percakapan yang dihasilkan oleh simulasi. expectation hanya ada berupa salah satu diantara berikut: |
|
toolExpectation |
Opsional. Pasangan panggilan dan respons alat yang akan dievaluasi. |
agentResponse |
Opsional. Respons agen yang akan dievaluasi. |
ToolExpectation
| Representasi JSON |
|---|
{ "expectedToolCall": { object ( |
| Kolom | |
|---|---|
expectedToolCall |
Wajib. Panggilan alat yang diharapkan, dengan parameter yang diinginkan ditentukan. Parameter yang tidak ditentukan akan dihalusinasi oleh LLM. |
mockToolResponse |
Wajib. Respons alat untuk meniru, dengan parameter yang diinginkan ditentukan. Parameter yang tidak ditentukan akan dihalusinasi oleh LLM. |
AggregatedMetrics
| Representasi JSON |
|---|
{
"metricsByAppVersion": [
{
object ( |
| Kolom | |
|---|---|
metricsByAppVersion[] |
Hanya output. Metrik gabungan, dikelompokkan menurut ID versi aplikasi. |
MetricsByAppVersion
| Representasi JSON |
|---|
{ "appVersionId": string, "toolMetrics": [ { object ( |
| Kolom | |
|---|---|
appVersionId |
Hanya output. ID versi aplikasi. |
toolMetrics[] |
Hanya output. Metrik untuk setiap alat dalam versi aplikasi ini. |
semanticSimilarityMetrics[] |
Hanya output. Metrik untuk kesamaan semantik dalam versi aplikasi ini. |
hallucinationMetrics[] |
Hanya output. Metrik untuk halusinasi dalam versi aplikasi ini. |
toolCallLatencyMetrics[] |
Hanya output. Metrik untuk latensi panggilan alat dalam versi aplikasi ini. |
turnLatencyMetrics[] |
Hanya output. Metrik untuk latensi belokan dalam versi aplikasi ini. |
passCount |
Hanya output. Jumlah evaluasi yang lulus. |
failCount |
Hanya output. Jumlah kegagalan evaluasi. |
metricsByTurn[] |
Hanya output. Metrik yang diagregasi per giliran dalam versi aplikasi ini. |
ToolMetrics
| Representasi JSON |
|---|
{ "tool": string, "passCount": integer, "failCount": integer } |
| Kolom | |
|---|---|
tool |
Hanya output. Nama alat. |
passCount |
Hanya output. Jumlah keberhasilan alat. |
failCount |
Hanya output. Frekuensi alat gagal. |
SemanticSimilarityMetrics
| Representasi JSON |
|---|
{ "score": number } |
| Kolom | |
|---|---|
score |
Hanya output. Skor kesamaan semantik rata-rata (0-4). |
HallucinationMetrics
| Representasi JSON |
|---|
{ "score": number } |
| Kolom | |
|---|---|
score |
Hanya output. Skor halusinasi rata-rata (0 hingga 1). |
ToolCallLatencyMetrics
| Representasi JSON |
|---|
{ "tool": string, "averageLatency": string } |
| Kolom | |
|---|---|
tool |
Hanya output. Nama alat. |
averageLatency |
Hanya output. Latensi rata-rata panggilan alat. Durasi dalam detik dengan maksimal sembilan digit pecahan, yang diakhiri dengan ' |
TurnLatencyMetrics
| Representasi JSON |
|---|
{ "averageLatency": string } |
| Kolom | |
|---|---|
averageLatency |
Hanya output. Latensi rata-rata giliran. Durasi dalam detik dengan maksimal sembilan digit pecahan, yang diakhiri dengan ' |
MetricsByTurn
| Representasi JSON |
|---|
{ "turnIndex": integer, "toolMetrics": [ { object ( |
| Kolom | |
|---|---|
turnIndex |
Hanya output. Indeks giliran (berbasis 0). |
toolMetrics[] |
Hanya output. Metrik untuk setiap alat dalam giliran ini. |
semanticSimilarityMetrics[] |
Hanya output. Metrik untuk kesamaan semantik dalam giliran ini. |
hallucinationMetrics[] |
Hanya output. Metrik untuk halusinasi dalam giliran ini. |
toolCallLatencyMetrics[] |
Hanya output. Metrik untuk latensi panggilan alat dalam giliran ini. |
turnLatencyMetrics[] |
Hanya output. Metrik untuk latensi giliran dalam giliran ini. |
EvaluationResult
| Representasi JSON |
|---|
{ "name": string, "displayName": string, "createTime": string, "evaluationStatus": enum ( |
| Kolom | |
|---|---|
name |
ID. ID unik hasil evaluasi. Format: |
displayName |
Wajib. Nama tampilan Hasil Evaluasi. Unik dalam Evaluasi. Secara default, formatnya adalah: " |
createTime |
Hanya output. Stempel waktu saat hasil evaluasi dibuat. Menggunakan RFC 3339 yang outputnya akan selalu dinormalisasi Z dan menggunakan 0, 3, 6, atau 9 digit pecahan. Offset selain "Z" juga diterima. Contoh: |
evaluationStatus |
Hanya output. Hasil evaluasi. Hanya diisi jika execution_state adalah COMPLETE. |
evaluationRun |
Hanya output. Jalannya evaluasi yang menghasilkan hasil ini. Format: |
persona |
Hanya output. Persona yang digunakan untuk membuat percakapan untuk hasil evaluasi. |
errorInfo |
Hanya output. Informasi error untuk hasil evaluasi. |
error |
Hanya output. Tidak digunakan lagi: Gunakan |
initiatedBy |
Hanya output. Pengguna yang memulai proses evaluasi yang menghasilkan hasil ini. |
appVersion |
Hanya output. Versi aplikasi yang digunakan untuk membuat percakapan yang menghasilkan hasil ini. Format: |
appVersionDisplayName |
Hanya output. Nama tampilan |
changelog |
Hanya output. Log perubahan versi aplikasi yang digunakan untuk menjalankan evaluasi. Kolom ini diisi jika pengguna menjalankan evaluasi pada versi terbaru/draf. |
changelogCreateTime |
Hanya output. Waktu pembuatan log perubahan versi aplikasi yang digunakan untuk menjalankan evaluasi. Kolom ini diisi jika pengguna menjalankan evaluasi pada versi terbaru/draf. Menggunakan RFC 3339 yang outputnya akan selalu dinormalisasi Z dan menggunakan 0, 3, 6, atau 9 digit pecahan. Offset selain "Z" juga diterima. Contoh: |
executionState |
Hanya output. Status eksekusi hasil evaluasi. |
evaluationMetricsThresholds |
Hanya output. Nilai minimum evaluasi untuk hasil. |
config |
Hanya output. Konfigurasi yang digunakan dalam proses evaluasi yang menghasilkan hasil ini. |
goldenRunMethod |
Hanya output. Metode yang digunakan untuk menjalankan evaluasi standar. |
rootSpan |
Hanya output. Rentang root eksekusi evaluasi, yang mencakup informasi tentang setiap langkah evaluasi. |
outcomeMetadata |
Hanya output. Metadata hasil evaluasi. Hanya diisi jika execution_state adalah COMPLETE. |
Kolom union result. Hasil evaluasi. Hanya diisi jika execution_state adalah COMPLETED. result hanya ada berupa salah satu diantara berikut: |
|
goldenResult |
Hanya output. Hasil evaluasi golden. |
scenarioResult |
Hanya output. Hasil evaluasi skenario. |
GoldenResult
| Representasi JSON |
|---|
{ "turnReplayResults": [ { object ( |
| Kolom | |
|---|---|
turnReplayResults[] |
Hanya output. Hasil menjalankan setiap giliran percakapan emas. |
evaluationExpectationResults[] |
Hanya output. Hasil ekspektasi evaluasi. |
TurnReplayResult
| Representasi JSON |
|---|
{ "conversation": string, "expectationOutcome": [ { object ( |
| Kolom | |
|---|---|
conversation |
Hanya output. Percakapan yang dibuat untuk giliran ini. |
expectationOutcome[] |
Hanya output. Hasil setiap ekspektasi. |
hallucinationResult |
Hanya output. Hasil pemeriksaan halusinasi. |
toolInvocationScore |
Hanya output. Tidak digunakan lagi. Sebagai gantinya, gunakan OverallToolInvocationResult. |
turnLatency |
Hanya output. Durasi giliran. Durasi dalam detik dengan maksimal sembilan digit pecahan, yang diakhiri dengan ' |
toolCallLatencies[] |
Hanya output. Latensi setiap panggilan alat dalam giliran. |
semanticSimilarityResult |
Hanya output. Hasil pemeriksaan kemiripan semantik. |
overallToolInvocationResult |
Hanya output. Hasil pemeriksaan pemanggilan alat secara keseluruhan. |
errorInfo |
Hanya output. Informasi tentang error yang terjadi selama giliran ini. |
spanLatencies[] |
Hanya output. Latensi rentang dalam giliran. |
Kolom union
|
|
toolOrderedInvocationScore |
Hanya output. Skor pemanggilan alat keseluruhan yang diurutkan untuk giliran ini. Ini menunjukkan persentase keseluruhan alat dari belokan yang diharapkan yang benar-benar dipanggil dalam urutan yang diharapkan. |
GoldenExpectationOutcome
| Representasi JSON |
|---|
{ "expectation": { object ( |
| Kolom | |
|---|---|
expectation |
Hanya output. Ekspektasi yang dievaluasi. |
outcome |
Hanya output. Hasil dari ekspektasi. |
semanticSimilarityResult |
Hanya output. Hasil pemeriksaan kemiripan semantik. |
toolInvocationResult |
Hanya output. Hasil pemeriksaan pemanggilan alat. |
Kolom union result. Hasil ekspektasi. result hanya ada berupa salah satu diantara berikut: |
|
observedToolCall |
Hanya output. Hasil ekspektasi panggilan alat. |
observedToolResponse |
Hanya output. Hasil ekspektasi respons alat. |
observedAgentResponse |
Hanya output. Hasil ekspektasi respons agen. |
observedAgentTransfer |
Hanya output. Hasil ekspektasi transfer agen. |
observedPayload |
Hanya output. Payload kustom yang diamati. Tidak ada ekspektasi untuk payload kustom. Kolom ini hanya digunakan untuk penghitungan metrik. Hasilnya selalu DILEWATI. |
SemanticSimilarityResult
| Representasi JSON |
|---|
{ "label": string, "explanation": string, "outcome": enum ( |
| Kolom | |
|---|---|
label |
Hanya output. Label yang terkait dengan setiap skor. Skor 4: Sepenuhnya Konsisten Skor 3: Sebagian Besar Konsisten Skor 2: Sebagian Konsisten (Kekurangan Kecil) Skor 1: Sebagian Besar Tidak Konsisten (Kekurangan Besar) Skor 0: Sepenuhnya Tidak Konsisten / Bertentangan |
explanation |
Hanya output. Penjelasan untuk skor kemiripan semantik. |
outcome |
Hanya output. Hasil pemeriksaan kemiripan semantik. Hal ini ditentukan dengan membandingkan skor dengan semantic_similarity_success_threshold. Jika skor sama dengan atau di atas nilai minimum, hasilnya adalah LULUS. Jika tidak, hasilnya akan GAGAL. |
Kolom union
|
|
score |
Hanya output. Skor kemiripan semantik. Dapat berupa 0, 1, 2, 3, atau 4. |
ToolInvocationResult
| Representasi JSON |
|---|
{ "outcome": enum ( |
| Kolom | |
|---|---|
outcome |
Hanya output. Hasil pemeriksaan pemanggilan alat. Hal ini ditentukan dengan membandingkan parameter_correctness_score dengan nilai minimum. Jika skor sama dengan atau di atas nilai minimum, hasilnya adalah LULUS. Jika tidak, hasilnya akan GAGAL. |
explanation |
Hanya output. Penjelasan teks bebas untuk hasil pemanggilan alat. |
Kolom union
|
|
parameterCorrectnessScore |
Hanya output. Skor kebenaran parameter pemanggilan alat. Ini menunjukkan persentase parameter dari panggilan alat yang diharapkan yang juga ada dalam panggilan alat sebenarnya. |
HallucinationResult
| Representasi JSON |
|---|
{ "label": string, "explanation": string, // Union field |
| Kolom | |
|---|---|
label |
Hanya output. Label yang terkait dengan setiap skor. Skor 1: Dibenarkan Skor 0: Tidak Dibenarkan Skor -1: Tidak Ada Klaim untuk Dinilai |
explanation |
Hanya output. Penjelasan untuk skor halusinasi. |
Kolom union
|
|
score |
Hanya output. Skor halusinasi. Dapat berupa -1, 0, 1. |
ToolCallLatency
| Representasi JSON |
|---|
{ "tool": string, "displayName": string, "startTime": string, "endTime": string, "executionLatency": string } |
| Kolom | |
|---|---|
tool |
Hanya output. Nama alat yang dieksekusi. Format: |
displayName |
Hanya output. Nama tampilan alat. |
startTime |
Hanya output. Waktu mulai eksekusi panggilan alat. Menggunakan RFC 3339 yang outputnya akan selalu dinormalisasi Z dan menggunakan 0, 3, 6, atau 9 digit pecahan. Offset selain "Z" juga diterima. Contoh: |
endTime |
Hanya output. Waktu berakhir eksekusi panggilan alat. Menggunakan RFC 3339 yang outputnya akan selalu dinormalisasi Z dan menggunakan 0, 3, 6, atau 9 digit pecahan. Offset selain "Z" juga diterima. Contoh: |
executionLatency |
Hanya output. Latensi eksekusi panggilan alat. Durasi dalam detik dengan maksimal sembilan digit pecahan, yang diakhiri dengan ' |
OverallToolInvocationResult
| Representasi JSON |
|---|
{ "outcome": enum ( |
| Kolom | |
|---|---|
outcome |
Hanya output. Hasil pemeriksaan pemanggilan alat. Hal ini ditentukan dengan membandingkan tool_invocation_score dengan overall_tool_invocation_correctness_threshold. Jika skor sama dengan atau di atas nilai minimum, hasilnya adalah LULUS. Jika tidak, hasilnya akan GAGAL. |
Kolom union
|
|
toolInvocationScore |
Skor pemanggilan alat keseluruhan untuk giliran ini. Ini menunjukkan persentase keseluruhan alat dari belokan yang diharapkan yang benar-benar dipanggil. |
EvaluationErrorInfo
| Representasi JSON |
|---|
{
"errorType": enum ( |
| Kolom | |
|---|---|
errorType |
Hanya output. Jenis error. |
errorMessage |
Hanya output. Pesan error. |
sessionId |
Hanya output. ID sesi untuk percakapan yang menyebabkan error. |
userFacingErrorMessage |
Hanya output. Pesan error yang ditampilkan kepada pengguna. |
SpanLatency
| Representasi JSON |
|---|
{ "type": enum ( |
| Kolom | |
|---|---|
type |
Hanya output. Jenis rentang. |
displayName |
Hanya output. Nama tampilan rentang. Berlaku untuk rentang alat dan pedoman. |
startTime |
Hanya output. Waktu mulai rentang. Menggunakan RFC 3339 yang outputnya akan selalu dinormalisasi Z dan menggunakan 0, 3, 6, atau 9 digit pecahan. Offset selain "Z" juga diterima. Contoh: |
endTime |
Hanya output. Waktu berakhir rentang. Menggunakan RFC 3339 yang outputnya akan selalu dinormalisasi Z dan menggunakan 0, 3, 6, atau 9 digit pecahan. Offset selain "Z" juga diterima. Contoh: |
executionLatency |
Hanya output. Latensi rentang. Durasi dalam detik dengan maksimal sembilan digit pecahan, yang diakhiri dengan ' |
Kolom union identifier. ID item tertentu berdasarkan jenisnya. identifier hanya ada berupa salah satu diantara berikut: |
|
resource |
Hanya output. Nama resource rentang alat atau pembatasan. |
toolset |
Hanya output. ID alat toolset. |
model |
Hanya output. Nama rentang LLM. |
callback |
Hanya output. Nama rentang callback pengguna. |
EvaluationExpectationResult
| Representasi JSON |
|---|
{
"evaluationExpectation": string,
"prompt": string,
"outcome": enum ( |
| Kolom | |
|---|---|
evaluationExpectation |
Hanya output. Ekspektasi evaluasi. Format: |
prompt |
Hanya output. Perintah yang digunakan untuk evaluasi. |
outcome |
Hanya output. Hasil ekspektasi evaluasi. |
explanation |
Hanya output. Penjelasan untuk hasil. |
ScenarioResult
| Representasi JSON |
|---|
{ "conversation": string, "task": string, "userFacts": [ { object ( |
| Kolom | |
|---|---|
conversation |
Hanya output. Percakapan yang dihasilkan dalam skenario. |
task |
Hanya output. Tugas yang digunakan saat menjalankan skenario untuk hasil ini. |
userFacts[] |
Hanya output. Fakta pengguna yang digunakan oleh skenario untuk hasil ini. |
expectationOutcomes[] |
Hanya output. Hasil setiap ekspektasi. |
rubricOutcomes[] |
Hanya output. Hasil rubrik. |
hallucinationResult[] |
Hanya output. Hasil pemeriksaan halusinasi. Akan ada satu hasil halusinasi untuk setiap giliran dalam percakapan. |
taskCompletionResult |
Hanya output. Hasil pemeriksaan penyelesaian tugas. |
toolCallLatencies[] |
Hanya output. Latensi setiap eksekusi panggilan alat dalam percakapan. |
userGoalSatisfactionResult |
Hanya output. Hasil pemeriksaan kepuasan target pengguna. |
spanLatencies[] |
Hanya output. Latensi rentang dalam percakapan. |
evaluationExpectationResults[] |
Hanya output. Hasil ekspektasi evaluasi. |
Kolom union
|
|
allExpectationsSatisfied |
Hanya output. Apakah semua ekspektasi terpenuhi untuk giliran ini. |
Kolom union
|
|
taskCompleted |
Hanya output. Apakah tugas telah diselesaikan untuk giliran ini. Ini adalah gabungan dari semua ekspektasi yang terpenuhi, tidak ada halusinasi, dan kepuasan tujuan pengguna. |
ScenarioExpectationOutcome
| Representasi JSON |
|---|
{ "expectation": { object ( |
| Kolom | |
|---|---|
expectation |
Hanya output. Ekspektasi yang dievaluasi. |
outcome |
Hanya output. Hasil ScenarioExpectation. |
Kolom union result. Hasil ekspektasi. result hanya ada berupa salah satu diantara berikut: |
|
observedToolCall |
Hanya output. Panggilan alat yang diamati. |
observedAgentResponse |
Hanya output. Respons agen yang diamati. |
ObservedToolCall
| Representasi JSON |
|---|
{ "toolCall": { object ( |
| Kolom | |
|---|---|
toolCall |
Hanya output. Panggilan alat yang diamati. |
toolResponse |
Hanya output. Respons alat yang diamati. |
ScenarioRubricOutcome
| Representasi JSON |
|---|
{ "rubric": string, "scoreExplanation": string, // Union field |
| Kolom | |
|---|---|
rubric |
Hanya output. Rubrik yang digunakan untuk mengevaluasi percakapan. |
scoreExplanation |
Hanya output. Respons pemberi rating terhadap rubrik. |
Kolom union
|
|
score |
Hanya output. Skor percakapan berdasarkan rubrik. |
TaskCompletionResult
| Representasi JSON |
|---|
{ "label": string, "explanation": string, // Union field |
| Kolom | |
|---|---|
label |
Hanya output. Label yang terkait dengan setiap skor. Skor 1: Tugas Selesai Skor 0: Tugas Belum Selesai Skor -1: Sasaran Pengguna Tidak Ditentukan |
explanation |
Hanya output. Penjelasan untuk skor penyelesaian tugas. |
Kolom union
|
|
score |
Hanya output. Skor penyelesaian tugas. Dapat berupa -1, 0, 1 |
UserGoalSatisfactionResult
| Representasi JSON |
|---|
{ "label": string, "explanation": string, // Union field |
| Kolom | |
|---|---|
label |
Hanya output. Label yang terkait dengan setiap skor. Skor 2: Skor Pengalihan yang Lancar 1: Tugas Pengguna Selesai 0: Tugas Pengguna Tidak Selesai Skor -1: Tugas Pengguna Tidak Ditentukan |
explanation |
Hanya output. Penjelasan untuk skor kepuasan tugas pengguna. |
Kolom union
|
|
score |
Hanya output. Skor kepuasan tugas pengguna. Dapat berupa -1, 0, 1, 2. |
EvaluationPersona
| Representasi JSON |
|---|
{
"name": string,
"description": string,
"displayName": string,
"personality": string,
"speechConfig": {
object ( |
| Kolom | |
|---|---|
name |
Wajib. ID unik persona. Format: |
description |
Opsional. Deskripsi persona. |
displayName |
Wajib. Nama tampilan persona. Unik dalam aplikasi. |
personality |
Wajib. Petunjuk bagi agen tentang cara berperilaku dalam evaluasi. |
speechConfig |
Opsional. Konfigurasi cara persona berbicara (setelan TTS). |
SpeechConfig
| Representasi JSON |
|---|
{
"speakingRate": number,
"environment": enum ( |
| Kolom | |
|---|---|
speakingRate |
Opsional. Kecepatan bicara. 1,0 adalah normal. Nilai yang lebih rendah lebih lambat (misalnya, 0,8), nilai yang lebih tinggi lebih cepat (misalnya, 1,5). Berguna untuk menguji cara agen menangani orang yang berbicara cepat. |
environment |
Opsional. Lingkungan audio simulasi. |
voiceId |
Opsional. ID/aksen suara spesifik yang akan digunakan. Contoh: "en-US-Wavenet-D" atau "en-GB-Standard-A" |
Status
| Representasi JSON |
|---|
{ "code": integer, "message": string, "details": [ { "@type": string, field1: ..., ... } ] } |
| Kolom | |
|---|---|
code |
Kode status, harus berupa nilai enum dari |
message |
Pesan error yang ditampilkan ke developer dan seharusnya dalam bahasa Inggris. Setiap pesan error yang ditampilkan kepada pengguna harus dilokalkan dan dikirim di kolom |
details[] |
Daftar pesan yang membawa detail error. Ada seperangkat jenis pesan umum untuk digunakan API. Objek yang berisi kolom tipe arbitrer. Kolom tambahan |
Semua
| Representasi JSON |
|---|
{ "typeUrl": string, "value": string } |
| Kolom | |
|---|---|
typeUrl |
Mengidentifikasi jenis pesan Protobuf yang diserialkan dengan referensi URI yang terdiri dari awalan yang diakhiri dengan garis miring dan nama jenis yang sepenuhnya memenuhi syarat. Contoh: type.googleapis.com/google.protobuf.StringValue String ini harus berisi setidaknya satu karakter Awalan bersifat arbitrer dan implementasi Protobuf diharapkan cukup menghapus semua yang ada hingga dan termasuk Semua string URL jenis harus berupa referensi URI yang valid dengan batasan tambahan (untuk format teks) bahwa konten referensi hanya boleh terdiri dari karakter alfanumerik, escape yang dienkode persen, dan karakter dalam set berikut (tidak termasuk tanda petik terbalik luar): Dalam desain asli |
value |
Berisi serialisasi Protobuf dari jenis yang dijelaskan oleh type_url. String berenkode base64. |
EvaluationMetricsThresholds
| Representasi JSON |
|---|
{ "goldenEvaluationMetricsThresholds": { object ( |
| Kolom | |
|---|---|
goldenEvaluationMetricsThresholds |
Opsional. Nilai minimum metrik evaluasi emas. |
hallucinationMetricBehavior |
Opsional. Tidak digunakan lagi: Gunakan |
goldenHallucinationMetricBehavior |
Opsional. Perilaku metrik halusinasi untuk evaluasi golden dataset. |
scenarioHallucinationMetricBehavior |
Opsional. Perilaku metrik halusinasi untuk evaluasi skenario. |
GoldenEvaluationMetricsThresholds
| Representasi JSON |
|---|
{ "turnLevelMetricsThresholds": { object ( |
| Kolom | |
|---|---|
turnLevelMetricsThresholds |
Opsional. Nilai minimum metrik tingkat belokan. |
expectationLevelMetricsThresholds |
Opsional. Nilai minimum metrik tingkat ekspektasi. |
toolMatchingSettings |
Opsional. Setelan pencocokan alat. Panggilan alat tambahan adalah panggilan alat yang ada dalam eksekusi, tetapi tidak cocok dengan panggilan alat apa pun dalam ekspektasi standar. |
ToolMatchingSettings
| Representasi JSON |
|---|
{
"extraToolCallBehavior": enum ( |
| Kolom | |
|---|---|
extraToolCallBehavior |
Opsional. Perilaku untuk panggilan alat tambahan. Nilai defaultnya adalah GAGAL. |
EvaluationConfig
| Representasi JSON |
|---|
{ "inputAudioConfig": { object ( |
| Kolom | |
|---|---|
inputAudioConfig |
Opsional. Konfigurasi untuk memproses audio input. |
outputAudioConfig |
Opsional. Konfigurasi untuk membuat audio output. |
evaluationChannel |
Opsional. Saluran yang akan dievaluasi. |
toolCallBehaviour |
Opsional. Menentukan apakah evaluasi harus menggunakan panggilan alat asli atau alat palsu. |
InputAudioConfig
| Representasi JSON |
|---|
{
"audioEncoding": enum ( |
| Kolom | |
|---|---|
audioEncoding |
Wajib. Encoding data audio input. |
sampleRateHertz |
Wajib. Frekuensi sampel (dalam Hertz) data audio input. |
noiseSuppressionLevel |
Opsional. Apakah peredam bising diaktifkan pada audio input. Nilai yang tersedia adalah "low", "moderate", "high", "very_high". |
OutputAudioConfig
| Representasi JSON |
|---|
{
"audioEncoding": enum ( |
| Kolom | |
|---|---|
audioEncoding |
Wajib. Encoding data audio output. |
sampleRateHertz |
Wajib. Frekuensi sampel (dalam Hertz) data audio output. |
EvaluationMetricsConfig
| Representasi JSON |
|---|
{ "goldenMetricsConfig": { object ( |
| Kolom | |
|---|---|
goldenMetricsConfig |
Opsional. Konfigurasi untuk metrik utama untuk evaluasi. |
scenarioMetricsConfig |
Opsional. Konfigurasi untuk metrik skenario untuk evaluasi. |
GoldenMetricsConfig
| Representasi JSON |
|---|
{ "semanticSimilarityMetricsConfig": { object ( |
| Kolom | |
|---|---|
semanticSimilarityMetricsConfig |
Opsional. Konfigurasi global untuk metrik kesamaan semantik. |
toolCorrectnessMetricsConfig |
Opsional. Konfigurasi untuk metrik kebenaran alat tingkat giliran. |
stepToolCorrectnessMetricsConfig |
Opsional. Konfigurasi untuk metrik kebenaran alat tingkat langkah. |
ToolCorrectnessMetricsConfig
| Representasi JSON |
|---|
{ "enableToolCorrectnessMetrics": boolean } |
| Kolom | |
|---|---|
enableToolCorrectnessMetrics |
Opsional. Apakah akan menghitung metrik kebenaran alat untuk evaluasi. |
ScenarioMetricsConfig
| Representasi JSON |
|---|
{ "userGoalMetMetricsConfig": { object ( |
| Kolom | |
|---|---|
userGoalMetMetricsConfig |
Opsional. Konfigurasi untuk metrik tercapai sasaran pengguna. |
expectationsMetMetricsConfig |
Opsional. Konfigurasi untuk metrik tingkat ekspektasi. |
UserGoalMetMetricsConfig
| Representasi JSON |
|---|
{ "enableUserGoalMetMetrics": boolean } |
| Kolom | |
|---|---|
enableUserGoalMetMetrics |
Opsional. Apakah akan menghitung metrik tujuan pengguna yang tercapai untuk evaluasi. |
ExpectationsMetMetricsConfig
| Representasi JSON |
|---|
{ "enableExpectationsMetMetrics": boolean } |
| Kolom | |
|---|---|
enableExpectationsMetMetrics |
Opsional. Apakah akan menghitung metrik tingkat ekspektasi untuk evaluasi. |
NullValue
Mewakili JSON null.
NullValue adalah sentinel, menggunakan enum dengan hanya satu nilai untuk merepresentasikan nilai null untuk gabungan jenis Value.
Kolom berjenis NullValue dengan nilai selain 0 dianggap tidak valid. Sebagian besar serializer ProtoJSON akan memancarkan Value dengan null_value yang ditetapkan sebagai null JSON, terlepas dari nilai bilangan bulatnya, dan akan melakukan perjalanan pulang pergi ke nilai 0.
| Enum | |
|---|---|
NULL_VALUE |
Nilai null. |
ComparisonType
Jenis perbandingan yang didukung untuk memeriksa respons agen.
| Enum | |
|---|---|
COMPARISON_TYPE_UNSPECIFIED |
Jenis perbandingan tidak ditentukan. Perilaku default adalah SEMANTIC_SIMILARITY untuk respons agen dan panggilan alat. |
EQUALS |
Pencocokan string persis. |
CONTAINS |
Pencocokan substring (memeriksa apakah string yang diharapkan terdapat dalam respons sebenarnya). |
SEMANTIC_SIMILARITY |
Kecocokan kemiripan semantik (mengevaluasi kemiripan makna menggunakan LLM). |
SemanticSimilarityChannel
Saluran kemiripan semantik yang akan digunakan.
| Enum | |
|---|---|
SEMANTIC_SIMILARITY_CHANNEL_UNSPECIFIED |
Metrik tidak ditentukan. Nilai defaultnya adalah TEXT. |
TEXT |
Menggunakan kemiripan semantik teks. |
AUDIO |
Gunakan kesamaan semantik audio. |
HallucinationMetricBehavior
Perilaku metrik halusinasi. Terlepas dari perilaku tersebut, metrik akan selalu dihitung. Perbedaannya adalah bahwa jika dinonaktifkan, metrik tidak digunakan untuk menghitung skor evaluasi keseluruhan.
| Enum | |
|---|---|
HALLUCINATION_METRIC_BEHAVIOR_UNSPECIFIED |
Perilaku metrik halusinasi tidak ditentukan. |
DISABLED |
Nonaktifkan metrik halusinasi. |
ENABLED |
Aktifkan metrik halusinasi. |
TaskCompletionBehavior
Perilaku yang diharapkan dari tugas pengguna. Hal ini digunakan untuk menentukan apakah skenario berhasil.
| Enum | |
|---|---|
TASK_COMPLETION_BEHAVIOR_UNSPECIFIED |
Perilaku tidak ditentukan. Akan ditetapkan secara default ke TASK_SATISFIED. |
TASK_SATISFIED |
Tugas pengguna harus berhasil diselesaikan. |
TASK_REJECTED |
Tugas pengguna harus ditolak. |
UserGoalBehavior
Perilaku yang diharapkan dari sasaran pengguna. Hal ini digunakan untuk menentukan apakah skenario berhasil.
| Enum | |
|---|---|
USER_GOAL_BEHAVIOR_UNSPECIFIED |
Perilaku tidak ditentukan. Secara default akan ditetapkan ke USER_GOAL_SATISFIED. |
USER_GOAL_SATISFIED |
Tujuan pengguna harus berhasil diselesaikan. |
USER_GOAL_REJECTED |
Tujuan pengguna harus ditolak. |
USER_GOAL_IGNORED |
Abaikan status sasaran pengguna. |
ScenarioExecutionMode
Mode eksekusi untuk evaluasi skenario.
| Enum | |
|---|---|
SCENARIO_EXECUTION_MODE_UNSPECIFIED |
Mode eksekusi tidak ditentukan. Nilai defaultnya adalah QUALITY_OPTIMIZED. |
QUALITY_OPTIMIZED |
Mode yang dioptimalkan untuk kualitas. |
SPEED_OPTIMIZED |
Mode yang dioptimalkan untuk kecepatan. |
Hasil
Hasil evaluasi atau ekspektasi.
| Enum | |
|---|---|
OUTCOME_UNSPECIFIED |
Hasil evaluasi tidak ditentukan. |
PASS |
Evaluasi/Ekspektasi terpenuhi. Dalam kasus evaluasi, hal ini berarti semua ekspektasi terpenuhi. |
FAIL |
Evaluasi/Ekspektasi gagal. Dalam kasus evaluasi, hal ini berarti setidaknya satu ekspektasi tidak terpenuhi. |
SKIPPED |
Evaluasi/Ekspektasi dilewati. |
ErrorType
Jenis error
| Enum | |
|---|---|
ERROR_TYPE_UNSPECIFIED |
Jenis error tidak ditentukan. |
RUNTIME_FAILURE |
Kegagalan selama eksekusi runtime. |
CONVERSATION_RETRIEVAL_FAILURE |
Gagal mengambil percakapan dari CES Runtime. |
METRIC_CALCULATION_FAILURE |
Gagal menghitung metrik / hasil. |
EVALUATION_UPDATE_FAILURE |
Gagal memperbarui evaluasi. |
QUOTA_EXHAUSTED |
Kehabisan kuota. |
USER_SIMULATION_FAILURE |
Kegagalan selama simulasi pengguna. |
Jenis
Jenis rentang. Nilai tambahan dapat ditambahkan di masa mendatang.
| Enum | |
|---|---|
TYPE_UNSPECIFIED |
Nilai default. Nilai ini tidak digunakan. |
TOOL |
Rentang panggilan alat. |
USER_CALLBACK |
Rentang callback pengguna. |
GUARDRAIL |
Rentang pembatas. |
LLM |
Rentang LLM. |
BackgroundEnvironment
Lingkungan audio simulasi.
| Enum | |
|---|---|
BACKGROUND_ENVIRONMENT_UNSPECIFIED |
Lingkungan latar belakang tidak ditentukan. |
CALL_CENTER |
Lingkungan pusat panggilan. |
TRAFFIC |
Lingkungan kebisingan lalu lintas. |
KIDS_NOISE |
Lingkungan bising anak-anak. |
CAFE |
Lingkungan kafe. |
ExecutionState
Status eksekusi hasil evaluasi.
| Enum | |
|---|---|
EXECUTION_STATE_UNSPECIFIED |
Status eksekusi hasil evaluasi tidak ditentukan. |
QUEUED |
Eksekusi hasil evaluasi diantrekan. |
RUNNING |
Eksekusi hasil evaluasi sedang berjalan. |
COMPLETED |
Eksekusi hasil evaluasi telah selesai. |
ERROR |
Eksekusi hasil evaluasi gagal karena error internal. |
CANCELLED |
Eksekusi hasil evaluasi dibatalkan. |
ExtraToolCallBehavior
Menentukan perilaku saat panggilan alat tambahan ditemukan. Panggilan alat tambahan adalah panggilan alat yang ada dalam eksekusi, tetapi tidak cocok dengan panggilan alat apa pun dalam ekspektasi standar.
| Enum | |
|---|---|
EXTRA_TOOL_CALL_BEHAVIOR_UNSPECIFIED |
Perilaku tidak ditentukan. Nilai defaultnya adalah GAGAL. |
FAIL |
Gagal dalam evaluasi jika panggilan alat tambahan ditemukan. |
ALLOW |
Izinkan panggilan alat tambahan. |
AudioEncoding
AudioEncoding menentukan format encoding untuk data audio.
| Enum | |
|---|---|
AUDIO_ENCODING_UNSPECIFIED |
Encoding audio tidak ditentukan. |
LINEAR16 |
Encoding audio PCM linear 16-bit. |
MULAW |
Sampel 8-bit yang memadatkan sampel audio 14-bit menggunakan PCMU/mu-law G.711. |
ALAW |
Sampel 8-bit yang memadatkan sampel audio 14-bit menggunakan G.711 PCMU/A-law. |
EvaluationChannel
Saluran yang akan dievaluasi.
| Enum | |
|---|---|
EVALUATION_CHANNEL_UNSPECIFIED |
Saluran evaluasi tidak ditentukan. |
TEXT |
Saluran evaluasi khusus teks. |
AUDIO |
Channel evaluasi audio. |
EvaluationToolCallBehaviour
Mengonfigurasi perilaku panggilan alat untuk menjalankan evaluasi.
| Enum | |
|---|---|
EVALUATION_TOOL_CALL_BEHAVIOUR_UNSPECIFIED |
Perilaku panggilan alat tidak ditentukan. Secara default akan memanggil alat asli. |
REAL |
Gunakan panggilan alat sebenarnya. |
FAKE |
Menggunakan panggilan alat palsu. |
GoldenRunMethod
Metode yang digunakan untuk menjalankan evaluasi.
| Enum | |
|---|---|
GOLDEN_RUN_METHOD_UNSPECIFIED |
Metode eksekusi tidak ditentukan. |
STABLE |
Jalankan evaluasi sebagai pemutaran ulang yang stabil, dengan setiap giliran merupakan sesi unik dengan giliran yang diharapkan sebelumnya disisipkan sebagai konteks. |
NAIVE |
Jalankan evaluasi sebagai pemutaran ulang naif, dengan menjalankan satu sesi tanpa konteks yang disisipkan. |
OutcomeMetadata
Metadata tentang hasil evaluasi.
| Enum | |
|---|---|
OUTCOME_METADATA_UNSPECIFIED |
Metadata hasil tidak ditentukan. |
GRACEFUL_HANDOFF |
Evaluasi menghasilkan pengalihan yang lancar kepada perwakilan manusia. |
Anotasi Alat
Anotasi alat dikirim ke klien MCP untuk menjelaskan risiko dasar alat tertentu. Sebagian besar klien memperlakukan petunjuk ini sebagai tidak tepercaya, tetapi petunjuk ini dapat digunakan untuk memutuskan kapan perintah konfirmasi dapat dikirim ke pengguna.
Selain string judul, petunjuk boolean berikut ditentukan sebagai berikut:
readOnlyHint: Jika benar, alat tidak akan mengubah lingkungannya. Default: false.destructiveHint: Jika benar (true), alat dapat melakukan tindakan merusak. Jika salah (false), alat hanya dapat melakukan tindakan tambahan. Default: true.idempotentHint: Jika benar (true), memanggil alat berulang kali dengan argumen yang sama tidak akan memberikan efek tambahan pada lingkungannya. Default: false.openWorldHint: Jika benar, alat dapat berinteraksi dengan 'dunia terbuka' entitas eksternal. Jika salah (false), alat hanya dapat berinteraksi dengan entitas internal. Misalnya, alat penelusuran web akan menjadi open world, sedangkan alat memori tidak akan menjadi open world.
Petunjuk Destruktif: ❌ | Petunjuk Idempoten: ✅ | Petunjuk Hanya Baca: ✅ | Petunjuk Dunia Terbuka: ❌