Nesta página, você encontra uma lista completa de métricas gerenciadas baseadas em rubricas oferecidas pelo serviço de avaliação de IA generativa, que podem ser usadas no cliente de IA generativa no SDK da Agent Platform.
Para mais informações sobre a avaliação orientada por testes, consulte Definir métricas de avaliação.
Visão geral
O serviço de avaliação de IA generativa oferece uma lista de métricas gerenciadas baseadas em rubricas para o
framework de avaliação orientada por testes:
Para métricas com rubricas adaptativas, a maioria inclui o fluxo de trabalho para geração e validação de rubricas para cada comando. Você pode executá-los separadamente, se necessário. Consulte Executar uma avaliação para mais detalhes.
Para métricas com rubricas estáticas, nenhuma rubrica por comando é gerada. Para mais detalhes sobre as saídas pretendidas, consulte Detalhes da métrica.
Cada métrica gerenciada baseada em rubrica tem um número de controle de versão. Por padrão, a métrica usa a versão mais recente, mas é possível fixar uma versão específica, se necessário:
from vertexai import types
text_quality_metric = types.RubricMetric.TEXT_QUALITY
general_quality_v1 = types.RubricMetric.GENERAL_QUALITY(version='v1')
Compatibilidade com versões anteriores
Para métricas oferecidas como modelos de solicitação de métrica, ainda é possível acessar as métricas pontuais pelo cliente de IA generativa no SDK da Agent Platform usando a mesma abordagem. As métricas aos pares não são compatíveis com o cliente de IA generativa no SDK da Agent Platform. No entanto, consulte Executar uma avaliação para comparar dois modelos na mesma avaliação.
from vertexai import types
# Access metrics represented by metric prompt template examples
coherence = types.RubricMetric.COHERENCE
fluency = types.RubricMetric.FLUENCY
Detalhes das métricas gerenciadas
Esta seção lista as métricas gerenciadas com detalhes como tipo, entradas obrigatórias e saída esperada:
Qualidade geral
| Versão mais recente |
general_quality_v1 |
| Tipo |
Rubricas adaptativas |
| Descrição |
Uma métrica abrangente de instruções adaptáveis que avalia a qualidade geral da resposta de um modelo. Ele gera e avalia automaticamente uma ampla variedade de critérios com base no conteúdo do comando. Esse é o ponto de partida recomendado para a maioria das avaliações. |
| Como acessar no SDK |
types.RubricMetric.GENERAL_QUALITY |
| Entrada |
prompt
response
- (Opcional)
rubric_groups
Se você já tiver rubricas geradas, envie-as diretamente para avaliação.
|
| Saída |
score
rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
|
| Número de chamadas de LLM |
6 chamadas para o Gemini 2.5 Flash |
Qualidade do texto
| Versão mais recente |
text_quality_v1 |
| Tipo |
Rubricas adaptativas |
| Descrição |
Uma métrica de instruções adaptáveis direcionada que avalia especificamente a qualidade linguística da resposta. Ele avalia aspectos como fluência, coerência e gramática. |
| Como acessar no SDK |
types.RubricMetric.TEXT_QUALITY |
| Entrada |
prompt
response
- (Opcional)
rubric_groups
Se você já tiver rubricas geradas, envie-as diretamente para avaliação.
|
| Saída |
score
rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
|
| Número de chamadas de LLM |
6 chamadas para o Gemini 2.5 Flash |
Seguir a instrução
| Versão mais recente |
instruction_following_v1 |
| Tipo |
Rubricas adaptativas |
| Descrição |
Uma métrica direcionada de rubricas adaptáveis que mede a aderência da resposta às restrições e instruções específicas fornecidas no comando. |
| Como acessar no SDK |
types.RubricMetric.INSTRUCTION_FOLLOWING |
| Entrada |
prompt
response
- (Opcional)
rubric_groups
Se você já tiver rubricas geradas, envie-as diretamente para avaliação.
|
| Saída |
score (taxa de aprovação)
rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
|
| Número de chamadas de LLM |
6 chamadas para o Gemini 2.5 Flash |
Embasamento
| Versão mais recente |
grounding_v1 |
| Tipo |
Rubricas estáticas |
| Descrição |
Uma métrica baseada em pontuação que verifica a veracidade dos fatos e a consistência. Ele verifica se a resposta do modelo é fundamentada no contexto. |
| Como acessar no SDK |
types.RubricMetric.GROUNDING |
| Entrada |
|
| Saída |
A pontuação tem um intervalo de 0-1. Se alguma frase for rotulada como unsupported ou contradictory, a pontuação será 0. Caso contrário, a pontuação representa a proporção de frases rotuladas como supported ou no_rad em relação ao número total de frases.
O campo explanation é uma string JSON que contém uma lista de objetos por frase com o seguinte esquema:
[
{
"sentence": "string",
"label": "supported | unsupported | contradictory | no_rad",
"rationale": "string",
"excerpt": "string or null"
}
]
Cada objeto contém os seguintes campos:
sentence: a frase que está sendo analisada na resposta.
label: a classificação da frase, uma destas:
supported: a frase é implicada pelo contexto.
unsupported: a frase não é implicada pelo contexto.
contradictory: a frase é falsificada pelo contexto.
no_rad: a frase não exige atribuição factual (por exemplo, opiniões, saudações, perguntas ou exonerações de responsabilidade).
rationale: uma breve explicação para a atribuição do rótulo.
excerpt (presente para os rótulos supported e contradictory): um trecho relevante do contexto que apoia ou contradiz a frase.
|
| Número de chamadas de LLM |
1 chamada para o Gemini 2.5 Flash |
Segurança
| Versão mais recente |
safety_v1 |
| Tipo |
Rubricas estáticas |
| Descrição |
Uma métrica baseada em pontuação que avalia se a resposta do modelo violou uma ou mais das seguintes políticas:
- PII e dados demográficos
- Discurso de ódio
- Conteúdo perigoso
- Assédio
- Sexualmente explícito
|
| Como acessar no SDK |
types.RubricMetric.SAFETY |
| Entrada |
|
| Saída |
Para a pontuação, 0 é inseguro e 1 é seguro.
O campo de explicação inclui as políticas violadas.
|
| Número de chamadas de LLM |
10 chamadas para o Gemini 2.5 Flash |
Qualidade geral multiturno
| Versão mais recente |
multi_turn_general_quality_v1 |
| Tipo |
Rubricas adaptativas |
| Descrição |
Uma métrica de rubricas adaptáveis que avalia a qualidade geral da resposta de um modelo no contexto de um diálogo multiturno. |
| Como acessar no SDK |
types.RubricMetric.MULTI_TURN_GENERAL_QUALITY |
| Entrada |
prompt com conversas multiturno
response
- (Opcional)
rubric_groups
Se você já tiver rubricas geradas, envie-as diretamente para avaliação.
|
| Saída |
score
- rubricas e veredictos correspondentes
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
|
| Número de chamadas de LLM |
6 chamadas para o Gemini 2.5 Flash |
Qualidade do texto multiturno
| Versão mais recente |
multi_turn_text_quality_v1 |
| Tipo |
Rubricas adaptativas |
| Descrição |
Uma métrica de rubricas adaptáveis que avalia a qualidade do texto da resposta de um modelo no contexto de um diálogo multiturno. |
| Como acessar no SDK |
types.RubricMetric.TEXT_QUALITY |
| Entrada |
prompt com conversas multiturno
response
- (Opcional)
rubric_groups
Se você já tiver rubricas geradas, envie-as diretamente para avaliação.
|
| Saída |
score
rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
|
| Número de chamadas de LLM |
6 chamadas para o Gemini 2.5 Flash |
Correspondência da resposta final do agente
| Versão mais recente |
final_response_match_v2 |
| Tipo |
Rubricas estáticas |
| Descrição |
Uma métrica que avalia a qualidade da resposta final de um agente de IA comparando-a a uma resposta de referência fornecida (informação empírica). |
| Como acessar no SDK |
types.RubricMetric.FINAL_RESPONSE_MATCH |
| Entrada |
prompt
response
reference
|
| Saída |
Pontuação
- 1: resposta válida que corresponde à referência.
- 0: resposta inválida que não corresponde à referência.
Explicação
|
| Número de chamadas de LLM |
5 chamadas para o Gemini 2.5 Flash |
Resposta final do agente sem referência
| Versão mais recente |
final_response_reference_free_v1 |
| Tipo |
Rubricas adaptativas |
| Descrição |
Uma métrica de instruções adaptáveis que avalia a qualidade da resposta final de um agente de IA sem precisar de uma resposta de referência.
Você precisa fornecer rubricas para essa métrica, já que ela não é compatível com rubricas geradas automaticamente. |
| Como acessar no SDK |
types.RubricMetric.FINAL_RESPONSE_REFERENCE_FREE |
| Entrada |
prompt
response
rubric_groups
|
| Saída |
score
rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
|
| Número de chamadas de LLM |
5 chamadas para o Gemini 2.5 Flash |
Qualidade da resposta final do agente
| Versão mais recente |
final_response_quality_v1 |
| Tipo |
Rubricas adaptativas |
| Descrição |
Uma métrica abrangente de instruções adaptáveis que avalia a qualidade geral da resposta de um agente. Ele gera automaticamente diversos critérios com base na configuração do agente (declarações e instruções do desenvolvedor para ferramentas disponíveis ao agente) e no comando do usuário. Em seguida, avalia os critérios gerados com base no uso de ferramentas em eventos intermediários e na resposta final do agente. |
| Como acessar no SDK |
types.RubricMetric.FINAL_RESPONSE_QUALITY |
| Entrada |
prompt
response
developer_instruction
tool_declarations (pode ser uma lista vazia)
intermediate_events (contém chamadas e respostas de função, pode ser uma lista vazia)
- (Opcional)
rubric_groups (se você já tiver rubricas geradas, poderá fornecê-las diretamente para avaliação)
|
| Saída |
score
rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
|
| Número de chamadas de LLM |
5 chamadas para o Gemini 2.5 Flash e 1 chamada para o Gemini 2.5 Pro |
Alucinação de agentes
| Versão mais recente |
hallucination_v1 |
| Tipo |
Rubricas estáticas |
| Descrição |
Uma métrica baseada em pontuação que verifica a veracidade dos fatos e a consistência das respostas de texto segmentando a resposta em declarações menores. Ela verifica se as declarações têm embasamento ou não com base no uso de ferramentas nos eventos intermediários.
Ela também pode ser usada para avaliar respostas de texto intermediárias ao definir a flag evaluate_intermediate_nl_responses como "true".
|
| Como acessar no SDK |
types.RubricMetric.HALLUCINATION |
| Entrada |
response
developer_instruction
tool_declarations (pode ser uma lista vazia)
intermediate_events (contém chamadas e respostas de função, pode ser uma lista vazia)
evaluate_intermediate_nl_responses (o padrão é False)
|
| Saída |
score
explanation e verdicts correspondente
A pontuação tem um intervalo de 0-1 e representa a proporção de frases rotuladas como supported ou no_rad em relação ao número total de frases.
O campo explanation é uma string JSON que contém uma lista de objetos por evento com o seguinte esquema:
[
{
"response": "string",
"score": "double",
"explanation": [
{
"sentence": "string",
"label": "supported | unsupported | contradictory | disputed | no_rad",
"rationale": "string",
"supporting_excerpt": "string or null",
"contradicting_excerpt": "string or null"
}
]
}
]
Cada entrada explanation contém um objeto por frase segmentada com os seguintes campos:
sentence: a frase exata extraída durante a etapa de segmentação de frases.
label: a classificação da frase, uma destas:
supported: a frase é implicada pelo contexto.
unsupported: a frase não é implicada pelo contexto.
contradictory: a frase é falsificada pelo contexto.
disputed: o contexto contém informações de apoio e contraditórias.
no_rad: a frase não exige atribuição factual (por exemplo, opiniões, saudações, perguntas ou exonerações de responsabilidade).
rationale: uma breve explicação para a atribuição do rótulo.
supporting_excerpt (presente nos rótulos supported e disputed): um trecho relevante do contexto que apoia a frase.
contradicting_excerpt (presente para os rótulos contradictory e disputed): um trecho relevante do contexto que contradiz a frase.
|
| Número de chamadas de LLM |
2 chamadas para o Gemini 2.5 Flash |
| Versão mais recente |
tool_use_quality_v1 |
| Tipo |
Rubricas adaptativas |
| Descrição |
Uma métrica direcionada de rubricas adaptáveis que avalia a seleção de ferramentas apropriadas, o uso correto de parâmetros e a adesão à sequência de operações especificada. |
| Como acessar no SDK |
types.RubricMetric.TOOL_USE_QUALITY |
| Entrada |
prompt
developer_instruction
tool_declarations (pode ser uma lista vazia)
intermediate_events (contém chamadas e respostas de função, pode ser uma lista vazia)
- (Opcional)
rubric_groups (se você já tiver rubricas geradas, poderá fornecê-las diretamente para avaliação)
|
| Saída |
score
rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
|
| Número de chamadas de LLM |
5 chamadas para o Gemini 2.5 Flash e 1 chamada para o Gemini 2.5 Pro |
Sucesso da tarefa multiturno do agente
| Versão mais recente |
multi_turn_task_success_v1 |
| Tipo |
Rubricas adaptativas |
| Descrição |
Uma métrica de rubricas adaptáveis que avalia se o agente atendeu aos objetivos do usuário em uma conversa completa multiturno. Ela se concentra em resultados e confirmações observáveis nas respostas do agente, em vez de processos intermediários, como chamadas de ferramentas específicas ou etapas de raciocínio.
A métrica funciona em três etapas:
- Extração de intenção: identifica as metas e intenções do usuário na conversa.
- Geração de rubricas: cria critérios com base nas intents extraídas, nas instruções do agente e nas definições de ferramentas.
- Validação da rubrica: valida as respostas gerais do agente em relação às rubricas geradas.
|
| Como acessar no SDK |
types.RubricMetric.MULTI_TURN_TASK_SUCCESS |
| Entrada |
agent_eval_data (rastreamento de conversa multiturno, incluindo entradas, respostas e chamadas de ferramentas do modelo)
|
| Saída |
score
rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
|
| Número de chamadas de LLM |
2 chamadas para o Gemini 3.1 Pro e 5 chamadas para o Gemini 3 Flash |
| Versão mais recente |
multi_turn_tool_use_quality_v1 |
| Tipo |
Rubricas adaptativas |
| Descrição |
Uma métrica de rubricas adaptáveis que avalia a correção técnica e semântica das chamadas de ferramentas do agente em uma conversa completa multiturno. Ele verifica se o agente selecionou as ferramentas corretas, preencheu os argumentos corretamente e seguiu os esquemas de ferramentas para cada objetivo do usuário.
A métrica funciona em três etapas:
- Extração de intenção: identifica as metas e intenções do usuário na conversa.
- Geração de rubrica: mapeia cada intenção para a seleção de ferramentas esperada, a correção de argumentos e os critérios de conformidade de esquema.
- Validação de rubrica: valida as chamadas de ferramenta reais do agente em relação às rubricas geradas.
|
| Como acessar no SDK |
types.RubricMetric.MULTI_TURN_TOOL_USE_QUALITY |
| Entrada |
agent_eval_data (rastreamento de conversa multiturno, incluindo entradas, respostas e chamadas de ferramentas do modelo)
|
| Saída |
score
rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
|
| Número de chamadas de LLM |
2 chamadas para o Gemini 3.1 Pro e 5 chamadas para o Gemini 3 Flash |
Qualidade da trajetória multiturno do agente
| Versão mais recente |
multi_turn_trajectory_quality_v1 |
| Tipo |
Rubricas adaptativas |
| Descrição |
Uma métrica de rubricas adaptáveis que avalia a qualidade da trajetória de execução detalhada do agente em uma conversa completa multiturno. Ele se concentra na estrutura lógica e na validade técnica do caminho do agente, e não apenas na resposta final.
A métrica funciona em três etapas:
- Extração de intenção: identifica as metas e intenções do usuário na conversa.
- Geração de rubricas: produz critérios em três dimensões: validade causal (sequência correta de roteamento de ferramentas, rastreamento de estado e transmissão de dados), eficiência (minimização de etapas desnecessárias) e robustez adaptativa (tratamento de casos extremos e erros).
- Validação da rubrica: valida o caminho de execução real do agente em relação às rubricas geradas.
|
| Como acessar no SDK |
types.RubricMetric.MULTI_TURN_TRAJECTORY_QUALITY |
| Entrada |
agent_eval_data (rastreamento de conversa multiturno, incluindo entradas, respostas e chamadas de ferramentas do modelo)
|
| Saída |
score
rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
|
| Número de chamadas de LLM |
2 chamadas para o Gemini 3.1 Pro e 5 chamadas para o Gemini 3 Flash |
Qualidade da conversão de texto em imagem do Gecko
| Versão mais recente |
gecko_text2image_v1 |
| Tipo |
Rubricas adaptativas |
| Descrição |
A métrica de conversão de texto em imagem Gecko é um método adaptativo baseado em rubrica para avaliar a qualidade de uma imagem gerada em relação ao comando de texto correspondente. Ele funciona gerando um conjunto de perguntas com base no comando, que servem como uma rubrica detalhada e específica para o comando. Em seguida, um modelo responde a essas perguntas com base na imagem gerada. |
| Como acessar no SDK |
types.RubricMetric.GECKO_TEXT2IMAGE |
| Entrada |
prompt
response: precisa ser dados de arquivo com tipo MIME de imagem.
|
| Saída |
score
rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
|
| Número de chamadas de LLM |
2 chamadas para o Gemini 2.5 Flash |
Qualidade de texto para vídeo do Gecko
| Versão mais recente |
gecko_text2video_v1 |
| Tipo |
Rubricas adaptativas |
| Descrição |
A métrica de texto para vídeo Gecko é um método adaptável baseado em instruções para avaliar a qualidade de um vídeo gerado em relação ao comando de texto correspondente. Ele funciona gerando um conjunto de perguntas com base no comando, que servem como uma rubrica detalhada e específica para o comando. Em seguida, um modelo responde a essas perguntas com base no vídeo gerado. |
| Como acessar no SDK |
types.RubricMetric.GECKO_TEXT2VIDEO |
| Entrada |
prompt
response: precisa ser dados de arquivo com tipo MIME de vídeo.
|
| Saída |
score
rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
|
| Número de chamadas de LLM |
2 chamadas para o Gemini 2.5 Flash |
A seguir