Detalhes das métricas gerenciadas com base em rubricas

Nesta página, você encontra uma lista completa de métricas gerenciadas baseadas em rubricas oferecidas pelo serviço de avaliação de IA generativa, que podem ser usadas no cliente de IA generativa no SDK da Agent Platform.

Para mais informações sobre a avaliação orientada por testes, consulte Definir métricas de avaliação.

Visão geral

O serviço de avaliação de IA generativa oferece uma lista de métricas gerenciadas baseadas em rubricas para o framework de avaliação orientada por testes:

  • Para métricas com rubricas adaptativas, a maioria inclui o fluxo de trabalho para geração e validação de rubricas para cada comando. Você pode executá-los separadamente, se necessário. Consulte Executar uma avaliação para mais detalhes.

  • Para métricas com rubricas estáticas, nenhuma rubrica por comando é gerada. Para mais detalhes sobre as saídas pretendidas, consulte Detalhes da métrica.

Cada métrica gerenciada baseada em rubrica tem um número de controle de versão. Por padrão, a métrica usa a versão mais recente, mas é possível fixar uma versão específica, se necessário:

from vertexai import types

text_quality_metric = types.RubricMetric.TEXT_QUALITY
general_quality_v1 = types.RubricMetric.GENERAL_QUALITY(version='v1')

Compatibilidade com versões anteriores

Para métricas oferecidas como modelos de solicitação de métrica, ainda é possível acessar as métricas pontuais pelo cliente de IA generativa no SDK da Agent Platform usando a mesma abordagem. As métricas aos pares não são compatíveis com o cliente de IA generativa no SDK da Agent Platform. No entanto, consulte Executar uma avaliação para comparar dois modelos na mesma avaliação.

from vertexai import types

# Access metrics represented by metric prompt template examples
coherence = types.RubricMetric.COHERENCE
fluency = types.RubricMetric.FLUENCY

Detalhes das métricas gerenciadas

Esta seção lista as métricas gerenciadas com detalhes como tipo, entradas obrigatórias e saída esperada:

Qualidade geral

Versão mais recente general_quality_v1
Tipo Rubricas adaptativas
Descrição Uma métrica abrangente de instruções adaptáveis que avalia a qualidade geral da resposta de um modelo. Ele gera e avalia automaticamente uma ampla variedade de critérios com base no conteúdo do comando. Esse é o ponto de partida recomendado para a maioria das avaliações.
Como acessar no SDK types.RubricMetric.GENERAL_QUALITY
Entrada
  • prompt
  • response
  • (Opcional) rubric_groups
Se você já tiver rubricas geradas, envie-as diretamente para avaliação.
Saída
  • score
  • rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
Número de chamadas de LLM 6 chamadas para o Gemini 2.5 Flash

Qualidade do texto

Versão mais recente text_quality_v1
Tipo Rubricas adaptativas
Descrição Uma métrica de instruções adaptáveis direcionada que avalia especificamente a qualidade linguística da resposta. Ele avalia aspectos como fluência, coerência e gramática.
Como acessar no SDK types.RubricMetric.TEXT_QUALITY
Entrada
  • prompt
  • response
  • (Opcional) rubric_groups
Se você já tiver rubricas geradas, envie-as diretamente para avaliação.
Saída
  • score
  • rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
Número de chamadas de LLM 6 chamadas para o Gemini 2.5 Flash

Seguir a instrução

Versão mais recente instruction_following_v1
Tipo Rubricas adaptativas
Descrição Uma métrica direcionada de rubricas adaptáveis que mede a aderência da resposta às restrições e instruções específicas fornecidas no comando.
Como acessar no SDK types.RubricMetric.INSTRUCTION_FOLLOWING
Entrada
  • prompt
  • response
  • (Opcional) rubric_groups
Se você já tiver rubricas geradas, envie-as diretamente para avaliação.
Saída
  • score (taxa de aprovação)
  • rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
Número de chamadas de LLM 6 chamadas para o Gemini 2.5 Flash

Embasamento

Versão mais recente grounding_v1
Tipo Rubricas estáticas
Descrição Uma métrica baseada em pontuação que verifica a veracidade dos fatos e a consistência. Ele verifica se a resposta do modelo é fundamentada no contexto.
Como acessar no SDK types.RubricMetric.GROUNDING
Entrada
  • prompt
  • response
  • context
Saída
  • score
  • explanation
A pontuação tem um intervalo de 0-1. Se alguma frase for rotulada como unsupported ou contradictory, a pontuação será 0. Caso contrário, a pontuação representa a proporção de frases rotuladas como supported ou no_rad em relação ao número total de frases.

O campo explanation é uma string JSON que contém uma lista de objetos por frase com o seguinte esquema:
[
  {
    "sentence": "string",
    "label": "supported | unsupported | contradictory | no_rad",
    "rationale": "string",
    "excerpt": "string or null"
  }
]
Cada objeto contém os seguintes campos:
  • sentence: a frase que está sendo analisada na resposta.
  • label: a classificação da frase, uma destas:
    • supported: a frase é implicada pelo contexto.
    • unsupported: a frase não é implicada pelo contexto.
    • contradictory: a frase é falsificada pelo contexto.
    • no_rad: a frase não exige atribuição factual (por exemplo, opiniões, saudações, perguntas ou exonerações de responsabilidade).
  • rationale: uma breve explicação para a atribuição do rótulo.
  • excerpt (presente para os rótulos supported e contradictory): um trecho relevante do contexto que apoia ou contradiz a frase.
Número de chamadas de LLM 1 chamada para o Gemini 2.5 Flash

Segurança

Versão mais recente safety_v1
Tipo Rubricas estáticas
Descrição Uma métrica baseada em pontuação que avalia se a resposta do modelo violou uma ou mais das seguintes políticas:
  • PII e dados demográficos
  • Discurso de ódio
  • Conteúdo perigoso
  • Assédio
  • Sexualmente explícito
Como acessar no SDK types.RubricMetric.SAFETY
Entrada
  • prompt
  • response
Saída
  • score
  • explanation
Para a pontuação, 0 é inseguro e 1 é seguro.
O campo de explicação inclui as políticas violadas.
Número de chamadas de LLM 10 chamadas para o Gemini 2.5 Flash

Qualidade geral multiturno

Versão mais recente multi_turn_general_quality_v1
Tipo Rubricas adaptativas
Descrição Uma métrica de rubricas adaptáveis que avalia a qualidade geral da resposta de um modelo no contexto de um diálogo multiturno.
Como acessar no SDK types.RubricMetric.MULTI_TURN_GENERAL_QUALITY
Entrada
  • prompt com conversas multiturno
  • response
  • (Opcional) rubric_groups
Se você já tiver rubricas geradas, envie-as diretamente para avaliação.
Saída
  • score
  • rubricas e veredictos correspondentes
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
Número de chamadas de LLM 6 chamadas para o Gemini 2.5 Flash

Qualidade do texto multiturno

Versão mais recente multi_turn_text_quality_v1
Tipo Rubricas adaptativas
Descrição Uma métrica de rubricas adaptáveis que avalia a qualidade do texto da resposta de um modelo no contexto de um diálogo multiturno.
Como acessar no SDK types.RubricMetric.TEXT_QUALITY
Entrada
  • prompt com conversas multiturno
  • response
  • (Opcional) rubric_groups
Se você já tiver rubricas geradas, envie-as diretamente para avaliação.
Saída
  • score
  • rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
Número de chamadas de LLM 6 chamadas para o Gemini 2.5 Flash

Correspondência da resposta final do agente

Versão mais recente final_response_match_v2
Tipo Rubricas estáticas
Descrição Uma métrica que avalia a qualidade da resposta final de um agente de IA comparando-a a uma resposta de referência fornecida (informação empírica).
Como acessar no SDK types.RubricMetric.FINAL_RESPONSE_MATCH
Entrada
  • prompt
  • response
  • reference
Saída Pontuação
  • 1: resposta válida que corresponde à referência.
  • 0: resposta inválida que não corresponde à referência.
Explicação
Número de chamadas de LLM 5 chamadas para o Gemini 2.5 Flash

Resposta final do agente sem referência

Versão mais recente final_response_reference_free_v1
Tipo Rubricas adaptativas
Descrição Uma métrica de instruções adaptáveis que avalia a qualidade da resposta final de um agente de IA sem precisar de uma resposta de referência.
Você precisa fornecer rubricas para essa métrica, já que ela não é compatível com rubricas geradas automaticamente.
Como acessar no SDK types.RubricMetric.FINAL_RESPONSE_REFERENCE_FREE
Entrada
  • prompt
  • response
  • rubric_groups
Saída
  • score
  • rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
Número de chamadas de LLM 5 chamadas para o Gemini 2.5 Flash

Qualidade da resposta final do agente

Versão mais recente final_response_quality_v1
Tipo Rubricas adaptativas
Descrição Uma métrica abrangente de instruções adaptáveis que avalia a qualidade geral da resposta de um agente. Ele gera automaticamente diversos critérios com base na configuração do agente (declarações e instruções do desenvolvedor para ferramentas disponíveis ao agente) e no comando do usuário. Em seguida, avalia os critérios gerados com base no uso de ferramentas em eventos intermediários e na resposta final do agente.
Como acessar no SDK types.RubricMetric.FINAL_RESPONSE_QUALITY
Entrada
  • prompt
  • response
  • developer_instruction
  • tool_declarations (pode ser uma lista vazia)
  • intermediate_events (contém chamadas e respostas de função, pode ser uma lista vazia)
  • (Opcional) rubric_groups (se você já tiver rubricas geradas, poderá fornecê-las diretamente para avaliação)
Saída
  • score
  • rubrics e verdicts correspondente

A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
Número de chamadas de LLM 5 chamadas para o Gemini 2.5 Flash e 1 chamada para o Gemini 2.5 Pro

Alucinação de agentes

Versão mais recente hallucination_v1
Tipo Rubricas estáticas
Descrição Uma métrica baseada em pontuação que verifica a veracidade dos fatos e a consistência das respostas de texto segmentando a resposta em declarações menores. Ela verifica se as declarações têm embasamento ou não com base no uso de ferramentas nos eventos intermediários. Ela também pode ser usada para avaliar respostas de texto intermediárias ao definir a flag evaluate_intermediate_nl_responses como "true".
Como acessar no SDK types.RubricMetric.HALLUCINATION
Entrada
  • response
  • developer_instruction
  • tool_declarations (pode ser uma lista vazia)
  • intermediate_events (contém chamadas e respostas de função, pode ser uma lista vazia)
  • evaluate_intermediate_nl_responses (o padrão é False)
Saída
  • score
  • explanation e verdicts correspondente
A pontuação tem um intervalo de 0-1 e representa a proporção de frases rotuladas como supported ou no_rad em relação ao número total de frases.

O campo explanation é uma string JSON que contém uma lista de objetos por evento com o seguinte esquema:
[
  {
    "response": "string",
    "score": "double",
    "explanation": [
      {
        "sentence": "string",
        "label": "supported | unsupported | contradictory | disputed | no_rad",
        "rationale": "string",
        "supporting_excerpt": "string or null",
        "contradicting_excerpt": "string or null"
      }
    ]
  }
]
Cada entrada explanation contém um objeto por frase segmentada com os seguintes campos:
  • sentence: a frase exata extraída durante a etapa de segmentação de frases.
  • label: a classificação da frase, uma destas:
    • supported: a frase é implicada pelo contexto.
    • unsupported: a frase não é implicada pelo contexto.
    • contradictory: a frase é falsificada pelo contexto.
    • disputed: o contexto contém informações de apoio e contraditórias.
    • no_rad: a frase não exige atribuição factual (por exemplo, opiniões, saudações, perguntas ou exonerações de responsabilidade).
  • rationale: uma breve explicação para a atribuição do rótulo.
  • supporting_excerpt (presente nos rótulos supported e disputed): um trecho relevante do contexto que apoia a frase.
  • contradicting_excerpt (presente para os rótulos contradictory e disputed): um trecho relevante do contexto que contradiz a frase.
Número de chamadas de LLM 2 chamadas para o Gemini 2.5 Flash

Qualidade do uso de ferramentas do agente

Versão mais recente tool_use_quality_v1
Tipo Rubricas adaptativas
Descrição Uma métrica direcionada de rubricas adaptáveis que avalia a seleção de ferramentas apropriadas, o uso correto de parâmetros e a adesão à sequência de operações especificada.
Como acessar no SDK types.RubricMetric.TOOL_USE_QUALITY
Entrada
  • prompt
  • developer_instruction
  • tool_declarations (pode ser uma lista vazia)
  • intermediate_events (contém chamadas e respostas de função, pode ser uma lista vazia)
  • (Opcional) rubric_groups (se você já tiver rubricas geradas, poderá fornecê-las diretamente para avaliação)
Saída
  • score
  • rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
Número de chamadas de LLM 5 chamadas para o Gemini 2.5 Flash e 1 chamada para o Gemini 2.5 Pro

Sucesso da tarefa multiturno do agente

Versão mais recente multi_turn_task_success_v1
Tipo Rubricas adaptativas
Descrição Uma métrica de rubricas adaptáveis que avalia se o agente atendeu aos objetivos do usuário em uma conversa completa multiturno. Ela se concentra em resultados e confirmações observáveis nas respostas do agente, em vez de processos intermediários, como chamadas de ferramentas específicas ou etapas de raciocínio.

A métrica funciona em três etapas:
  1. Extração de intenção: identifica as metas e intenções do usuário na conversa.
  2. Geração de rubricas: cria critérios com base nas intents extraídas, nas instruções do agente e nas definições de ferramentas.
  3. Validação da rubrica: valida as respostas gerais do agente em relação às rubricas geradas.
Como acessar no SDK types.RubricMetric.MULTI_TURN_TASK_SUCCESS
Entrada
  • agent_eval_data (rastreamento de conversa multiturno, incluindo entradas, respostas e chamadas de ferramentas do modelo)
Saída
  • score
  • rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
Número de chamadas de LLM 2 chamadas para o Gemini 3.1 Pro e 5 chamadas para o Gemini 3 Flash

Qualidade do uso de ferramentas multiturno do agente

Versão mais recente multi_turn_tool_use_quality_v1
Tipo Rubricas adaptativas
Descrição Uma métrica de rubricas adaptáveis que avalia a correção técnica e semântica das chamadas de ferramentas do agente em uma conversa completa multiturno. Ele verifica se o agente selecionou as ferramentas corretas, preencheu os argumentos corretamente e seguiu os esquemas de ferramentas para cada objetivo do usuário.

A métrica funciona em três etapas:
  1. Extração de intenção: identifica as metas e intenções do usuário na conversa.
  2. Geração de rubrica: mapeia cada intenção para a seleção de ferramentas esperada, a correção de argumentos e os critérios de conformidade de esquema.
  3. Validação de rubrica: valida as chamadas de ferramenta reais do agente em relação às rubricas geradas.
Como acessar no SDK types.RubricMetric.MULTI_TURN_TOOL_USE_QUALITY
Entrada
  • agent_eval_data (rastreamento de conversa multiturno, incluindo entradas, respostas e chamadas de ferramentas do modelo)
Saída
  • score
  • rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
Número de chamadas de LLM 2 chamadas para o Gemini 3.1 Pro e 5 chamadas para o Gemini 3 Flash

Qualidade da trajetória multiturno do agente

Versão mais recente multi_turn_trajectory_quality_v1
Tipo Rubricas adaptativas
Descrição Uma métrica de rubricas adaptáveis que avalia a qualidade da trajetória de execução detalhada do agente em uma conversa completa multiturno. Ele se concentra na estrutura lógica e na validade técnica do caminho do agente, e não apenas na resposta final.

A métrica funciona em três etapas:
  1. Extração de intenção: identifica as metas e intenções do usuário na conversa.
  2. Geração de rubricas: produz critérios em três dimensões: validade causal (sequência correta de roteamento de ferramentas, rastreamento de estado e transmissão de dados), eficiência (minimização de etapas desnecessárias) e robustez adaptativa (tratamento de casos extremos e erros).
  3. Validação da rubrica: valida o caminho de execução real do agente em relação às rubricas geradas.
Como acessar no SDK types.RubricMetric.MULTI_TURN_TRAJECTORY_QUALITY
Entrada
  • agent_eval_data (rastreamento de conversa multiturno, incluindo entradas, respostas e chamadas de ferramentas do modelo)
Saída
  • score
  • rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
Número de chamadas de LLM 2 chamadas para o Gemini 3.1 Pro e 5 chamadas para o Gemini 3 Flash

Qualidade da conversão de texto em imagem do Gecko

Versão mais recente gecko_text2image_v1
Tipo Rubricas adaptativas
Descrição A métrica de conversão de texto em imagem Gecko é um método adaptativo baseado em rubrica para avaliar a qualidade de uma imagem gerada em relação ao comando de texto correspondente. Ele funciona gerando um conjunto de perguntas com base no comando, que servem como uma rubrica detalhada e específica para o comando. Em seguida, um modelo responde a essas perguntas com base na imagem gerada.
Como acessar no SDK types.RubricMetric.GECKO_TEXT2IMAGE
Entrada
  • prompt
  • response: precisa ser dados de arquivo com tipo MIME de imagem.
Saída
  • score
  • rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
Número de chamadas de LLM 2 chamadas para o Gemini 2.5 Flash

Qualidade de texto para vídeo do Gecko

Versão mais recente gecko_text2video_v1
Tipo Rubricas adaptativas
Descrição A métrica de texto para vídeo Gecko é um método adaptável baseado em instruções para avaliar a qualidade de um vídeo gerado em relação ao comando de texto correspondente. Ele funciona gerando um conjunto de perguntas com base no comando, que servem como uma rubrica detalhada e específica para o comando. Em seguida, um modelo responde a essas perguntas com base no vídeo gerado.
Como acessar no SDK types.RubricMetric.GECKO_TEXT2VIDEO
Entrada
  • prompt
  • response: precisa ser dados de arquivo com tipo MIME de vídeo.
Saída
  • score
  • rubrics e verdicts correspondente
A pontuação representa a taxa de aprovação da resposta com base nas rubricas.
Número de chamadas de LLM 2 chamadas para o Gemini 2.5 Flash

A seguir