Avaliação de agentes

Este documento descreve como usar a avaliação de agente para medir e melhorar a performance, a segurança e a qualidade dos seus agentes.

Para saber mais sobre a avaliação de modelos, consulte Visão geral do serviço de avaliação de IA generativa.

Resumo do procedimento

Fase Atividade Objetivo
Design Definir casos de avaliação Especificar tarefas do agente e resultados esperados.
Execução Executar inferências Gerar traces de conversas reais ou simuladas.
Pontuação Calcular métricas Classificar traces usando avaliadores automatizados (sucesso da tarefa, segurança).
Refinamento Otimizar o agente Propor e verificar melhorias nas instruções ou ferramentas.

Processo de avaliação

A avaliação segue um fluxo de trabalho estruturado e iterativo:

  1. Definir casos de avaliação: um caso de avaliação é uma especificação que define a tarefa de um agente. Um caso de avaliação pode incluir uma ou várias etapas de conversa, o contexto da conversa (o estado do agente) e uma especificação para simular respostas do usuário durante a inferência.
  2. Executar inferências: inferência é a execução de um caso de avaliação. Se um caso de avaliação contiver um plano de conversa, as respostas do usuário serão simuladas durante a inferência.
  3. Gerar traces: cada execução de inferência captura o comportamento do agente em um trace. Um trace é um registro factual e imutável do comportamento do agente, incluindo entradas, respostas e chamadas de ferramentas do modelo.
  4. Calcular métricas: métricas são pontuações calculadas para cada trace usando avaliadores pré-criados ou personalizados. Algumas métricas, como Correspondência exata, são baseadas em referência e exigem um caso de avaliação com uma resposta de referência. Outras, como Utilidade, são sem referência e avaliam o trace por conta própria. Essa avaliação automatizada permite que você pontue traces capturados do tráfego de produção ou de registros externos, independentemente de um ambiente de teste gerenciado.
  5. Realizar análise: analise métricas, rubricas e veredictos para identificar os principais problemas do agente, vincular os problemas do agente aos casos de teste e gerar insights para melhoria.
  6. Otimizar o agente: use a otimização para gerenciar todo o ciclo de avaliação. Esse processo automatizado analisa os resultados, propõe melhorias ao agente e executa o processo de forma iterativa para verificar os ganhos de performance.

Fluxo de trabalho de avaliação

É possível integrar a avaliação em duas etapas principais do fluxo de trabalho:

  • Iteração de desenvolvimento local: avalie um agente baseado no Kit de Desenvolvimento de Agente (ADK, na sigla em inglês) localmente para iterar rapidamente na engenharia de comandos e nas configurações de ferramentas.
  • Avaliação de agente implantado: meça a qualidade dos agentes implantados analisando traces históricos ou executando benchmarks sintéticos em endpoints.

Recursos principais

A avaliação de agentes ajuda a criar um conjunto de avaliação inicial, mesmo sem dados de teste. Os recursos a seguir ajudam a automatizar o processo de geração de casos de teste e refinar seus sistemas de agentes:

  • Geração de cenários e simulação de usuários: gere automaticamente cenários de teste sintéticos diversos e multiturno com base nas instruções e definições de ferramentas do agente. Essa automação permite que você comece a testar imediatamente, eliminando a necessidade de criar casos de teste iniciais manualmente.

  • Simulação de ambiente: intercepte chamadas de ferramentas específicas para injetar comportamentos personalizados, dados simulados ou erros simulados (como erros HTTP 503 erros ou picos de latência). Essa simulação permite validar a resiliência do agente sem afetar os back-ends de produção.

  • Avaliação multiturno: avalie automaticamente históricos de conversas inteiras usando avaliadores automáticos multiturno. Esses avaliadores analisam a extração de intents, geram rubricas dinamicamente e fornecem veredictos de validação objetivos para ajudar a garantir a conformidade com as instruções.

  • Otimização de comandos: gere e valide instruções de sistema refinadas de forma programática usando a otimização de comandos. A estrutura de otimização identifica pontos de falha e propõe atualizações direcionadas de forma iterativa.

Avaliar com assistentes de programação de IA

Se você usa a CLI do Gemini ou outro assistente de programação de IA, é possível instalar habilidades do agente que ensinam ao assistente a metodologia de avaliação de agente descrita nesta página. Cada habilidade fornece o fluxo de trabalho de avaliação, o esquema do conjunto de dados, orientações para a seleção de métricas e etapas de análise de falhas diretamente na sessão de programação. Assim, o assistente pode criar, classificar e melhorar as avaliações sem sair do editor.

As instruções de instalação seguem cada habilidade.

Habilidade de avaliação da Agents CLI

Um fluxo de trabalho orientado pela CLI para avaliar e otimizar agentes do Kit de Desenvolvimento de Agente (ADK) usando os comandos agents-cli eval. Essa habilidade abrange:

  • Preparar conjuntos de dados de avaliação e sintetizar cenários multiturno com simulação de usuários
  • Executar inferência, classificar traces e analisar clusters de falhas
  • Iterar em comandos e ferramentas com o loop de correção de avaliação

Para instalá-lo, execute o seguinte comando:

npx skills add https://github.com/google/agents-cli --skill google-agents-cli-eval

Habilidade de flywheel do serviço de avaliação de IA generativa da Agent Platform

Um playbook orientado pelo SDK para avaliar e melhorar modelos e agentes usando o serviço de avaliação de IA generativa da Agent Platform, usando o SDK de avaliação de IA generativa da Agent Platform (client.evals.evaluate()). Essa habilidade abrange:

  • Criar conjuntos de dados de avaliação de traces de sessão, DataFrames ou geração sintética
  • Selecionar, configurar e gravar métricas personalizadas com pontuação de LLM como juiz
  • Analisar veredictos de rubricas e padrões de perda para gerar melhorias concretas

Para instalá-lo, execute o seguinte comando:

npx skills add https://github.com/google/skills --skill agent-platform-eval-flywheel

A seguir