Avaliação de agentes

Este documento descreve como usar a avaliação de agentes para medir e melhorar a performance, a segurança e a qualidade dos seus agentes.

Para saber mais sobre a avaliação de modelos, consulte Visão geral do serviço de avaliação de IA generativa.

Resumo do procedimento

Fase Atividade Objetivo
Design Definir casos de avaliação Especificar tarefas do agente e resultados esperados.
Execução Executar inferências Gerar traces de conversas reais ou simuladas.
Pontuação Calcular métricas Classificar traces usando avaliadores automatizados (sucesso da tarefa, segurança).
Refinamento Otimizar o agente Propor e verificar melhorias nas instruções ou ferramentas.

Processo de avaliação

A avaliação segue um fluxo de trabalho estruturado e iterativo:

  1. Definir casos de avaliação: um caso de avaliação é uma especificação que define a tarefa de um agente. Um caso de avaliação pode incluir uma ou várias etapas de conversa, o contexto da conversa (o estado do agente) e uma especificação para simular respostas do usuário durante a inferência.
  2. Executar inferências: inferência é a execução de um caso de avaliação. Se um caso de avaliação contiver um plano de conversa, as respostas do usuário serão simuladas durante a inferência.
  3. Gerar traces: cada execução de inferência captura o comportamento do agente em um trace. Um trace é um registro factual e imutável do comportamento do agente, incluindo entradas, respostas e chamadas de ferramentas do modelo.
  4. Calcular métricas: métricas são pontuações calculadas para cada trace usando avaliadores pré-criados ou personalizados. Algumas métricas, como Correspondência exata, são baseadas em referência e exigem um caso de avaliação com uma resposta de referência. Outras, como Utilidade, são sem referência e avaliam o trace por conta própria. Essa avaliação automatizada permite que você pontue traces capturados do tráfego de produção ou registros externos, independentemente de um ambiente de teste gerenciado.
  5. Realizar análise: analise métricas, rubricas e veredictos para identificar os principais problemas do agente, vincular os problemas do agente aos casos de teste e gerar insights para melhoria.
  6. Otimizar o agente: use a otimização para gerenciar todo o ciclo de avaliação. Esse processo automatizado analisa os resultados, propõe melhorias ao agente e executa o processo de forma iterativa para verificar os ganhos de performance.

Fluxo de trabalho de avaliação

É possível integrar a avaliação em duas etapas principais do fluxo de trabalho:

  • Iteração de desenvolvimento local: avalie um agente baseado no Kit de Desenvolvimento de Agente (ADK, na sigla em inglês) localmente para iterar rapidamente na engenharia de comandos e nas configurações de ferramentas.
  • Avaliação de agentes implantados: meça a qualidade dos agentes implantados analisando traces históricos ou executando benchmarks sintéticos em endpoints de agentes.

Recursos principais

A avaliação de agentes ajuda a criar um conjunto de avaliação inicial, mesmo sem dados de teste. Os recursos a seguir ajudam a automatizar o processo de geração de casos de teste e refinar seus sistemas de agentes:

  • Geração de cenários e simulação de usuários: gere automaticamente cenários de teste sintéticos diversos e multiturno com base nas instruções e definições de ferramentas do agente. Essa automação permite que você comece a testar imediatamente, eliminando a necessidade de criar casos de teste iniciais manualmente.

  • Simulação de ambiente: intercepte chamadas de ferramentas específicas para injetar comportamentos personalizados, dados simulados ou erros simulados (como erros HTTP 503 erros ou picos de latência). Essa simulação permite validar a resiliência do agente sem afetar os back-ends de produção.

  • Avaliação multiturno: avalie automaticamente todo o histórico de conversas usando avaliadores automáticos multiturno. Esses avaliadores analisam a extração de intents, geram rubricas dinamicamente e fornecem veredictos de validação objetivos para ajudar a garantir a adesão às instruções.

  • Otimização de comandos: gere e valide instruções de sistema refinadas de forma programática usando a otimização de comandos. A estrutura de otimização identifica pontos de falha e propõe atualizações direcionadas de forma iterativa.

Avaliar com assistentes de programação de IA

Se você usa a CLI do Gemini ou outro assistente de programação de IA, é possível instalar habilidades de agente que ensinam ao assistente a metodologia de avaliação de agentes descrita nesta página. Cada habilidade fornece o fluxo de trabalho de avaliação, o esquema do conjunto de dados, orientações para a seleção de métricas e etapas de análise de falhas diretamente na sessão de programação. Assim, o assistente pode criar, classificar e melhorar as avaliações sem sair do editor.

As instruções de instalação seguem cada habilidade.

Habilidade de avaliação da Agents CLI

Um fluxo de trabalho orientado pela CLI para avaliar e otimizar agentes do Kit de Desenvolvimento de Agente (ADK) usando os comandos agents-cli eval. Essa habilidade abrange:

  • Preparar conjuntos de dados de avaliação e sintetizar cenários multiturno com simulação de usuários
  • Executar inferência, classificar traces e analisar clusters de falhas
  • Iterar em comandos e ferramentas com o loop de correção de avaliação

Para instalá-lo, execute o seguinte comando:

npx skills add https://github.com/google/agents-cli --skill google-agents-cli-eval

Habilidade de flywheel do serviço de avaliação de IA generativa da Agent Platform

Um playbook orientado por SDK para avaliar e melhorar modelos e agentes usando o serviço de avaliação de IA generativa da Agent Platform, usando o SDK de avaliação de IA generativa da Agent Platform (client.evals.evaluate()). Essa habilidade abrange:

  • Criar conjuntos de dados de avaliação de traces de sessão, DataFrames ou geração sintética
  • Selecionar, configurar e gravar métricas personalizadas com pontuação de LLM como juiz
  • Analisar veredictos de rubricas e padrões de perda para gerar melhorias concretas

Para instalá-lo, execute o seguinte comando:

npx skills add https://github.com/google/skills --skill agent-platform-eval-flywheel

A seguir