Este documento descreve como usar a avaliação de agentes para medir e melhorar a performance, a segurança e a qualidade dos seus agentes.
Para saber mais sobre a avaliação de modelos, consulte Visão geral do serviço de avaliação de IA generativa.
Resumo do procedimento
| Fase | Atividade | Objetivo |
|---|---|---|
| Design | Definir casos de avaliação | Especificar tarefas do agente e resultados esperados. |
| Execução | Executar inferências | Gerar traces de conversas reais ou simuladas. |
| Pontuação | Calcular métricas | Classificar traces usando avaliadores automatizados (sucesso da tarefa, segurança). |
| Refinamento | Otimizar o agente | Propor e verificar melhorias nas instruções ou ferramentas. |
Processo de avaliação
A avaliação segue um fluxo de trabalho estruturado e iterativo:
- Definir casos de avaliação: um caso de avaliação é uma especificação que define a tarefa de um agente. Um caso de avaliação pode incluir uma ou várias etapas de conversa, o contexto da conversa (o estado do agente) e uma especificação para simular respostas do usuário durante a inferência.
- Executar inferências: inferência é a execução de um caso de avaliação. Se um caso de avaliação contiver um plano de conversa, as respostas do usuário serão simuladas durante a inferência.
- Gerar traces: cada execução de inferência captura o comportamento do agente em um trace. Um trace é um registro factual e imutável do comportamento do agente, incluindo entradas, respostas e chamadas de ferramentas do modelo.
- Calcular métricas: métricas são pontuações calculadas para cada trace usando avaliadores pré-criados ou personalizados. Algumas métricas, como Correspondência exata, são baseadas em referência e exigem um caso de avaliação com uma resposta de referência. Outras, como Utilidade, são sem referência e avaliam o trace por conta própria. Essa avaliação automatizada permite que você pontue traces capturados do tráfego de produção ou registros externos, independentemente de um ambiente de teste gerenciado.
- Realizar análise: analise métricas, rubricas e veredictos para identificar os principais problemas do agente, vincular os problemas do agente aos casos de teste e gerar insights para melhoria.
- Otimizar o agente: use a otimização para gerenciar todo o ciclo de avaliação. Esse processo automatizado analisa os resultados, propõe melhorias ao agente e executa o processo de forma iterativa para verificar os ganhos de performance.
Fluxo de trabalho de avaliação
É possível integrar a avaliação em duas etapas principais do fluxo de trabalho:
- Iteração de desenvolvimento local: avalie um agente baseado no Kit de Desenvolvimento de Agente (ADK, na sigla em inglês) localmente para iterar rapidamente na engenharia de comandos e nas configurações de ferramentas.
- Avaliação de agentes implantados: meça a qualidade dos agentes implantados analisando traces históricos ou executando benchmarks sintéticos em endpoints de agentes.
Recursos principais
A avaliação de agentes ajuda a criar um conjunto de avaliação inicial, mesmo sem dados de teste. Os recursos a seguir ajudam a automatizar o processo de geração de casos de teste e refinar seus sistemas de agentes:
Geração de cenários e simulação de usuários: gere automaticamente cenários de teste sintéticos diversos e multiturno com base nas instruções e definições de ferramentas do agente. Essa automação permite que você comece a testar imediatamente, eliminando a necessidade de criar casos de teste iniciais manualmente.
Simulação de ambiente: intercepte chamadas de ferramentas específicas para injetar comportamentos personalizados, dados simulados ou erros simulados (como erros HTTP 503 erros ou picos de latência). Essa simulação permite validar a resiliência do agente sem afetar os back-ends de produção.
Avaliação multiturno: avalie automaticamente todo o histórico de conversas usando avaliadores automáticos multiturno. Esses avaliadores analisam a extração de intents, geram rubricas dinamicamente e fornecem veredictos de validação objetivos para ajudar a garantir a adesão às instruções.
Otimização de comandos: gere e valide instruções de sistema refinadas de forma programática usando a otimização de comandos. A estrutura de otimização identifica pontos de falha e propõe atualizações direcionadas de forma iterativa.
Avaliar com assistentes de programação de IA
Se você usa a CLI do Gemini ou outro assistente de programação de IA, é possível instalar habilidades de agente que ensinam ao assistente a metodologia de avaliação de agentes descrita nesta página. Cada habilidade fornece o fluxo de trabalho de avaliação, o esquema do conjunto de dados, orientações para a seleção de métricas e etapas de análise de falhas diretamente na sessão de programação. Assim, o assistente pode criar, classificar e melhorar as avaliações sem sair do editor.
As instruções de instalação seguem cada habilidade.
Habilidade de avaliação da Agents CLI
Um fluxo de trabalho orientado pela CLI para avaliar e otimizar agentes do Kit de Desenvolvimento de Agente (ADK) usando os comandos agents-cli eval. Essa habilidade abrange:
- Preparar conjuntos de dados de avaliação e sintetizar cenários multiturno com simulação de usuários
- Executar inferência, classificar traces e analisar clusters de falhas
- Iterar em comandos e ferramentas com o loop de correção de avaliação
Para instalá-lo, execute o seguinte comando:
npx skills add https://github.com/google/agents-cli --skill google-agents-cli-eval
Habilidade de flywheel do serviço de avaliação de IA generativa da Agent Platform
Um playbook orientado por SDK para avaliar e melhorar modelos e agentes usando o serviço de avaliação de IA generativa da Agent Platform, usando o SDK de avaliação de IA generativa da Agent Platform (client.evals.evaluate()). Essa habilidade abrange:
- Criar conjuntos de dados de avaliação de traces de sessão, DataFrames ou geração sintética
- Selecionar, configurar e gravar métricas personalizadas com pontuação de LLM como juiz
- Analisar veredictos de rubricas e padrões de perda para gerar melhorias concretas
Para instalá-lo, execute o seguinte comando:
npx skills add https://github.com/google/skills --skill agent-platform-eval-flywheel