Evaluación de agentes

En este documento, se describe cómo usar la evaluación de agentes para medir y mejorar el rendimiento, la seguridad y la calidad de tus agentes.

Para obtener más información sobre la evaluación de modelos, consulta la descripción general del servicio de evaluación de IA generativa.

Resumen del procedimiento

Fase Actividad Objetivo
Diseño Define casos de evaluación Especifica las tareas del agente y los resultados esperados.
Ejecución Ejecuta inferencias Generar registros de conversaciones simuladas o reales
Puntuación Cómo calcular métricas Calificar los registros con evaluadores automáticos (éxito de la tarea, seguridad)
Refinamiento Agente de optimización Proponer y verificar mejoras en las instrucciones o herramientas

Proceso de evaluación

La evaluación sigue un flujo de trabajo estructurado e iterativo:

  1. Define casos de evaluación: Un caso de evaluación es una especificación que define la tarea de un agente. Un caso de evaluación puede incluir uno o varios pasos de conversación, el contexto de la conversación (el estado del agente) y una especificación para simular las respuestas del usuario durante la inferencia.
  2. Ejecuta inferencias: La inferencia es la ejecución de un caso de evaluación. Si un caso de evaluación contiene un plan de conversación, las respuestas del usuario se simulan durante la inferencia.
  3. Genera registros: Cada ejecución de inferencia captura el comportamiento del agente en un registro. Un registro es un registro inmutable y fáctico del comportamiento del agente, incluidas las entradas del modelo, las respuestas y las llamadas a herramientas.
  4. Métricas de cálculo: Las métricas son las puntuaciones que se calculan para cada registro de seguimiento con evaluadores prediseñados o personalizados. Algunas métricas, como la coincidencia exacta, se basan en referencias y requieren un caso de evaluación con una respuesta de referencia. Otras, como Utilidad, son independientes de referencias y evalúan el registro por sí solas. Esta evaluación automatizada te permite calificar los registros capturados del tráfico de producción o los registros externos, independientemente de un entorno de prueba administrado.
  5. Realiza análisis: Analiza las métricas, las rúbricas y los veredictos para identificar los problemas clave del agente, vincularlos con los casos de prueba y generar estadísticas para mejorar.
  6. Optimiza el agente: Usa la optimización para administrar todo el ciclo de evaluación. Este proceso automatizado analiza los resultados, propone mejoras al agente y vuelve a ejecutar el proceso de forma iterativa para verificar las ganancias de rendimiento.

Flujo de trabajo de evaluación

Puedes integrar la evaluación en dos etapas principales de tu flujo de trabajo:

  • Iteración de desarrollo local: Evalúa un agente basado en el Kit de desarrollo de agentes (ADK) de forma local para iterar rápidamente en la ingeniería de instrucciones y las configuraciones de herramientas.
  • Evaluación de agentes implementados: Mide la calidad de los agentes implementados analizando registros históricos o ejecutando comparativas sintéticas en los extremos de los agentes.

Capacidades principales

La evaluación del agente te ayuda a crear un conjunto de evaluaciones inicial, incluso sin datos de prueba existentes. Las siguientes funciones ayudan a automatizar el proceso de generación de casos de prueba y a perfeccionar tus sistemas basados en agentes:

  • Generación de situaciones y simulación de usuarios: Genera automáticamente situaciones de prueba sintéticas diversas y de varios turnos en función de las instrucciones y las definiciones de herramientas de tu agente. Esta automatización te permite comenzar a realizar pruebas de inmediato, ya que elimina la necesidad de crear manualmente casos de prueba iniciales.

  • Simulación del entorno: Intercepta llamadas a herramientas específicas para insertar comportamientos personalizados, datos simulados o errores simulados (como errores HTTP 503 o picos de latencia). Esta simulación te permite validar la resiliencia del agente sin afectar los backends de producción.

  • Evaluación de varios turnos: Evalúa automáticamente historiales de conversaciones completos con evaluadores automáticos de varios turnos. Estos evaluadores analizan la extracción de la intención, generan rúbricas de forma dinámica y proporcionan veredictos de validación objetivos para garantizar el cumplimiento de las instrucciones.

  • Optimización de instrucciones: Genera y valida de forma programática instrucciones del sistema refinadas con la optimización de instrucciones. El marco de optimización identifica los puntos de falla y propone de forma iterativa actualizaciones segmentadas.

Evalúa con asistentes de programación con IA

Si usas Gemini CLI o algún otro asistente de programación con IA, puedes instalar habilidades de agente que le enseñen a tu asistente la metodología de evaluación de agentes que se describe en esta página. Cada habilidad proporciona el flujo de trabajo de evaluación, el esquema del conjunto de datos, la orientación para la selección de métricas y los pasos para el análisis de errores directamente en tu sesión de programación, de modo que tu asistente pueda compilar, calificar y mejorar las evaluaciones sin salir del editor.

Las instrucciones de instalación se incluyen después de cada habilidad.

Habilidad de evaluación de Agents CLI

Un flujo de trabajo controlado por la CLI para evaluar y optimizar agentes del Kit de desarrollo de agentes (ADK) con los comandos de agents-cli eval En este curso, se abordan los siguientes temas:

  • Prepara conjuntos de datos de evaluación y sintetiza situaciones de varios turnos con simulación del usuario
  • Ejecutar inferencias, calificar registros y analizar clústeres de fallas
  • Cómo iterar instrucciones y herramientas con el bucle de evaluación y corrección

Para instalarlo, ejecuta el siguiente comando:

npx skills add https://github.com/google/agents-cli --skill google-agents-cli-eval

Habilidad de ciclo de retroalimentación de Gen AI Evaluation Service de Agent Platform

Una guía basada en el SDK para evaluar y mejorar modelos y agentes a través de Agent Platform GenAI Evaluation Service, con el SDK de Agent Platform GenAI Evaluation (client.evals.evaluate()). Esta habilidad abarca lo siguiente:

  • Compilación de conjuntos de datos de evaluación a partir de registros de sesiones, DataFrames o generación sintética
  • Selección, configuración y escritura de métricas personalizadas con la puntuación de LLM como juez
  • Analizar los veredictos de la rúbrica y los patrones de pérdida para impulsar mejoras concretas

Para instalarlo, ejecuta el siguiente comando:

npx skills add https://github.com/google/skills --skill agent-platform-eval-flywheel

¿Qué sigue?