Un arnés de evaluación de AlphaEvolve debe procesar las actualizaciones de código de los candidatos de forma sistemática a través de una canalización de ejecución determinista. En lugar de ejecutar y calificar una solución de una sola vez, el arnés divide la canalización en tres puertas de prueba progresivas:
Puertas de evaluación
En el siguiente diagrama, se muestra cómo los programas de los candidatos fluyen a través de los tres niveles de prueba distintos antes de devolver metadatos estructurados a AlphaEvolve.

Validación de la solución
El bucle de evaluación comienza aplicando restricciones estructurales estrictas sin ejecutar la lógica central del código. El arnés verifica la solución del candidato para detectar la corrección básica de la sintaxis en tiempo de compilación, los errores de análisis y las violaciones de seguridad estructural.
Ruta de éxito: Si el programa pasa todas las verificaciones de validación, el código avanza de forma segura hasta el bucle de tiempo de ejecución de verificación de la solución.
Ruta de falla (cortocircuito): Si falla alguna prueba de validación, el arnés interrumpe la ejecución de inmediato. Omite por completo los niveles de verificación y prueba de rendimiento que consumen muchos recursos para proteger la infraestructura del sistema. El bucle pasa directamente a la producción de comentarios, lo que afirma una penalización de búsqueda plana masiva (como
-1e12) junto con puntuaciones de rendimiento con valor cero.
Verificación de la solución
Una vez que se valida un programa candidato como sintácticamente sólido y seguro para ejecutar, el arnés lo inicia en un entorno aislado para aplicar restricciones funcionales flexibles. En esta fase, se ejecutan las verificaciones de unidades estándar y de corrección funcional.
En lugar de generar una señal binaria de aprobado o reprobado, el arnés evalúa el programa en función de la cantidad o el porcentaje exactos de pruebas funcionales aprobadas. Esto se incluye en una puntuación de penalización general, lo que proporciona a AlphaEvolve un gradiente de búsqueda numérico denso para corregir de forma incremental las estructuras lógicas rotas en generaciones sucesivas.
Evaluación de la solución
Cuando un programa candidato demuestra ser sintácticamente seguro y algorítmicamente correcto, alcanza el nivel de comparativa de rendimiento.
El arnés ejecuta pruebas empíricas, cálculos directos de lógica de productos o simulaciones analíticas para cuantificar tus métricas de optimización comercial objetivo (como la velocidad de ejecución algorítmica, la huella de memoria de la infraestructura de la nube o los límites de calibración de salida).
Comentarios de evaluación integrales
Al final de la canalización de ejecución, el arnés agrega datos de todas las fases completadas en una carga útil de comentarios estructurada. Esta carga útil se devuelve directamente a AlphaEvolve para guiar la selección de elementos superiores para mutaciones posteriores.
El resultado de comentarios estandarizado consta de los siguientes tres componentes principales:
Puntuación general de ascenso de colina: Un valor escalar único y combinado que calcula el arnés de forma determinista y que AlphaEvolve maximiza directamente durante la optimización.
Puntuaciones y penalizaciones de optimización detalladas: Las submétricas individuales, los tiempos de ejecución y los desgloses de penalizaciones de restricciones flexibles. Esta distribución de datos explícita permite que el motor razone con claridad sobre las compensaciones de ingeniería subyacentes.
Estadísticas textuales: Registros estructurales sin procesar y detalles del modo de falla que se vuelven a pasar a contextos de instrucciones futuros, lo que permite que el LLM aprenda de forma explícita de sus errores de generación.