Un harness di valutazione AlphaEvolve deve elaborare gli aggiornamenti del codice candidato in modo sistematico tramite una pipeline di esecuzione deterministica. Anziché eseguire e valutare una soluzione contemporaneamente, il harness divide la pipeline in tre fasi di test progressivi:
Fasi di valutazione
Il seguente diagramma mostra il flusso dei programmi candidati attraverso i tre livelli di test distinti prima di restituire i metadati strutturati ad AlphaEvolve.

Convalida della soluzione
Il ciclo di valutazione inizia applicando vincoli strutturali rigidi senza eseguire la logica principale del codice. Il harness controlla la soluzione candidata per verificare la correttezza sintattica di base in fase di compilazione, gli errori di analisi e le violazioni della sicurezza strutturale.
Percorso di successo: se il programma supera tutti i controlli di convalida, il codice passa in sicurezza al ciclo di runtime di verifica della soluzione.
Percorso di errore (cortocircuito): se un test di convalida non riesce, il harness interrompe immediatamente l'esecuzione. Ignora completamente i livelli di verifica e test delle prestazioni che richiedono molte risorse per proteggere l'infrastruttura di sistema. Il ciclo passa direttamente alla produzione di feedback, applicando una penalità di ricerca piatta elevata (ad esempio
-1e12) insieme a punteggi di rendimento pari a zero.
Verifica della soluzione
Una volta convalidato un programma candidato come sintatticamente valido e sicuro da eseguire, il harness lo avvia in un ambiente isolato per applicare vincoli funzionali soft. Questa fase esegue i controlli standard di correttezza funzionale e delle unità.
Anziché restituire un segnale binario di superamento o non superamento, il harness valuta il programma in base al numero esatto o alla percentuale di test funzionali superati. Questo valore viene conteggiato per un punteggio di penalità complessivo, fornendo ad AlphaEvolve un gradiente di ricerca numerico denso per correggere in modo incrementale le strutture logiche non funzionanti nelle generazioni successive.
Valutazione della soluzione
Quando un programma candidato si dimostra sintatticamente sicuro e algoritmicamente corretto, raggiunge il livello di benchmarking delle prestazioni.
Il harness esegue test empirici, calcoli diretti della logica del prodotto o simulazioni analitiche per quantificare le metriche di ottimizzazione aziendale target (ad esempio velocità di esecuzione algoritmica, footprint della memoria dell'infrastruttura cloud o limiti di calibrazione dell'output).
Feedback di valutazione completo
Al termine della pipeline di esecuzione, il harness aggrega i dati di tutte le fasi completate in un payload di feedback strutturato. Questo payload viene restituito direttamente ad AlphaEvolve per guidare la selezione dei genitori per le mutazioni successive.
L'output di feedback standardizzato è costituito dai seguenti tre componenti principali:
Punteggio complessivo di hill climbing: un singolo valore scalare combinato calcolato in modo deterministico dal harness che AlphaEvolve massimizza direttamente durante l'ottimizzazione.
Punteggi e penalità di ottimizzazione granulari: le singole metriche secondarie, i tempi di esecuzione e le suddivisioni delle penalità dei vincoli soft. Questa distribuzione esplicita dei dati consente al motore di ragionare chiaramente sui compromessi di progettazione sottostanti.
Approfondimenti testuali: log strutturali non elaborati e dettagli della modalità di errore passati ai contesti di prompt futuri, consentendo all'LLM di apprendere in modo esplicito dagli errori di generazione.