AlphaEvolve 평가 하네스는 결정적 실행 파이프라인을 통해 후보 코드 업데이트를 체계적으로 처리해야 합니다. 하네스는 솔루션을 한 번에 실행하고 평가하는 대신 파이프라인을 세 가지 점진적 테스트 게이트로 나눕니다.
평가 게이트
다음 다이어그램은 후보 프로그램이 세 가지 고유한 테스트 계층을 통과한 후 구조화된 메타데이터를 AlphaEvolve로 반환하는 방법을 보여줍니다.

솔루션 유효성 검사
평가 루프는 코드의 핵심 로직을 실행하지 않고 엄격한 구조적 제약 조건을 적용하는 것으로 시작됩니다. 하네스는 후보 솔루션에서 기본 컴파일 시간 구문 정확성, 파싱 버그, 구조적 보안 위반을 확인합니다.
성공 경로: 프로그램이 모든 유효성 검사 테스트를 통과하면 코드가 솔루션 확인 런타임 루프로 안전하게 진행됩니다.
실패 경로 (단락): 유효성 검사 테스트가 실패하면 하네스가 즉시 실행을 중단합니다. 시스템 인프라를 보호하기 위해 리소스가 많이 필요한 확인 및 성능 테스트 계층을 완전히 우회합니다. 루프는 피드백 생성으로 바로 이동하여 0 값 성능 점수와 함께 대규모 플랫 검색 페널티 (예:
-1e12)를 어설션합니다.
솔루션 확인
후보 프로그램이 구문적으로 건전하고 실행하기에 안전한 것으로 확인되면 하네스는 격리된 환경 내에서 이를 실행하여 소프트 기능 제약 조건을 적용합니다. 이 단계에서는 표준 단위 및 기능 정확성 검사를 실행합니다.
하네스는 통과 또는 실패 바이너리 신호를 출력하는 대신 통과한 기능 테스트의 정확한 수 또는 비율을 기준으로 프로그램을 평가합니다. 이는 전반적인 페널티 점수에 반영되어 AlphaEvolve에 연속 세대에 걸쳐 손상된 로직 구조를 점진적으로 수정할 수 있는 밀도 높은 숫자 검색 그라데이션을 제공합니다.
솔루션 평가
후보 프로그램이 구문적으로 안전하고 알고리즘적으로 올바른 것으로 확인되면 성능 벤치마킹 레이어에 도달합니다.
하네스는 경험적 테스트, 직접 제품 로직 계산 또는 분석 시뮬레이션을 실행하여 타겟 비즈니스 최적화 측정항목(예: 알고리즘 실행 속도, 클라우드 인프라 메모리 사용 공간 또는 출력 보정 경계)을 정량화합니다.
종합 평가 의견
실행 파이프라인의 끝에서 하네스는 완료된 모든 단계의 데이터를 구조화된 의견 페이로드로 집계합니다. 이 페이로드는 후속 변형의 상위 항목 선택을 안내하기 위해 AlphaEvolve로 직접 반환됩니다.
표준화된 의견 출력은 다음 세 가지 기본 구성요소로 구성됩니다.
전반적인 언덕 오르기 점수: AlphaEvolve가 최적화 중에 직접 최대화하는 하네스에 의해 결정적으로 계산되는 단일 결합 스칼라 값입니다.
세분화된 최적화 점수 및 페널티: 개별 하위 측정항목, 실행 시간, 소프트 제약 조건 페널티 분석입니다. 이 명시적 데이터 분포를 통해 엔진은 기본 엔지니어링 절충안에 대해 명확하게 추론할 수 있습니다.
텍스트 인사이트: 향후 프롬프트 컨텍스트로 다시 전달되는 원시 구조 로그 및 실패 모드 세부정보로, LLM이 생성 오류로부터 명시적으로 학습할 수 있도록 합니다.