Best Practices für Tests

Für den Einstieg in die Tests mit AlphaEvolve empfehlen wir den folgenden Workflow:

  1. Umgebung initialisieren

    Auf der Seite „Erste Schritte“ können Sie alle Voraussetzungen erfüllen und Ihre Umgebung initialisieren.

  2. Grundlegende Überprüfung durchführen

    Führen Sie das Codelab Erste Schritte mit AlphaEvolve auf Google Cloud aus, bevor Sie fortfahren. Mit diesem Schritt wird sichergestellt, dass Ihre Transportschichten, die Blocksyntax und die lokale Laufzeitüberprüfung reibungslos und ohne Fehler ausgeführt werden, bevor Sie zu domainspezifischen Zielen übergehen.

  3. Testdesign ausführen

    Wählen Sie zwischen einer agentenbasierten oder manuellen Integration:

    • Agentenbasierte Integration: Wenn Sie agentenbasierte Codierungstools verwenden, führen Sie die integrierte Skills-Pipeline aus, um Ihre Einrichtung und Ihr Testdesign programmatisch zu durchlaufen.

    • Manuelle Integration: Wenn Sie keine agentenbasierten Tools verwenden, beziehen Sie sich auf die Codelabs und erstellen Sie Ihren Test manuell, indem Sie die folgenden Schritte ausführen:

      • Ausgangscode-Baseline vorbereiten

        Erstellen Sie den anfänglichen Baseline-Code gemäß den Programmrichtlinien, platzieren Sie explizite EVOLVE-BLOCK Kommentarmarkierungen ausschließlich um die spezifischen Logiksegmente oder Unterroutinen, die mit der Placement-Strategie umgestaltet werden sollen.

      • Evaluator-Harness-Funktion erstellen

        Schreiben Sie eine clientseitige oder serverseitige Ausführungsschleife, um die geänderten Codeblöcke von AlphaEvolve zu empfangen, sie sicher auszuführen und Geschäftsstatistiken zu berechnen. Der Evaluator muss ein strukturiertes Dictionary mit einer oder mehreren Statistiken zurückgeben, um AlphaEvolve eine explizite Suchrichtung zu geben. Beachten Sie die wichtigsten Richtlinien auf der Seite Evaluator-Design.

      • Problemdefinition dokumentieren

        Definieren Sie eine genaue Problembeschreibung in Ihrer Konfiguration und geben Sie Hintergrunddetails, relevante Regeln für den Domainkontext und harte Einschränkungen des Betriebssystems an. Beachten Sie die Richtlinien auf der Seite Richtlinien für die Kontext- und Prompts-Konfiguration.

      • Testkonfiguration auswählen

        Geben Sie Ihre Laufzeit-Hyperparameterkonfiguration an, einschließlich der Ziel-LLM-Mischungen, der maximalen Grenzwerte für die Programmausführung und der optimalen Grenzwerte für die Ausführungskonkurrenz. Beachten Sie die Richtlinien auf der Seite Daten und Parallelität.

  4. Ausführung beobachten

    Starten Sie den Optimierungstest und verfolgen Sie die Fitnesswerte in Echtzeit über aufeinanderfolgende Generationen hinweg. Empfohlene Evaluierungsbudgets beginnen bei etwa 100 Programmen und können bei schwierigen Problemen auf Tausende ansteigen. Wenn Ihre Evaluierungsstatistiken nach etwa 1.500 Kandidatenprogrammbewertungen keine klare Entwicklung zeigen, pausieren Sie die Ausführungsschleife, um den Kontext der Problemdefinition zu verfeinern oder die weichen Strafbeschränkungen anzupassen.

  5. In die Produktion integrieren

    Nach erfolgreicher Suchkonvergenz rufen Sie den optimalen Programmkandidaten (oder die n-beste Variante, je nach betrieblichen Kompromissen bei mehreren Statistiken) aus den Verlaufstabellen ab und implementieren Sie ihn direkt in Ihre Systemarchitektur.

Wenn die Optimierungskomplexität, die Abhängigkeitsstacks und die Skalierungsanforderungen steigen, wechseln Sie von Ihrem lokalen Prozessraum zur clusterbasierten Infrastruktureinrichtung, um erweiterte Berechnungsanforderungen im Unternehmen zu erfüllen.