テストのベスト プラクティス

AlphaEvolve のテストを開始するには、次のワークフローをおすすめします。

  1. 環境の初期化を完了する

    スタートガイド ページを使用して、すべての前提条件を満たし、 環境を初期化します。

  2. 基本的な検証を行う

    続行する前に、で AlphaEvolve を使ってみる Google Cloud Codelab を完了してください。この手順では、ドメイン固有のターゲットに進む前に、トランスポート レイヤ、ブロック構文、ローカル ランタイム検証がエラーなくスムーズに実行されるようにします。

  3. テスト設計を実行する

    エージェント統合パスまたは手動統合パスを選択します。

    • エージェント統合: エージェント コーディング ツールを使用する場合は、組み込みの スキル パイプラインを実行して、セットアップとテスト設計を プログラムで確認します。

    • 手動統合: エージェント ツールを使用しない場合は、 Codelab を参照し、次の操作を行ってテストを手動で構築します。

      • シードコードのベースラインを準備する

        配置戦略を使用して、プログラム ガイドラインに沿って初期ベースライン コードを作成し、 リファクタリングの対象となる特定のロジック セグメントまたはサブルーチンを厳密に囲むように明示的な EVOLVE-BLOCK コメント マーカーを配置します。

      • 評価ツール ハーネス関数を作成する

        クライアントサイドまたはサーバーサイドの実行ループを作成して、AlphaEvolve から変異したコードブロックを受け取り、安全に実行して、ビジネス指標を計算します。評価ツールは、1 つ以上の指標の構造化されたディクショナリを返して、AlphaEvolve に明示的な検索グラデーションの方向を提供する必要があります。 評価ツールの設計ページに記載されているコア ガイドラインを使用します。

      • 問題の定義を文書化する

        構成内で正確な問題ステートメントを定義し、背景の詳細、関連するドメイン コンテキスト ルール、厳しいオペレーティング システムの制約を指定します。コンテキストとプロンプトの構成ガイドライン ページのガイドライン を使用します。

      • テスト構成を選択する

        ターゲット LLM ミックス、プログラム生成の最大制限、最適な実行同時実行しきい値など、ランタイム ハイパーパラメータ構成を指定します。データと同時実行のページのガイドラインを使用します。

  4. 実行をモニタリングする

    最適化テストを開始し、連続する世代のフィットネス スコアをリアルタイムで追跡します。推奨される評価予算は、約 100 個のプログラムから始まり、難しい問題の場合は数千個までスケールアップします。候補プログラムの評価を約 1, 500 回行っても、評価指標で明確な軌跡が示されない場合は、実行ループを一時停止して、問題定義のコンテキストを絞り込むか、ソフト ペナルティの制約を調整します。

  5. 本番環境に統合する

    検索が正常に収束したら、履歴テーブルから最適なプログラム候補(または、複数の指標の運用上のトレードオフに応じて n 番目に最適なバリアント)を取得し、システム アーキテクチャに直接実装します。

最適化の複雑さ、依存関係スタック、スケール要件が拡大したら、ローカル プロセス空間からクラスタ ツールキット ベースのインフラストラクチャ セットアップに切り替えて、高度なエンタープライズ規模のコンピューティング ニーズに対応します。