最適化の目標を定量化する

最適化の目標は、AlphaEvolve が各世代で最大化する単一の数値を表します。評価ツールのコードを記述する前に、次の 3 つの質問に答えてください。

  1. この数値は何を表していますか?

  2. システムはどのように計算しますか?

  3. 計算はどこで実行されますか?

AlphaEvolve では、人手を介さずに、すべての候補ソリューションに対して自動化されたプログラムによる目標計算が厳密に必要です。この自動化により、この問題は AlphaEvolve に適したものになります。ソリューションの品質を手動で判断する必要がある場合、AlphaEvolve はそのソリューションを検索できません。

生成された候補ソリューションのパフォーマンスをさまざまな最適化目標と検証制約で推定するには、次の考慮事項を使用します。

  • 最適化目標は、経験的な測定を必要とせずに、ビジネスまたはプロダクトのロジックを使用して直接計算できますか?
  • 生成されたソリューションのコードでパフォーマンス テストと負荷テストを実行して、最適化目標を直接測定できますか?
  • 最適化の目標は、確立された信頼性の高いシミュレーション方法である決定論的代理関数を使用して推定できますか?
  • 最適化目標は、経験的観測に基づくチューニングとアウトオブサンプル データに基づく検証を必要とするカスタム サロゲート関数(予測モデルやその他の非決定論的推定量など)を設計することで推定できますか?

目標を数値化するための主な手順

構造化されたアプローチに従って、AlphaEvolve が検索をガイドするための信頼性の高い自動化されたフィードバック ループを確保します。次の手順を完了して、指標を確立し、測定方法を定義して、実行場所を決定します。

1. 目標を、ソリューションの改善に応じて増加する単一のスコアとして表現する

コア最適化指標を構成して、実際のパフォーマンスの向上に合わせて線形または単調にスケーリングし、検索パスに明確な方向勾配を設定します。

  • スカラーの最大化: AlphaEvolve は常に 1 つのスカラー値を最大化します。関心のあるものをすべて 1 つの数値に変換します。数値が高いほど良いことを示します。レイテンシ、費用、エラーを最小限に抑えるには、否定します。score = -latency_ms

  • 単調性: スコアは単調でなければなりません。ソリューションが実際に改善されるたびにスコアが上昇する必要があります。スコアが不安定に変動すると、検索結果の順位を上げる方向性が定まらなくなります。

  • 決定論的実行: スコアは LLM や人ではなく、評価ツールで計算されます。同じ候補が常に同じスコアを取得するように、決定論的に計算します。

  • 主観的な目標のコンジョイント分析: スコアリング式を作成できないが、2 つのソリューションを目で比較できる場合は、コンジョイント分析を使用して作成します。候補出力のペアを生成し、ドメイン エキスパートに各ペアで優れた方を選択してもらい、その選択にロジスティック回帰を適合させ、適合させたモデルを指標として使用します。これにより、主観的な判断が決定論的で微分可能なスコアに変わります。未加工の LLM ルーブリックは、遅く、ノイズが多く、報酬ハッキングがすぐに発生するため、ライブスコアとして使用しないでください。まず、固定関数に抽出します。

2. スコアの計算方法を選択する

数値の生成方法は、測定対象によって異なります。目標に合った方法を次の表から選択します。実際のデプロイのほとんどは、この 4 つのうちの 1 つを使用しており、多くは 2 つを組み合わせています。つまり、検索を促進する安価な方法と、勝者を確定する高価な方法です。

測定方法 ターゲットが次の場合は、このパターンを使用します。 スコアの算出方法 実行に必要なもの
直接計算 ビジネス ロジックまたはプロダクト ロジックを使用して候補の出力から閉形式で計算できる量 評価者は候補を実行し、数式(合計、比率、カウント、費用)を適用します。 コントローラの独自のプロセス - 追加のインフラストラクチャは不要
パフォーマンス テストまたは負荷テスト 候補コード自体のランタイム、スループット、メモリ 代表的なハードウェアで候補を実行して測定し、まず正確性でゲートを通過させる ターゲット ハードウェア(GPU、TPU、CPU)。タイミング ノイズをカットするためのウォームアップとベスト オブ N
決定論的サロゲート / シミュレーション 直接測定するにはコストがかかるかノイズが多いが、信頼できるプロキシまたは実際の条件の再現が存在する 決定論的プロキシを計算する、または固定シード オペレーティング シナリオを再生する 任意の環境。固定シードで完全に再現可能
アウトオブサンプル検証 候補者が作成するモデルまたはデータ パイプラインの品質 候補をトレーニング/適合させ、ホールドアウト データまたは新しく生成されたデータでスコアリングする トレーニング/評価スタック、厳密なトレーニングと検証の分割、ホールドアウト セットでの勝者の再検証

詳しくは、 Google Cloud ブログの AlphaEvolve に関するお知らせをご覧ください。

これらのいずれも自動的に数値を生成できない場合、その問題は AlphaEvolve の準備がまだ整っていません。したがって、コアタスクは、そのようなサロゲートまたはシミュレーションを構築することです。

3. 複数の目標と制約を処理する

実際の目標には、通常、複数の懸念事項が混在しています。次のいずれかの方法で処理します。

  1. 評価ツールの実装パターン

  2. 多目的最適化

スカラー ブレンディング(最も単純 - 開始時に推奨): 各指標を比較可能な範囲にリスケールし、最小化する指標を否定してから、それらを加算します(score = w1*A - w2*L - w3*M)。

数値的に不安定な A/(L⋅M) などの比率よりも、加算和を優先します。

名前付きスコアの辞書を返します。AlphaEvolve がそれらをまとめて最適化できるようにします。評価ツールは、1 つの数値ではなく、複数の名前付き指標を返すことができます。

```JSON
{
  "scores": [
    {"metric": "accuracy", "score": 0.95},
    {"metric": "latency_ms", "score": -120.0}
  ]
}
```

各指標は高いほど良いので、最小化するものはすべて否定します。これにより、単なるレポートではなく、真の多目的検索がトリガーされます。母集団データベースは、指標ごとに最適なプログラム(MAP-Elites)を保持し、指標間でパレートフロンティアを維持し、さまざまな指標間で親を多様にサンプリングします。このサンプリングが有効になっている場合は、パレートフロンティアから親を直接抽出することもできます。報告されたヒルクライムは 1 つの広告見出しスコアによって推進されますが、返されたすべての指標が検索を形成します。

  1. 指標を 3 ~ 5 個に抑える: 指標が多すぎると、パレート支配がほぼすべてのプログラムで非支配になり、検索がさまよいます。そのしきい値を超える指標を集計または削除します。

  2. 正確性と実現可能性を分離する: 正確性をハードゲートとして維持し、報酬関数の一部にしない。間違った候補や実現不可能な候補には、速度やコストに関係なく失敗スコアが付けられます。これは、エージェントが指標を操作するのを防ぐための主な対策です。

  3. 制約付き最適化: 1 つの目標を制約として保持し、もう 1 つの目標を最適化します。制約が違反された場合はペナルティが適用されます。このワークフローを複数の制約レベルで実行すると、パレート フロントがトレースされます。

4. 評価ツールを実行する場所を決定する

AlphaEvolve は評価者を直接実行しません。候補プログラムを提案してスコアを受け取ります。スコアを計算するコードは、ユーザーがホストして実行します。環境は完全にユーザーの選択であり、Google Cloud で実行できない候補はブロックされません。目標を測定できる場所で評価ツールを実行し、スコアを送信します。

効率的かつ安全なデプロイを実現するには、コンピューティング インフラストラクチャを特定の測定戦略に合わせ、普遍的な実行上限を遵守する必要があります。次のガイドラインに沿って実行環境を選択し、すべての設定に適用されるコア オペレーションの境界を理解してください。

実行環境を測定方法に合わせる

直接計算または代理: コントローラの独自のプロセス、または単一の Cloud Run コンテナ。

パフォーマンス テストまたはロードテスト: GKE の GPU ノードや TPU ノード、独自のオンプレミスまたはカスタム ハードウェア、サードパーティ製または ISV ツール(EDA シミュレータや Verilog シミュレータなど)などのターゲット ハードウェア。

アウトオブサンプル検証または重いジョブ: トレーニング スタックが Cloud Run または GKE に分散されるか、大規模な HPC またはアクセラレータ ワークロード用の Cluster Toolkit を使用してGoogle Cloud batch にオフロードされます。

環境に関係なく 2 つの上限が適用される

進化ループを継続的に進めるため、各評価を 10 分程度に抑えるようにしてください。コストの高い目標の場合は、評価カスケードを使用してすべての候補をチェックし、有望な候補に対してのみ完全な評価を実行します。

評価者のネットワーキング、セキュリティ、アクセス制御を所有している。AlphaEvolve は、評価ツールをデプロイまたは管理しません。 Google Cloudや他の場所でも同様です。

指標、計算方法、実行場所が決まったら、評価ツールの実装パターンで評価ツールの構造を確認します。