防範獎勵遭盜用

獎勵遭盜用會帶來許多風險,請參閱下文,瞭解相關風險和因應策略。

風險 1:

貪婪獎勵駭客攻擊。如果 Obj = w1*S1 + w2*S2 + w3*S3,AlphaEvolve 可能會發現 S2,並完全專注於 S2,忽略 S1 和 S3。

緩解措施:

降低子項分數的權重。可能需要 2 到 3 次試跑來校正重量。初步基準模擬有助於瞭解幾種評分結果。

風險 2:

忽略限制處分。如果軟性限制是懲罰 (Obj = Score - w*Penalty),AlphaEvolve 可能會發現忽略限制可產生更高的 Obj

緩解措施:

大幅提高違規事項的權重。如果問題仍未解決,請在問題說明中加入明確指示,例如「無論分數為何,違反限制 X 的解決方案皆無效」。

風險 3:

評估函式遭濫用。AlphaEvolve 可能會找出導致評估人員傳回人為高分的輸入內容 (浮點邊緣案例、測試資料外洩)。

緩解措施:

使用固定隨機種子的確定性評估。實驗結束後,根據預留資料驗證勝出者。

如要避免獎勵遭駭,請實作下列一般技術:

  • 使用 AST 檢查禁止使用的基本型別 (sys、os、inspect、eval、exec、getattr、setattr),如果找到這類型別,則傳回 None

  • 確認 EVOLVE-BLOCK 外部的程式碼未變更 (文字差異或 AST)。

  • 使用相同輸入內容執行演進函式兩次,並驗證輸出內容是否相同 (可偵測隨機性駭客攻擊)。

  • 請檢查評估時間。如果幾微秒內就完成,可能是硬式編碼的答案。

  • 將評分邏輯放在 LLM 無法存取的獨立檔案中。