獎勵遭盜用會帶來許多風險,請參閱下文,瞭解相關風險和因應策略。
風險 1:
貪婪獎勵駭客攻擊。如果 Obj = w1*S1 + w2*S2 + w3*S3,AlphaEvolve 可能會發現 S2,並完全專注於 S2,忽略 S1 和 S3。
緩解措施:
降低子項分數的權重。可能需要 2 到 3 次試跑來校正重量。初步基準模擬有助於瞭解幾種評分結果。
風險 2:
忽略限制處分。如果軟性限制是懲罰 (Obj = Score - w*Penalty),AlphaEvolve 可能會發現忽略限制可產生更高的 Obj。
緩解措施:
大幅提高違規事項的權重。如果問題仍未解決,請在問題說明中加入明確指示,例如「無論分數為何,違反限制 X 的解決方案皆無效」。
風險 3:
評估函式遭濫用。AlphaEvolve 可能會找出導致評估人員傳回人為高分的輸入內容 (浮點邊緣案例、測試資料外洩)。
緩解措施:
使用固定隨機種子的確定性評估。實驗結束後,根據預留資料驗證勝出者。
如要避免獎勵遭駭,請實作下列一般技術:
使用 AST 檢查禁止使用的基本型別 (sys、os、inspect、eval、exec、getattr、setattr),如果找到這類型別,則傳回
None。確認
EVOLVE-BLOCK外部的程式碼未變更 (文字差異或 AST)。使用相同輸入內容執行演進函式兩次,並驗證輸出內容是否相同 (可偵測隨機性駭客攻擊)。
請檢查評估時間。如果幾微秒內就完成,可能是硬式編碼的答案。
將評分邏輯放在 LLM 無法存取的獨立檔案中。