Praktik terbaik eksperimen

Untuk mulai melakukan eksperimen di AlphaEvolve, sebaiknya ikuti alur kerja berikut:

  1. Selesaikan inisialisasi lingkungan

    Gunakan halaman Mulai untuk menyelesaikan semua prasyarat dan menginisialisasi lingkungan Anda.

  2. Melakukan verifikasi dasar

    Selesaikan codelab Memulai AlphaEvolve di Google Cloud sebelum melanjutkan. Langkah ini memastikan bahwa lapisan transportasi, sintaksis blok, dan verifikasi runtime lokal Anda berjalan lancar tanpa error sebelum Anda melanjutkan ke target spesifik per domain.

  3. Menjalankan desain eksperimen

    Pilih antara jalur integrasi manual atau berbasis agen:

    • Integrasi berbasis agen: Jika Anda menggunakan alat coding berbasis agen, jalankan pipeline Skills bawaan untuk mempelajari penyiapan dan desain eksperimen Anda secara terprogram.

    • Integrasi manual: Jika Anda tidak menggunakan alat berbasis agen, lihat codelab dan buat eksperimen secara manual dengan melakukan tindakan berikut:

      • Menyiapkan dasar pengukuran kode awal

        Buat kode dasar awal yang mengikuti pedoman program, tempatkan penanda komentar EVOLVE-BLOCK eksplisit secara ketat di sekitar segmen atau subrutin logika tertentu yang ditargetkan untuk pemfaktoran ulang menggunakan strategi penempatan.

      • Membangun fungsi harness evaluator

        Tulis loop eksekusi sisi klien atau sisi server untuk menerima blok kode yang diubah dari AlphaEvolve, jalankan secara aman, dan hitung metrik bisnis. Evaluator harus menampilkan kamus terstruktur dari satu atau beberapa metrik untuk memberikan arah gradien penelusuran eksplisit ke AlphaEvolve. Gunakan pedoman inti yang tercantum di halaman Desain evaluator.

      • Mendokumentasikan definisi masalah

        Tentukan pernyataan masalah yang tepat dalam konfigurasi Anda, dengan menentukan detail latar belakang, aturan konteks domain yang relevan, dan batasan sistem operasional yang sulit. Gunakan panduan dari halaman Panduan konfigurasi konteks dan perintah.

      • Memilih konfigurasi eksperimen

        Tentukan konfigurasi hyperparameter runtime Anda, termasuk campuran LLM yang ditargetkan, batas pembuatan program maksimum, dan nilai minimum konkurensi eksekusi yang optimal. Gunakan panduan dari halaman data dan konkurensi.

  4. Memantau eksekusi

    Luncurkan eksperimen pengoptimalan dan pantau skor kebugaran real-time di berbagai generasi. Anggaran evaluasi yang direkomendasikan dimulai dari ~100 program dan dapat ditingkatkan skalanya hingga ribuan untuk masalah sulit. Jika metrik evaluasi Anda gagal menunjukkan lintasan yang jelas setelah ~1.500 evaluasi program kandidat, jeda loop eksekusi untuk mempertajam konteks definisi masalah atau menyesuaikan batasan penalti ringan.

  5. Mengintegrasikan ke dalam produksi

    Setelah konvergensi penelusuran berhasil, ambil kandidat program optimal (atau varian terbaik ke-n bergantung pada pertimbangan operasional multi-metrik) dari tabel histori dan terapkan langsung ke arsitektur sistem Anda.

Seiring dengan bertambahnya kompleksitas pengoptimalan, tumpukan dependensi, dan persyaratan skala, beralihlah dari ruang proses lokal ke penyiapan infrastruktur berbasis toolkit cluster untuk menangani kebutuhan komputasi tingkat perusahaan yang canggih.