Rekomendasi LoRA dan QLoRA untuk LLM

Halaman ini memberikan rekomendasi konfigurasi untuk menyesuaikan model bahasa besar (LLM) di Gemini Enterprise Agent Platform dengan menggunakan Low-Rank Adaptation of Large Language Models (LoRA) dan versi yang lebih hemat memori, QLoRA.

Menyesuaikan rekomendasi

Tabel berikut merangkum rekomendasi kami untuk menyesuaikan LLM menggunakan LoRA atau QLoRA:

Spesifikasi Disarankan Detail
Efisiensi memori GPU QLoRA QLoRA memiliki penggunaan memori GPU puncak yang sekitar 75% lebih kecil dibandingkan dengan LoRA.
Kecepatan LoRA LoRA sekitar 66% lebih cepat daripada QLoRA dalam hal kecepatan penyesuaian.
Efisiensi biaya LoRA Meskipun kedua metode ini relatif tidak mahal, LoRA hingga 40% lebih murah daripada QLoRA.
Panjang urutan maksimum yang lebih tinggi QLoRA Panjang urutan maksimal yang lebih tinggi akan meningkatkan konsumsi memori GPU. QLoRA menggunakan lebih sedikit memori GPU sehingga dapat mendukung panjang urutan maksimal yang lebih tinggi.
Peningkatan akurasi Sama Kedua metode ini menawarkan peningkatan akurasi yang serupa.
Ukuran batch yang lebih tinggi QLoRA QLoRA mendukung ukuran tumpukan yang jauh lebih tinggi. Misalnya, berikut adalah rekomendasi ukuran tumpukan untuk menyetel openLLaMA-7B di GPU berikut:
  • 1 x A100 40G:
    • LoRA: Ukuran tumpukan 2 direkomendasikan.
    • QLoRA: Ukuran tumpukan 24 direkomendasikan.
  • 1 x L4:
    • LoRA: Ukuran tumpukan 1 gagal dengan error kehabisan memori (OOM).
    • QLoRA: Ukuran tumpukan 12 direkomendasikan.
  • 1 x V100:
    • LoRA: Ukuran tumpukan 1 gagal dengan error kehabisan memori (OOM).
    • QLoRA: Ukuran tumpukan 8 direkomendasikan.