Halaman ini menyediakan daftar kuota menurut region dan model, serta menunjukkan cara untuk melihat dan mengedit kuota Anda di Google Cloud konsol.
Kuota model yang disesuaikan
Inferensi model yang disesuaikan menggunakan kuota yang sama dengan model dasar. Tidak ada kuota terpisah untuk inferensi model yang disesuaikan.
Batas penyematan
Permintaan untukgemini-embedding-001 tunduk pada kuota regional, sedangkan permintaan untuk gemini-embedding-2 tunduk pada kuota global.
| Model dasar | Quota | Metrik |
|---|---|---|
| base_model: gemini-embedding | 100.000.000 | aiplatform.googleapis.com/embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding-2 | 200.000.000 | aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding-2 | 60.000 | aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model |
Permintaan untuk gemini-embedding-001 menggunakan predict API juga tunduk pada kuota berikut:
| Model dasar | Quota | Metrik |
|---|---|---|
| base_model: gemini-embedding | 100.000 | aiplatform.googleapis.com/online_prediction_requests_per_base_model |
| base_model: N/A | 30.000 | aiplatform.googleapis.com/online_prediction_requests |
Kuota Agent Runtime
Kuota berikut berlaku untuk Agent Runtime untuk project tertentu di setiap region:| Deskripsi | Quota | Metrik |
|---|---|---|
| Membuat, menghapus, atau memperbarui resource Agent Runtime per menit | 10 | aiplatform.googleapis.com/reasoning_engine_service_write_requests |
| Membuat, menghapus, atau memperbarui sesi Agent Runtime per menit | 100 | aiplatform.googleapis.com/session_write_requests |
| Mendapatkan, mencantumkan, atau mengambil sesi Agent Runtime per menit | 10000 | aiplatform.googleapis.com/session_read_requests |
Query atau StreamQuery Agent Runtime per
menit
|
90 | aiplatform.googleapis.com/reasoning_engine_service_query_requests |
| Menambahkan peristiwa ke sesi Agent Runtime per menit | 300 | aiplatform.googleapis.com/session_event_append_requests |
| Jumlah maksimum resource Agent Runtime | 100 | aiplatform.googleapis.com/reasoning_engine_service_entities |
| Membuat, menghapus, atau memperbarui resource memori Agent Runtime per menit | 100 | aiplatform.googleapis.com/memory_bank_write_requests |
| Mendapatkan, mencantumkan, atau mengambil dari Memory Bank Agent Runtime per menit | 300 | aiplatform.googleapis.com/memory_bank_read_requests |
| Permintaan eksekusi lingkungan sandbox (Eksekusi Kode) per menit | 1000 | aiplatform.googleapis.com/sandbox_environment_execute_requests |
| Entity lingkungan sandbox (Eksekusi Kode) per region | 1000 | aiplatform.googleapis.com/sandbox_environment_entities |
| Permintaan tulis lingkungan sandbox (Eksekusi Kode) per menit | 500 | aiplatform.googleapis.com/sandbox_environment_write_requests |
Permintaan postingan Agen A2A seperti sendMessage dan cancelTask per
menit
|
60 | aiplatform.googleapis.com/a2a_agent_post_requests |
Permintaan get Agen A2A seperti getTask dan getCard per menit
|
600 | aiplatform.googleapis.com/a2a_agent_get_requests |
Koneksi dua arah langsung serentak menggunakan BidiStreamQuery API per
menit
|
10 |
aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests
|
Kuota input multimodal
Kuota berikut berlaku untuk input multimodal untuk permintaangenerateContent dan streamGenerateContent untuk project tertentu di setiap region. Setiap kuota diterapkan per model dasar dan resolusi. Batas yang sama berlaku untuk permintaan yang ditayangkan oleh endpoint global, menggunakan metrik ..._global yang sesuai.
| Deskripsi | Quota | Metrik |
|---|---|---|
| Permintaan pembuatan konten dengan input gambar per menit per model dasar dan resolusi | 34.000.000 | aiplatform.googleapis.com/generate_content_image_input_per_base_model_id_and_resolution |
| Permintaan pembuatan konten dengan input video per menit per model dasar dan resolusi | 192.000.000 | aiplatform.googleapis.com/generate_content_video_input_per_base_model_id_and_resolution |
| Permintaan pembuatan konten dengan input audio per menit per model dasar dan resolusi | 11.000.000 | aiplatform.googleapis.com/generate_content_audio_input_per_base_model_id_and_resolution |
| Permintaan pembuatan konten dengan input dokumen per menit per model dasar dan resolusi | 1.200.000 | aiplatform.googleapis.com/generate_content_document_input_per_base_model_id_and_resolution |
Untuk meminta batas yang lebih tinggi untuk kuota ini, hubungi tim akun Google Cloud Anda; kuota ini tidak dapat ditingkatkan dari Google Cloud konsol.
Inferensi batch
Kuota dan batas untuk tugas inferensi batch sama di semua region.Batas tugas inferensi batch serentak untuk model Gemini
Tidak ada batas kuota yang telah ditentukan sebelumnya untuk inferensi batch untuk model Gemini. Sebagai gantinya, layanan batch menyediakan akses ke kumpulan resource bersama yang besar, yang dialokasikan secara dinamis berdasarkan ketersediaan dan permintaan real-time model di semua pelanggan untuk model tersebut. Jika lebih banyak pelanggan yang aktif dan kapasitas model sudah penuh, permintaan batch Anda mungkin akan dimasukkan ke dalam antrean untuk kapasitas.Kuota tugas inferensi batch serentak untuk model non-Gemini
Tabel berikut mencantumkan kuota untuk jumlah tugas inferensi batch serentak, yang tidak berlaku untuk model Gemini:| Quota | Nilai |
|---|---|
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs |
4 |
Melihat dan mengedit kuota di Google Cloud konsol
Untuk melihat dan mengedit kuota di Google Cloud konsol, lakukan hal berikut:- Buka halaman Quotas and System Limits.
- Untuk menyesuaikan kuota, salin dan tempel properti
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobsdi Filter. Tekan Enter. - Klik tiga titik di akhir baris, lalu pilih Edit quota.
- Masukkan nilai kuota baru di panel, lalu klik Submit request.
Kuota Kebijakan Tata Kelola Semantik
Kuota berikut berlaku untuk Kebijakan Tata Kelola Semantik untuk project tertentu di setiap region:| Deskripsi | Quota | Metrik |
|---|---|---|
| Mendapatkan atau mencantumkan resource kebijakan tata kelola semantik per menit | 600 | aiplatform.googleapis.com/semantic_governance/policy_read_requests |
| Membuat, memperbarui, atau menghapus resource kebijakan tata kelola semantik per menit | 60 | aiplatform.googleapis.com/semantic_governance/policy_write_requests |
| Mendapatkan resource mesin kebijakan tata kelola semantik per menit | 600 | aiplatform.googleapis.com/semantic_governance/engine_read_requests |
| Memperbarui atau menghentikan penyediaan resource mesin kebijakan tata kelola semantik per menit | 60 | aiplatform.googleapis.com/semantic_governance/engine_write_requests |
| Jumlah resource kebijakan tata kelola semantik per project per lokasi. | 1.000 | aiplatform.googleapis.com/semantic_governance/policy_count |
Melihat dan mengedit kuota di Google Cloud konsol
Untuk melihat dan mengedit kuota di Google Cloud konsol, lakukan hal berikut:- Buka halaman Quotas and System Limits.
- Untuk menyesuaikan kuota, salin dan tempel properti
aiplatform.googleapis.com/semantic_governance/policy_write_requestsdi Filter. Tekan Enter. - Klik tiga titik di akhir baris, lalu pilih Edit quota.
- Masukkan nilai kuota baru di panel, lalu klik Submit request.
Mesin RAG di Gemini Enterprise Agent Platform
Untuk setiap layanan yang melakukan Retrieval-Augmented Generation (RAG) menggunakan Mesin RAG, kuota berikut berlaku, dengan kuota diukur sebagai permintaan per menit (RPM).| Layanan | Quota | Metrik |
|---|---|---|
| API pengelolaan data Mesin RAG | 60 RPM | VertexRagDataService requests per minute per region |
RetrievalContexts API |
600 RPM | VertexRagService retrieve requests per minute per region |
base_model: textembedding-gecko |
1.500 RPM | Online prediction requests per base model per minute per region per base_modelFilter tambahan yang dapat Anda tentukan adalah base_model: textembedding-gecko |
| Layanan | Batas | Metrik |
|---|---|---|
Permintaan ImportRagFiles serentak |
3 RPM | VertexRagService concurrent import requests per region |
Jumlah maksimum file per permintaan ImportRagFiles |
10.000 | VertexRagService import rag files requests per region |
Layanan evaluasi AI generatif
Layanan evaluasi AI generatif menggunakan Gemini 2.5 Flash sebagai model hakim default untuk metrik berbasis model. Satu permintaan evaluasi untuk metrik berbasis model dapat menghasilkan beberapa permintaan yang mendasarinya ke layanan evaluasi AI generatif. Penggunaan setiap model dihitung di tingkat organisasi, yang berarti bahwa setiap permintaan yang diarahkan ke model hakim untuk inferensi model dan evaluasi berbasis model berkontribusi pada penggunaan model. Kuota untuk layanan evaluasi AI generatif dan model hakim yang mendasarinya ditampilkan dalam tabel berikut:| Kuota permintaan | Kuota default |
|---|---|
| Permintaan layanan evaluasi AI generatif per menit | 1.000 permintaan per project per region |
| Throughput Gemini | Bergantung pada model dan opsi penggunaan |
| Uji coba evaluasi serentak | 20 uji coba evaluasi serentak per project per region |
Jika Anda menerima error terkait kuota saat menggunakan layanan evaluasi AI generatif, Anda mungkin perlu mengajukan permintaan penambahan kuota. Lihat Melihat dan mengelola kuota untuk mengetahui informasi selengkapnya.
| Batas | Nilai |
|---|---|
| Batas waktu permintaan layanan evaluasi AI generatif | 60 detik |
Saat menggunakan layanan evaluasi AI generatif untuk pertama kalinya di project baru, Anda mungkin mengalami penundaan penyiapan awal hingga dua menit. Jika permintaan pertama Anda gagal, tunggu beberapa menit, lalu coba lagi. Permintaan evaluasi berikutnya biasanya selesai dalam waktu 60 detik.
Token input dan output maksimum untuk metrik berbasis model bergantung pada model yang digunakan sebagai model hakim. Lihat Model Google untuk mengetahui daftar model.
Kuota Gemini Enterprise Agent Platform Pipelines
Setiap tugas penyesuaian menggunakan Gemini Enterprise Agent Platform Pipelines. Untuk mengetahui informasi selengkapnya, lihat Kuota dan batas Agent Platform Pipelines.
Langkah berikutnya
PayGo Standar
Pelajari PayGo Standar, opsi penggunaan Agent Platform yang memungkinkan Anda hanya membayar resource yang Anda gunakan, tanpa memerlukan komitmen keuangan di awal.
Kuota dan batas sistem Agent Platform
Kuota dan batas sistem yang terkait dengan Agent Platform, tidak termasuk kuota dan batas sistem khusus produk.
Kuota Google Cloud
Pelajari cara Google Cloud membatasi jumlah resource yang dapat digunakan oleh project Google Cloud Anda, dan cara kuota berlaku untuk berbagai jenis resource, termasuk komponen hardware, software, dan jaringan.