בדף הזה מופיעה רשימה של מכסות לפי אזור ומודל, ומוסבר בו איך להציג ולערוך את המכסות ב Google Cloud מסוף.
מכסות של מודלים שעברו התאמה
הסקת מסקנות ממודל שעבר התאמה משתמשת באותה מכסה כמו מודל הבסיס. אין מכסה נפרדת להסקת מסקנות ממודל שעבר התאמה.
מגבלות על הטמעה
בקשות ל-gemini-embedding-001 כפופות למכסות אזוריות, ובקשות ל-gemini-embedding-2 כפופות למכסות גלובליות.
| מודל בסיס | מכסה | מדד |
|---|---|---|
| base_model: gemini-embedding | 100,000,000 | aiplatform.googleapis.com/embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding-2 | 200,000,000 | aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding-2 | 60,000 | aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model |
בקשות ל-gemini-embedding-001 באמצעות predict API כפופות גם למכסות הבאות:
| מודל בסיס | מכסה | מדד |
|---|---|---|
| base_model: gemini-embedding | 100,000 | aiplatform.googleapis.com/online_prediction_requests_per_base_model |
| base_model: N/A | 30,000 | aiplatform.googleapis.com/online_prediction_requests |
מכסות של Agent Runtime
המכסות הבאות חלות על Agent Runtime עבור פרויקט נתון בכל אזור:| תיאור | מכסה | מדד |
|---|---|---|
| יצירה, מחיקה או עדכון של משאבי Agent Runtime לדקה | 10 | aiplatform.googleapis.com/reasoning_engine_service_write_requests |
| יצירה, מחיקה או עדכון של סשנים של Agent Runtime לדקה | 100 | aiplatform.googleapis.com/session_write_requests |
| קבלת רשימה או אחזור של סשנים של Agent Runtime בדקה | 10000 | aiplatform.googleapis.com/session_read_requests |
Query או StreamQuery Agent Runtime לדקה
|
90 | aiplatform.googleapis.com/reasoning_engine_service_query_requests |
| הוספת אירוע לסשנים בדקה ב-Agent Runtime | 300 | aiplatform.googleapis.com/session_event_append_requests |
| מספר המשאבים המקסימלי של Agent Runtime | 100 | aiplatform.googleapis.com/reasoning_engine_service_entities |
| יצירה, מחיקה או עדכון של משאבי זיכרון של Agent Runtime בכל דקה | 100 | aiplatform.googleapis.com/memory_bank_write_requests |
| קבלת נתונים, הצגת רשימה או אחזור נתונים מ-Memory Bank של Agent Runtime בכל דקה | 300 | aiplatform.googleapis.com/memory_bank_read_requests |
| סביבת Sandbox (הרצת קוד) – ביצוע בקשות לדקה | 1000 | aiplatform.googleapis.com/sandbox_environment_execute_requests |
| ישויות של סביבת ארגז חול (הפעלת קוד) לכל אזור | 1000 | aiplatform.googleapis.com/sandbox_environment_entities |
| בקשות כתיבה לדקה בסביבת ארגז חול (הפעלת קוד) | 500 | aiplatform.googleapis.com/sandbox_environment_write_requests |
בקשות מ-Agent ל-Agent כמו sendMessage ו-cancelTask לדקה
|
60 | aiplatform.googleapis.com/a2a_agent_post_requests |
סוכן A2A מקבל בקשות כמו getTask ו-getCard לדקה
|
600 | aiplatform.googleapis.com/a2a_agent_get_requests |
חיבורים דו-כיווניים בו-זמניים בשידור חי באמצעות BidiStreamQuery API לדקה
|
10 |
aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests
|
מכסות של קלט מרובה מצבים
המכסות הבאות חלות על קלט מולטי-מודאלי בבקשות ל-generateContent ול-streamGenerateContent עבור פרויקט נתון בכל אזור. כל מכסה נאכפת לכל מודל בסיס ולכל רזולוציה. אותן מגבלות חלות על בקשות שמטופלות על ידי נקודת הקצה הגלובלית, באמצעות המדד המתאים ..._global.
| תיאור | מכסה | מדד |
|---|---|---|
| יצירת בקשות לתוכן עם קלט של תמונה לדקה לכל מודל בסיס ורזולוציה | 34,000,000 | aiplatform.googleapis.com/generate_content_image_input_per_base_model_id_and_resolution |
| יצירת בקשות לתוכן עם קלט של סרטון לדקה לכל מודל בסיס ורזולוציה | 192,000,000 | aiplatform.googleapis.com/generate_content_video_input_per_base_model_id_and_resolution |
| יצירת בקשות לתוכן עם קלט אודיו לדקה לכל מודל בסיסי ורזולוציה | 11,000,000 | aiplatform.googleapis.com/generate_content_audio_input_per_base_model_id_and_resolution |
| יצירת בקשות לתוכן עם קלט מסמך לדקה לכל מודל בסיסי ורזולוציה | 1,200,000 | aiplatform.googleapis.com/generate_content_document_input_per_base_model_id_and_resolution |
כדי לבקש להגדיל את המכסות האלה, צריך לפנות לצוות ניהול החשבון שלכם ב-Google Cloud. אי אפשר להגדיל אותן דרך מסוף Google Cloud .
היסק באצווה
המכסות והמגבלות של משימות הסקה באצווה זהות בכל האזורים.מגבלות על מספר המשימות של הסקת מסקנות באצווה במקביל במודלים של Gemini
אין מכסות מוגדרות מראש להסקת מסקנות באצווה במודלים של Gemini. במקום זאת, שירות ה-Batch מספק גישה למאגר גדול של משאבים משותפים, שמוקצים באופן דינמי על סמך הזמינות בזמן אמת של המודל והביקוש למודל בקרב כל הלקוחות. אם יש הרבה לקוחות פעילים והקיבולת של המודל מלאה, יכול להיות שהבקשות שלכם יוכנסו לתור.מכסות של משימות הסקה (inference) בו-זמניות של מודלים שאינם Gemini
בטבלה הבאה מפורטות המכסות של מספר משימות ההסקה באצווה שפועלות בו-זמנית, שלא חלות על מודלים של Gemini:| Quota | ערך |
|---|---|
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs |
4 |
איך רואים ועורכים את המכסות במסוף Google Cloud
כדי לראות ולערוך את המכסות במסוף Google Cloud :- נכנסים לדף Quotas and System Limits.
- כדי לשנות את המכסה, מעתיקים ומדביקים את המאפיין
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobsבשדה Filter. מקישים על Enter. - לוחצים על סמל האפשרויות הנוספות (3 נקודות) בסוף השורה ובוחרים באפשרות עריכת נפח האחסון.
- מזינים את ערך המכסה החדש בחלונית ולוחצים על שליחת בקשה.
כניסה לדף Quotas and System Limits
מכסות של מדיניות סמנטית לניהול נתונים
המכסות הבאות חלות על מדיניות סמנטית לניהול נתונים בפרויקט נתון בכל אזור:| תיאור | מכסה | מדד |
|---|---|---|
| קבלת משאבים של מדיניות סמנטית לניהול גישה או הצגת רשימה שלהם לדקה | 600 | aiplatform.googleapis.com/semantic_governance/policy_read_requests |
| יצירה, עדכון או מחיקה של משאבי מדיניות לניהול סמנטיקה לדקה | 60 | aiplatform.googleapis.com/semantic_governance/policy_write_requests |
| קבלת משאבים של מנוע מדיניות לניהול סמנטיקה לדקה | 600 | aiplatform.googleapis.com/semantic_governance/engine_read_requests |
| עדכון או ביטול הקצאת משאבים של מנוע מדיניות הסמנטיקה בכל דקה | 60 | aiplatform.googleapis.com/semantic_governance/engine_write_requests |
| מספר המשאבים של מדיניות ניהול סמנטי לכל פרויקט בכל מיקום. | 1,000 | aiplatform.googleapis.com/semantic_governance/policy_count |
איך רואים ועורכים את המכסות במסוף Google Cloud
כדי לראות ולערוך את המכסות במסוף Google Cloud :- נכנסים לדף Quotas and System Limits.
- כדי לשנות את המכסה, מעתיקים ומדביקים את המאפיין
aiplatform.googleapis.com/semantic_governance/policy_write_requestsבשדה Filter. מקישים על Enter. - לוחצים על סמל האפשרויות הנוספות (3 נקודות) בסוף השורה ובוחרים באפשרות עריכת נפח האחסון.
- מזינים את ערך המכסה החדש בחלונית ולוחצים על שליחת בקשה.
כניסה לדף Quotas and System Limits
מנוע RAG ב-Gemini Enterprise Agent Platform
כדי שכל שירות יבצע יצירה משולבת-אחזור (RAG) באמצעות RAG Engine, חלות המכסות הבאות, והמכסה נמדדת כבקשות לדקה (RPM).| שירות | מכסה | מדד |
|---|---|---|
| ממשקי API לניהול נתונים של מנוע RAG | 60 סל"ד | VertexRagDataService requests per minute per region |
RetrievalContexts API |
600 סל״ד | VertexRagService retrieve requests per minute per region |
base_model: textembedding-gecko |
1,500 סל״ד | Online prediction requests per base model per minute per region per base_modelמסנן נוסף שאפשר לציין הוא base_model: textembedding-gecko |
| שירות | הגבלה | מדד |
|---|---|---|
בקשות מקבילות ImportRagFiles |
3 RPM | VertexRagService concurrent import requests per region |
מספר הקבצים המקסימלי לכל בקשת ImportRagFiles |
10,000 | VertexRagService import rag files requests per region |
שירות הערכה של AI גנרטיבי
שירות ההערכה של AI גנרטיבי משתמש ב-Gemini 2.5 Flash כמודל שופט ברירת המחדל למדדים מבוססי-מודל. בקשה אחת להערכה של מדד שמבוסס על מודל עשויה להוביל לכמה בקשות בסיסיות לשירות ההערכה של AI גנרטיבי. השימוש בכל מודל מחושב ברמת הארגון, כלומר כל בקשה שמופנית למודל judge לצורך הסקת מסקנות על סמך מודל והערכה מבוססת-מודל נכללת בחישוב השימוש במודל. בטבלה הבאה מוצגות מכסות לשירות ההערכה של AI גנרטיבי ולמודל השופט הבסיסי:| בקשה להגדלת המכסה | מכסה שמוגדרת כברירת מחדל |
|---|---|
| בקשות לדקה לשירות הערכה של AI גנרטיבי | 1,000 בקשות לכל פרויקט לכל אזור |
| תפוקה של Gemini | תלוי במודל ובאפשרות הצריכה |
| הרצות הערכה בו-זמנית | 20 הפעלות הערכה בו-זמניות לכל פרויקט בכל אזור |
אם אתם מקבלים שגיאה שקשורה למכסות בזמן השימוש בשירות להערכת AI גנרטיבי, יכול להיות שתצטרכו לשלוח בקשה להגדלת המכסה. מידע נוסף זמין במאמר בנושא איך רואים ומנהלים את המכסות.
| מגבלה | ערך |
|---|---|
| פסק זמן של בקשת שירות להערכה של AI גנרטיבי | 60 שניות |
כשמשתמשים בשירות להערכת AI גנרטיבי בפעם הראשונה בפרויקט חדש, יכול להיות שיהיה עיכוב של עד שתי דקות בהגדרה הראשונית. אם הבקשה הראשונה נכשלת, צריך להמתין כמה דקות ואז לנסות שוב. בדרך כלל, בקשות הערכה חוזרות מסתיימות תוך 60 שניות.
מספר הטוקנים המקסימלי של הקלט והפלט למדדים מבוססי-מודל תלוי במודל שמשמש כמודל השופט. רשימת המודלים מופיעה במאמר בנושא מודלים של Google.
מכסות של צינורות נתונים ב-Gemini Enterprise Agent Platform
כל משימת התאמה משתמשת בצינורות של Gemini Enterprise Agent Platform. מידע נוסף זמין במאמר מכסות ומגבלות של פייפליינים בפלטפורמת Agent Platform.
המאמרים הבאים
Standard PayGo
במאמר הזה מוסבר על Standard PayGo, אפשרות צריכה בפלטפורמת הסוכנים שמאפשרת לשלם רק על המשאבים שצורכים, בלי לדרוש התחייבויות כספיות מראש.
מכסות ומגבלות מערכת של Agent Platform
מכסות ומגבלות מערכת שקשורות ל-Agent Platform, לא כולל מכסות ומגבלות מערכת ספציפיות למוצרים.
מיכסות ב-Google Cloud
במאמר הזה מוסבר איך Google Cloud מגבילה את כמות המשאבים שאפשר להשתמש בהם בפרויקט בענן ב-Google Cloud, ואיך המכסות חלות על מגוון סוגי משאבים, כולל חומרה, תוכנה ורכיבי רשת.