במאמר הזה מפורטות המכסות והמגבלות של המערכת שחלות על מודלים של AI גנרטיבי ב-Agent Platform.
- המכסות נקבעות כברירת מחדל, אבל בדרך כלל אפשר לבקש לשנות אותן.
- מגבלות המערכת קבועות ואי אפשר לשנות אותן.
המכסות שלGoogle Cloud עוזרות לשמור על הוגנות ולצמצם עליות חדות בשימוש במשאבים ובזמינות שלהם. הן מגבילות את כמות המשאבים שלGoogle Cloud שאפשר להשתמש בהם בפרויקט ב- Google Cloud . המכסות רלוונטיות למגוון רחב של סוגי משאבים, כולל רכיבי חומרה, תוכנה ורשתות. לדוגמה, המכסות יכולות להגביל את מספר הקריאות ל-API בשירות מסוים, את מספר מאזני העומסים שאפשר להשתמש בהם בו-זמנית בפרויקט או את מספר הפרויקטים שאפשר ליצור. בשורה התחתונה, המכסות מגינות על משתמשיGoogle Cloud בכך שהן מונעות עומס יתר על השירותים, אבל גם עוזרות לשלוט על השימוש במשאבי Google Cloud .
מערכת המכסות ב-Cloud:
- עוקבת אחרי השימוש במוצרים ובשירותים של Google Cloud
- מגבילה את השימוש במשאבים האלה
- כוללת כלי שבאמצעותו אפשר לשלוח בקשות לשינוי המכסות ולשנות אותן אוטומטית
ברוב המקרים, כשאתם מנסים להשתמש ביותר משאבים מהמכסה, הגישה למשאב נחסמת ומה שאתם מנסים לעשות נכשל.
בדרך כלל, המכסות ב- Google Cloud הן ברמת הפרויקט. כלומר, השימוש במשאב מסוים בפרויקט כלשהו לא משפיע על המכסה שלכם בפרויקטים אחרים. ברמת הפרויקט ב- Google Cloud , המכסות משותפות לכל האפליקציות וכתובות ה-IP.
למשאבי Agent Platform יש גם מגבלות מערכת. שאי אפשר לשנות.
יש גם מגבלות על משאבים ב-Gemini Enterprise Agent Platform. אי אפשר לשנות את מגבלות המערכת.
מכסות של מודלים שעברו התאמה
ההסקה של מודל שעבר התאמה משתמשת באותה מכסה כמו מודל הבסיס. אין מכסה נפרדת להסקת מסקנות ממודל שעבר התאמה.
מגבלות הטמעה
הבקשות ל-gemini-embedding-001 ול-gemini-embedding-2 כפופות למכסות גלובליות.
| מודל בסיס | מכסה | מדד |
|---|---|---|
| base_model: gemini-embedding | 100,000,000 | aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding | 100,000 | aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model |
| base_model: gemini-embedding-2 | 200,000,000 | aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model |
| base_model: gemini-embedding-2 | 60,000 | aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model |
בקשות ל-gemini-embedding-001 באמצעות predict API כפופות גם למכסות הבאות:
| מודל בסיס | מכסה | מדד |
|---|---|---|
| base_model: N/A | 30,000 | aiplatform.googleapis.com/online_prediction_requests |
מכסות של Agent Runtime
המכסות הבאות חלות על Agent Runtime עבור פרויקט נתון בכל אזור:| תיאור | מכסה | מדד |
|---|---|---|
| יצירה, מחיקה או עדכון של משאבי Agent Runtime לדקה | 10 | aiplatform.googleapis.com/reasoning_engine_service_write_requests |
| יצירה, מחיקה או עדכון של סשנים של Agent Runtime לדקה | 100 | aiplatform.googleapis.com/session_write_requests |
| קבלת רשימה או אחזור של סשנים ב-Agent Runtime לדקה | 10000 | aiplatform.googleapis.com/session_read_requests |
Query או StreamQuery Agent Runtime לדקה
|
90 | aiplatform.googleapis.com/reasoning_engine_service_query_requests |
| הוספת אירוע לסשנים בדקה ב-Agent Runtime | 300 | aiplatform.googleapis.com/session_event_append_requests |
| מספר מקסימלי של משאבים של Agent Runtime | 100 | aiplatform.googleapis.com/reasoning_engine_service_entities |
| יצירה, מחיקה או עדכון של משאבי זיכרון של Agent Runtime בכל דקה | 100 | aiplatform.googleapis.com/memory_bank_write_requests |
| קבלת נתונים, הצגת רשימה או אחזור נתונים מ-Memory Bank של Agent Runtime בכל דקה | 300 | aiplatform.googleapis.com/memory_bank_read_requests |
| סביבת Sandbox (הרצת קוד) – הרצת בקשות לדקה | 1000 | aiplatform.googleapis.com/sandbox_environment_execute_requests |
| ישויות של סביבת ארגז חול (הפעלת קוד) לפי אזור | 1000 | aiplatform.googleapis.com/sandbox_environment_entities |
| בקשות כתיבה לדקה בסביבת ארגז חול (הרצת קוד) | 500 | aiplatform.googleapis.com/sandbox_environment_write_requests |
בקשות מ-Agent ל-Agent כמו sendMessage ו-cancelTask לדקה
|
60 | aiplatform.googleapis.com/a2a_agent_post_requests |
A2A Agent מקבל בקשות כמו getTask ו-getCard לדקה
|
600 | aiplatform.googleapis.com/a2a_agent_get_requests |
חיבורים דו-כיווניים בו-זמניים בשידור חי באמצעות BidiStreamQuery API לדקה
|
10 |
aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests
|
מכסות של קלט מולטי-מודאלי
המכסות הבאות חלות על קלט מולטי-מודאלי בבקשות ל-generateContent ול-streamGenerateContent עבור פרויקט נתון בכל אזור. כל מכסה נאכפת לכל מודל בסיס ורזולוציה. אותן מגבלות חלות על בקשות שמטופלות על ידי נקודת הקצה הגלובלית, באמצעות המדד המתאים ..._global.
| תיאור | מכסה | מדד |
|---|---|---|
| יצירת בקשות לתוכן עם קלט של תמונה לדקה לכל מודל בסיס ורזולוציה | 34,000,000 | aiplatform.googleapis.com/generate_content_image_input_per_base_model_id_and_resolution |
| יצירת בקשות לתוכן עם קלט של סרטון לדקה לכל מודל בסיסי ורזולוציה | 192,000,000 | aiplatform.googleapis.com/generate_content_video_input_per_base_model_id_and_resolution |
| יצירת בקשות לתוכן עם קלט אודיו לדקה לכל מודל בסיסי ורזולוציה | 11,000,000 | aiplatform.googleapis.com/generate_content_audio_input_per_base_model_id_and_resolution |
| יצירת בקשות לתוכן עם קלט מסמך לדקה לכל מודל בסיסי ורזולוציה | 1,200,000 | aiplatform.googleapis.com/generate_content_document_input_per_base_model_id_and_resolution |
כדי לבקש להגדיל את המכסות האלה, צריך לפנות לצוות ניהול החשבון שלכם ב-Google Cloud. אי אפשר להגדיל אותן דרך מסוף Google Cloud .
מכסות של מדיה גנרטיבית
כדי לראות ולערוך את מכסות המדיה הגנרטיבית במסוף Google Cloud :
- מוודאים ש הפעלתם את Agent Platform API בפרויקט. אם ה-API לא מופעל, המכסות של Agent Platform לא יוצגו.
-
עוברים לדף Quotas and System Limits (מכסות ומגבלות מערכת).
-
בתיבת הטקסט Filter, מזינים את השאילתות הבאות:
Metric: METRIC_NAME
Dimensions (e.g. location): MODEL_NAMEמחליפים את מה שכתוב בשדות הבאים:
-
METRIC_NAME: שם המדד לחיפוש, אחת מהאפשרויות הבאות:
-
Gemini Omni:
global_generate_content_requests_per_minute_per_project_per_base_model -
Veo:
long_running_online_prediction_requests_per_base_model -
Lyria:
global_generate_content_requests_per_minute_per_project_per_base_model
-
Gemini Omni:
- MODEL_NAME: השם של המודל שבו אתם משתמשים.
-
METRIC_NAME: שם המדד לחיפוש, אחת מהאפשרויות הבאות:
- כדי לשנות את המכסה, לוחצים על More ואז על Edit quota.
- מזינים את ערך המכסה החדש בחלונית ולוחצים על שליחת בקשה.
היסק באצווה
המיכסות והמגבלות של משימות באצווה להסקת מסקנות זהות בכל האזורים.מגבלות על מספר המשימות של הסקת מסקנות באצווה במקביל במודלים של Gemini
אין מכסות מוגדרות מראש להסקת מסקנות באצווה במודלים של Gemini. במקום זאת, שירות ה-Batch מספק גישה למאגר גדול של משאבים משותפים, שמוקצים באופן דינמי על סמך הזמינות בזמן אמת של המודל והביקוש למודל בקרב כל הלקוחות. כשיש יותר לקוחות פעילים והקיבולת של המודל מלאה, יכול להיות שהבקשות שלכם לעיבוד באצווה יתווספו לתור עד שתתפנה קיבולת.מכסות של משימות הסקה אצווה בו-זמניות במודלים שאינם Gemini
בטבלה הבאה מפורטות המכסות של מספר משימות ההסקה באצווה שפועלות במקביל, שלא חלות על מודלים של Gemini:| Quota | ערך |
|---|---|
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs |
4 |
הצגה ועריכה של המכסות במסוף Google Cloud
כדי לראות ולערוך את המכסות במסוף Google Cloud :- עוברים לדף Quotas and System Limits (מכסות ומגבלות מערכת).
- כדי לשנות את המכסה, מעתיקים את המאפיין
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobsומשנים את הערך שלו בFilter. מקישים על Enter. - לוחצים על סמל האפשרויות הנוספות (3 נקודות) בסוף השורה ובוחרים באפשרות עריכת המכסה.
- מזינים את ערך המכסה החדש בחלונית ולוחצים על שליחת בקשה.
כניסה לדף Quotas and System Limits
מכסות של מדיניות פיקוח בשפה טבעית
המכסות הבאות חלות על מדיניות פיקוח בשפה טבעית בפרויקט נתון בכל אזור:| תיאור | מכסה | מדד |
|---|---|---|
| קבלת או הצגת רשימה של משאבי מדיניות פיקוח בשפה טבעית לדקה | 600 | aiplatform.googleapis.com/semantic_governance/policy_read_requests |
| יצירה, עדכון או מחיקה של משאבי מדיניות פיקוח בשפה טבעית לדקה | 60 | aiplatform.googleapis.com/semantic_governance/policy_write_requests |
| קבלת משאבים של מנוע מדיניות פיקוח בשפה טבעית לדקה | 600 | aiplatform.googleapis.com/semantic_governance/engine_read_requests |
| עדכון או ביטול הקצאת משאבים של מנוע מדיניות הפיקוח בשפה טבעית מדי דקה | 60 | aiplatform.googleapis.com/semantic_governance/engine_write_requests |
| מספר משאבי מדיניות הפיקוח בשפה טבעית לכל פרויקט בכל מיקום. | 1,000 | aiplatform.googleapis.com/semantic_governance/policy_count |
הצגה ועריכה של המכסות במסוף Google Cloud
כדי לראות ולערוך את המכסות במסוף Google Cloud :- עוברים לדף Quotas and System Limits (מכסות ומגבלות מערכת).
- כדי לשנות את המכסה, מעתיקים את המאפיין
aiplatform.googleapis.com/semantic_governance/policy_write_requestsומשנים את הערך שלו בFilter. מקישים על Enter. - לוחצים על סמל האפשרויות הנוספות (3 נקודות) בסוף השורה ובוחרים באפשרות עריכת המכסה.
- מזינים את ערך המכסה החדש בחלונית ולוחצים על שליחת בקשה.
כניסה לדף Quotas and System Limits
מנוע RAG ב-Gemini Enterprise Agent Platform
לכל שירות שמשתמש ב-RAG Engine כדי לבצע יצירה משופרת באחזור (RAG), חלות המכסות הבאות, והמכסה נמדדת כבקשות לדקה (RPM).| שירות | מכסה | מדד |
|---|---|---|
| ממשקי API לניהול נתונים של RAG Engine | 60 סל״ד | VertexRagDataService requests per minute per region |
RetrievalContexts API |
600 סל"ד | VertexRagService retrieve requests per minute per region |
base_model: textembedding-gecko |
1,500 סל"ד | Online prediction requests per base model per minute per region per base_modelמסנן נוסף שאפשר לציין הוא base_model: textembedding-gecko |
| שירות | הגבלה | מדד |
|---|---|---|
בקשות ImportRagFiles בו-זמניות |
3 RPM | VertexRagService concurrent import requests per region |
מספר הקבצים המקסימלי לכל בקשת ImportRagFiles |
10,000 | VertexRagService import rag files requests per region |
שירות הערכה של AI גנרטיבי
שירות ההערכה של AI גנרטיבי משתמש ב-Gemini 2.5 Flash כמודל שופט ברירת המחדל למדדים מבוססי-מודל. בקשה אחת להערכה של מדד שמבוסס על מודל עשויה להוביל לכמה בקשות בסיסיות לשירות ההערכה של AI גנרטיבי. השימוש בכל מודל מחושב ברמת הארגון, כלומר כל בקשה שמופנית למודל judge לצורך הסקת מסקנות על סמך המודל והערכה מבוססת-מודל תורמת לשימוש במודל. בטבלה הבאה מוצגות מכסות לשירות ההערכה של AI גנרטיבי ולמודל השופט הבסיסי:| בקשה להגדלת המכסה | מכסה שמוגדרת כברירת מחדל |
|---|---|
| בקשות לשירות הערכה של AI גנרטיבי לדקה | 1,000 בקשות לכל פרויקט לכל אזור |
| קצב העברת הנתונים של Gemini | תלוי במודל ובאפשרות הצריכה |
| הרצות הערכה בו-זמניות | 20 הפעלות הערכה בו-זמניות לכל פרויקט בכל אזור |
אם אתם מקבלים שגיאה שקשורה למכסות בזמן השימוש בשירות להערכת AI גנרטיבי, יכול להיות שתצטרכו לשלוח בקשה להגדלת המכסה. מידע נוסף זמין במאמר בנושא איך רואים ומנהלים את המכסות.
| מגבלה | ערך |
|---|---|
| פסק זמן של בקשה לשירות הערכה של AI גנרטיבי | 60 שניות |
כשמשתמשים בשירות להערכת AI גנרטיבי בפעם הראשונה בפרויקט חדש, יכול להיות שיהיה עיכוב של עד שתי דקות בהגדרה הראשונית. אם הבקשה הראשונה נכשלת, צריך להמתין כמה דקות ואז לנסות שוב. בדרך כלל, בקשות להערכה נוספת מסתיימות תוך 60 שניות.
מספר הטוקנים המקסימלי של הקלט והפלט למדדים שמבוססים על מודל תלוי במודל שמשמש כמודל השופט. רשימת המודלים מופיעה במאמר בנושא מודלים של Google.
מכסות של Gemini Enterprise Agent Platform Pipelines
כל משימת כוונון משתמשת בצינורות של Gemini Enterprise Agent Platform. מידע נוסף זמין במאמר מכסות ומגבלות של פייפליינים בפלטפורמת Agent Platform.
המאמרים הבאים
Standard PayGo
מידע על Standard PayGo, אפשרות צריכה בפלטפורמת הסוכנים שמאפשרת לשלם רק על המשאבים שצורכים, בלי לדרוש התחייבויות כספיות מראש.
מכסות ומגבלות מערכת של Agent Platform
מכסות ומגבלות מערכת שקשורות ל-Agent Platform, לא כולל מכסות ומגבלות מערכת ספציפיות למוצרים.
מיכסות ב-Google Cloud
במאמר הזה מוסבר איך Google Cloud מגבילה את כמות המשאבים שאפשר להשתמש בהם בפרויקט בענן ב-Google Cloud, ואיך המכסות חלות על מגוון סוגי משאבים, כולל חומרה, תוכנה ורכיבי רשת.