מכסות ומגבלות מערכת של AI גנרטיבי ב-Gemini Enterprise Agent Platform

בדף הזה מופיעה רשימה של מכסות לפי אזור ומודל, ומוסבר בו איך להציג ולערוך את המכסות ב Google Cloud מסוף.

מכסות של מודלים שעברו התאמה

הסקת מסקנות ממודל שעבר התאמה משתמשת באותה מכסה כמו מודל הבסיס. אין מכסה נפרדת להסקת מסקנות ממודל שעבר התאמה.

מגבלות על הטמעה

בקשות ל-gemini-embedding-001 כפופות למכסות אזוריות, ובקשות ל-gemini-embedding-2 כפופות למכסות גלובליות.
מודל בסיס מכסה מדד
base_model: gemini-embedding ‫100,000,000 aiplatform.googleapis.com/embed_content_input_tokens_per_minute_per_base_model
base_model: gemini-embedding-2 200,000,000 aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model
base_model: gemini-embedding-2 60,000 aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model

בקשות ל-gemini-embedding-001 באמצעות predict API כפופות גם למכסות הבאות:

מודל בסיס מכסה מדד
base_model: gemini-embedding 100,000 aiplatform.googleapis.com/online_prediction_requests_per_base_model
base_model: N/A 30,000 aiplatform.googleapis.com/online_prediction_requests

מכסות של Agent Runtime

המכסות הבאות חלות על Agent Runtime עבור פרויקט נתון בכל אזור:
תיאור מכסה מדד
יצירה, מחיקה או עדכון של משאבי Agent Runtime לדקה 10 aiplatform.googleapis.com/reasoning_engine_service_write_requests
יצירה, מחיקה או עדכון של סשנים של Agent Runtime לדקה 100 aiplatform.googleapis.com/session_write_requests
קבלת רשימה או אחזור של סשנים של Agent Runtime בדקה 10000 aiplatform.googleapis.com/session_read_requests
Query או StreamQuery Agent Runtime לדקה 90 aiplatform.googleapis.com/reasoning_engine_service_query_requests
הוספת אירוע לסשנים בדקה ב-Agent Runtime 300 aiplatform.googleapis.com/session_event_append_requests
מספר המשאבים המקסימלי של Agent Runtime 100 aiplatform.googleapis.com/reasoning_engine_service_entities
יצירה, מחיקה או עדכון של משאבי זיכרון של Agent Runtime בכל דקה 100 aiplatform.googleapis.com/memory_bank_write_requests
קבלת נתונים, הצגת רשימה או אחזור נתונים מ-Memory Bank של Agent Runtime בכל דקה 300 aiplatform.googleapis.com/memory_bank_read_requests
סביבת Sandbox (הרצת קוד) – ביצוע בקשות לדקה 1000 aiplatform.googleapis.com/sandbox_environment_execute_requests
ישויות של סביבת ארגז חול (הפעלת קוד) לכל אזור 1000 aiplatform.googleapis.com/sandbox_environment_entities
בקשות כתיבה לדקה בסביבת ארגז חול (הפעלת קוד) 500 aiplatform.googleapis.com/sandbox_environment_write_requests
בקשות מ-Agent ל-Agent כמו sendMessage ו-cancelTask לדקה 60 aiplatform.googleapis.com/a2a_agent_post_requests
סוכן A2A מקבל בקשות כמו getTask ו-getCard לדקה 600 aiplatform.googleapis.com/a2a_agent_get_requests
חיבורים דו-כיווניים בו-זמניים בשידור חי באמצעות BidiStreamQuery API לדקה 10 aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests

מכסות של קלט מרובה מצבים

המכסות הבאות חלות על קלט מולטי-מודאלי בבקשות ל-generateContent ול-streamGenerateContent עבור פרויקט נתון בכל אזור. כל מכסה נאכפת לכל מודל בסיס ולכל רזולוציה. אותן מגבלות חלות על בקשות שמטופלות על ידי נקודת הקצה הגלובלית, באמצעות המדד המתאים ..._global.
תיאור מכסה מדד
יצירת בקשות לתוכן עם קלט של תמונה לדקה לכל מודל בסיס ורזולוציה 34,000,000 aiplatform.googleapis.com/generate_content_image_input_per_base_model_id_and_resolution
יצירת בקשות לתוכן עם קלט של סרטון לדקה לכל מודל בסיס ורזולוציה ‫192,000,000 aiplatform.googleapis.com/generate_content_video_input_per_base_model_id_and_resolution
יצירת בקשות לתוכן עם קלט אודיו לדקה לכל מודל בסיסי ורזולוציה ‫11,000,000 aiplatform.googleapis.com/generate_content_audio_input_per_base_model_id_and_resolution
יצירת בקשות לתוכן עם קלט מסמך לדקה לכל מודל בסיסי ורזולוציה 1,200,000 aiplatform.googleapis.com/generate_content_document_input_per_base_model_id_and_resolution

כדי לבקש להגדיל את המכסות האלה, צריך לפנות לצוות ניהול החשבון שלכם ב-Google Cloud. אי אפשר להגדיל אותן דרך מסוף Google Cloud .

היסק באצווה

המכסות והמגבלות של משימות הסקה באצווה זהות בכל האזורים.

מגבלות על מספר המשימות של הסקת מסקנות באצווה במקביל במודלים של Gemini

אין מכסות מוגדרות מראש להסקת מסקנות באצווה במודלים של Gemini. במקום זאת, שירות ה-Batch מספק גישה למאגר גדול של משאבים משותפים, שמוקצים באופן דינמי על סמך הזמינות בזמן אמת של המודל והביקוש למודל בקרב כל הלקוחות. אם יש הרבה לקוחות פעילים והקיבולת של המודל מלאה, יכול להיות שהבקשות שלכם יוכנסו לתור.

מכסות של משימות הסקה (inference) בו-זמניות של מודלים שאינם Gemini

בטבלה הבאה מפורטות המכסות של מספר משימות ההסקה באצווה שפועלות בו-זמנית, שלא חלות על מודלים של Gemini:
Quota ערך
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs 4
אם מספר המשימות שנשלחו חורג מהמכסה שהוקצתה, המשימות מועברות לתור ומעובדות כשהקיבולת של המכסה תהיה זמינה.

איך רואים ועורכים את המכסות במסוף Google Cloud

כדי לראות ולערוך את המכסות במסוף Google Cloud :
  1. נכנסים לדף Quotas and System Limits.
  2. כניסה לדף Quotas and System Limits

  3. כדי לשנות את המכסה, מעתיקים ומדביקים את המאפיין aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs בשדה Filter. מקישים על Enter.
  4. לוחצים על סמל האפשרויות הנוספות (3 נקודות) בסוף השורה ובוחרים באפשרות עריכת נפח האחסון.
  5. מזינים את ערך המכסה החדש בחלונית ולוחצים על שליחת בקשה.

מכסות של מדיניות סמנטית לניהול נתונים

המכסות הבאות חלות על מדיניות סמנטית לניהול נתונים בפרויקט נתון בכל אזור:
תיאור מכסה מדד
קבלת משאבים של מדיניות סמנטית לניהול גישה או הצגת רשימה שלהם לדקה 600 aiplatform.googleapis.com/semantic_governance/policy_read_requests
יצירה, עדכון או מחיקה של משאבי מדיניות לניהול סמנטיקה לדקה 60 aiplatform.googleapis.com/semantic_governance/policy_write_requests
קבלת משאבים של מנוע מדיניות לניהול סמנטיקה לדקה 600 aiplatform.googleapis.com/semantic_governance/engine_read_requests
עדכון או ביטול הקצאת משאבים של מנוע מדיניות הסמנטיקה בכל דקה 60 aiplatform.googleapis.com/semantic_governance/engine_write_requests
מספר המשאבים של מדיניות ניהול סמנטי לכל פרויקט בכל מיקום. 1,000 aiplatform.googleapis.com/semantic_governance/policy_count

איך רואים ועורכים את המכסות במסוף Google Cloud

כדי לראות ולערוך את המכסות במסוף Google Cloud :
  1. נכנסים לדף Quotas and System Limits.
  2. כניסה לדף Quotas and System Limits

  3. כדי לשנות את המכסה, מעתיקים ומדביקים את המאפיין aiplatform.googleapis.com/semantic_governance/policy_write_requests בשדה Filter. מקישים על Enter.
  4. לוחצים על סמל האפשרויות הנוספות (3 נקודות) בסוף השורה ובוחרים באפשרות עריכת נפח האחסון.
  5. מזינים את ערך המכסה החדש בחלונית ולוחצים על שליחת בקשה.

מנוע RAG ב-Gemini Enterprise Agent Platform

כדי שכל שירות יבצע יצירה משולבת-אחזור (RAG) באמצעות RAG Engine, חלות המכסות הבאות, והמכסה נמדדת כבקשות לדקה (RPM).
שירות מכסה מדד
ממשקי API לניהול נתונים של מנוע RAG ‫60 סל"ד VertexRagDataService requests per minute per region
RetrievalContexts API ‫600 סל״ד VertexRagService retrieve requests per minute per region
base_model: textembedding-gecko ‫1,500 סל״ד Online prediction requests per base model per minute per region per base_model

מסנן נוסף שאפשר לציין הוא base_model: textembedding-gecko
המגבלות הבאות חלות:
שירות הגבלה מדד
בקשות מקבילות ImportRagFiles ‫3 RPM VertexRagService concurrent import requests per region
מספר הקבצים המקסימלי לכל בקשת ImportRagFiles 10,000 VertexRagService import rag files requests per region

שירות הערכה של AI גנרטיבי

שירות ההערכה של AI גנרטיבי משתמש ב-Gemini 2.5 Flash כמודל שופט ברירת המחדל למדדים מבוססי-מודל. בקשה אחת להערכה של מדד שמבוסס על מודל עשויה להוביל לכמה בקשות בסיסיות לשירות ההערכה של AI גנרטיבי. השימוש בכל מודל מחושב ברמת הארגון, כלומר כל בקשה שמופנית למודל judge לצורך הסקת מסקנות על סמך מודל והערכה מבוססת-מודל נכללת בחישוב השימוש במודל. בטבלה הבאה מוצגות מכסות לשירות ההערכה של AI גנרטיבי ולמודל השופט הבסיסי:
בקשה להגדלת המכסה מכסה שמוגדרת כברירת מחדל
בקשות לדקה לשירות הערכה של AI גנרטיבי ‫1,000 בקשות לכל פרויקט לכל אזור
תפוקה של Gemini תלוי במודל ובאפשרות הצריכה
הרצות הערכה בו-זמנית ‫20 הפעלות הערכה בו-זמניות לכל פרויקט בכל אזור

אם אתם מקבלים שגיאה שקשורה למכסות בזמן השימוש בשירות להערכת AI גנרטיבי, יכול להיות שתצטרכו לשלוח בקשה להגדלת המכסה. מידע נוסף זמין במאמר בנושא איך רואים ומנהלים את המכסות.

מגבלה ערך
פסק זמן של בקשת שירות להערכה של AI גנרטיבי ‫60 שניות

כשמשתמשים בשירות להערכת AI גנרטיבי בפעם הראשונה בפרויקט חדש, יכול להיות שיהיה עיכוב של עד שתי דקות בהגדרה הראשונית. אם הבקשה הראשונה נכשלת, צריך להמתין כמה דקות ואז לנסות שוב. בדרך כלל, בקשות הערכה חוזרות מסתיימות תוך 60 שניות.

מספר הטוקנים המקסימלי של הקלט והפלט למדדים מבוססי-מודל תלוי במודל שמשמש כמודל השופט. רשימת המודלים מופיעה במאמר בנושא מודלים של Google.

מכסות של צינורות נתונים ב-Gemini Enterprise Agent Platform

כל משימת התאמה משתמשת בצינורות של Gemini Enterprise Agent Platform. מידע נוסף זמין במאמר מכסות ומגבלות של פייפליינים בפלטפורמת Agent Platform.

המאמרים הבאים

סקירה כללית

במאמר הזה מוסבר על Standard PayGo, אפשרות צריכה בפלטפורמת הסוכנים שמאפשרת לשלם רק על המשאבים שצורכים, בלי לדרוש התחייבויות כספיות מראש.

Resource

מכסות ומגבלות מערכת שקשורות ל-Agent Platform, לא כולל מכסות ומגבלות מערכת ספציפיות למוצרים.

סקירה כללית

במאמר הזה מוסבר איך Google Cloud מגבילה את כמות המשאבים שאפשר להשתמש בהם בפרויקט בענן ב-Google Cloud, ואיך המכסות חלות על מגוון סוגי משאבים, כולל חומרה, תוכנה ורכיבי רשת.