מכסות ומגבלות מערכת ב-Agent Platform

במאמר הזה מפורטות המכסות והמגבלות של המערכת שחלות על מודלים של AI גנרטיבי ב-Agent Platform.

  • המכסות נקבעות כברירת מחדל, אבל בדרך כלל אפשר לבקש לשנות אותן.
  • מגבלות המערכת קבועות ואי אפשר לשנות אותן.

המכסות שלGoogle Cloud עוזרות לשמור על הוגנות ולצמצם עליות חדות בשימוש במשאבים ובזמינות שלהם. הן מגבילות את כמות המשאבים שלGoogle Cloud שאפשר להשתמש בהם בפרויקט ב- Google Cloud . המכסות רלוונטיות למגוון רחב של סוגי משאבים, כולל רכיבי חומרה, תוכנה ורשתות. לדוגמה, המכסות יכולות להגביל את מספר הקריאות ל-API בשירות מסוים, את מספר מאזני העומסים שאפשר להשתמש בהם בו-זמנית בפרויקט או את מספר הפרויקטים שאפשר ליצור. בשורה התחתונה, המכסות מגינות על משתמשיGoogle Cloud בכך שהן מונעות עומס יתר על השירותים, אבל גם עוזרות לשלוט על השימוש במשאבי Google Cloud .

מערכת המכסות ב-Cloud:

ברוב המקרים, כשאתם מנסים להשתמש ביותר משאבים מהמכסה, הגישה למשאב נחסמת ומה שאתם מנסים לעשות נכשל.

בדרך כלל, המכסות ב- Google Cloud הן ברמת הפרויקט. כלומר, השימוש במשאב מסוים בפרויקט כלשהו לא משפיע על המכסה שלכם בפרויקטים אחרים. ברמת הפרויקט ב- Google Cloud , המכסות משותפות לכל האפליקציות וכתובות ה-IP.

לסקירה כללית על מכסות ב-Cloud

למשאבי Agent Platform יש גם מגבלות מערכת. שאי אפשר לשנות.

יש גם מגבלות על משאבים ב-Gemini Enterprise Agent Platform. אי אפשר לשנות את מגבלות המערכת.

מכסות של מודלים שעברו התאמה

ההסקה של מודל שעבר התאמה משתמשת באותה מכסה כמו מודל הבסיס. אין מכסה נפרדת להסקת מסקנות ממודל שעבר התאמה.

מגבלות הטמעה

הבקשות ל-gemini-embedding-001 ול-gemini-embedding-2 כפופות למכסות גלובליות.
מודל בסיס מכסה מדד
base_model: gemini-embedding ‫100,000,000 aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model
base_model: gemini-embedding 100,000 aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model
base_model: gemini-embedding-2 200,000,000 aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model
base_model: gemini-embedding-2 60,000 aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model

בקשות ל-gemini-embedding-001 באמצעות predict API כפופות גם למכסות הבאות:

מודל בסיס מכסה מדד
base_model: N/A 30,000 aiplatform.googleapis.com/online_prediction_requests

מכסות של Agent Runtime

המכסות הבאות חלות על Agent Runtime עבור פרויקט נתון בכל אזור:
תיאור מכסה מדד
יצירה, מחיקה או עדכון של משאבי Agent Runtime לדקה 10 aiplatform.googleapis.com/reasoning_engine_service_write_requests
יצירה, מחיקה או עדכון של סשנים של Agent Runtime לדקה 100 aiplatform.googleapis.com/session_write_requests
קבלת רשימה או אחזור של סשנים ב-Agent Runtime לדקה 10000 aiplatform.googleapis.com/session_read_requests
Query או StreamQuery Agent Runtime לדקה 90 aiplatform.googleapis.com/reasoning_engine_service_query_requests
הוספת אירוע לסשנים בדקה ב-Agent Runtime 300 aiplatform.googleapis.com/session_event_append_requests
מספר מקסימלי של משאבים של Agent Runtime 100 aiplatform.googleapis.com/reasoning_engine_service_entities
יצירה, מחיקה או עדכון של משאבי זיכרון של Agent Runtime בכל דקה 100 aiplatform.googleapis.com/memory_bank_write_requests
קבלת נתונים, הצגת רשימה או אחזור נתונים מ-Memory Bank של Agent Runtime בכל דקה 300 aiplatform.googleapis.com/memory_bank_read_requests
סביבת Sandbox (הרצת קוד) – הרצת בקשות לדקה 1000 aiplatform.googleapis.com/sandbox_environment_execute_requests
ישויות של סביבת ארגז חול (הפעלת קוד) לפי אזור 1000 aiplatform.googleapis.com/sandbox_environment_entities
בקשות כתיבה לדקה בסביבת ארגז חול (הרצת קוד) 500 aiplatform.googleapis.com/sandbox_environment_write_requests
בקשות מ-Agent ל-Agent כמו sendMessage ו-cancelTask לדקה 60 aiplatform.googleapis.com/a2a_agent_post_requests
‫A2A Agent מקבל בקשות כמו getTask ו-getCard לדקה 600 aiplatform.googleapis.com/a2a_agent_get_requests
חיבורים דו-כיווניים בו-זמניים בשידור חי באמצעות BidiStreamQuery API לדקה 10 aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests

מכסות של קלט מולטי-מודאלי

המכסות הבאות חלות על קלט מולטי-מודאלי בבקשות ל-generateContent ול-streamGenerateContent עבור פרויקט נתון בכל אזור. כל מכסה נאכפת לכל מודל בסיס ורזולוציה. אותן מגבלות חלות על בקשות שמטופלות על ידי נקודת הקצה הגלובלית, באמצעות המדד המתאים ..._global.
תיאור מכסה מדד
יצירת בקשות לתוכן עם קלט של תמונה לדקה לכל מודל בסיס ורזולוציה 34,000,000 aiplatform.googleapis.com/generate_content_image_input_per_base_model_id_and_resolution
יצירת בקשות לתוכן עם קלט של סרטון לדקה לכל מודל בסיסי ורזולוציה ‫192,000,000 aiplatform.googleapis.com/generate_content_video_input_per_base_model_id_and_resolution
יצירת בקשות לתוכן עם קלט אודיו לדקה לכל מודל בסיסי ורזולוציה ‫11,000,000 aiplatform.googleapis.com/generate_content_audio_input_per_base_model_id_and_resolution
יצירת בקשות לתוכן עם קלט מסמך לדקה לכל מודל בסיסי ורזולוציה 1,200,000 aiplatform.googleapis.com/generate_content_document_input_per_base_model_id_and_resolution

כדי לבקש להגדיל את המכסות האלה, צריך לפנות לצוות ניהול החשבון שלכם ב-Google Cloud. אי אפשר להגדיל אותן דרך מסוף Google Cloud .

מכסות של מדיה גנרטיבית

כדי לראות ולערוך את מכסות המדיה הגנרטיבית במסוף Google Cloud :

  1. מוודאים ש הפעלתם את Agent Platform API בפרויקט. אם ה-API לא מופעל, המכסות של Agent Platform לא יוצגו.
  2. עוברים לדף Quotas and System Limits (מכסות ומגבלות מערכת).

    כניסה לדף Quotas and System Limits

  3. בתיבת הטקסט Filter, מזינים את השאילתות הבאות:

    Metric: METRIC_NAME
    Dimensions (e.g. location): MODEL_NAME

    מחליפים את מה שכתוב בשדות הבאים:

    • ‫METRIC_NAME: שם המדד לחיפוש, אחת מהאפשרויות הבאות:
      • ‫Gemini Omni: global_generate_content_requests_per_minute_per_project_per_base_model
      • ‫Veo: long_running_online_prediction_requests_per_base_model
      • Lyria: global_generate_content_requests_per_minute_per_project_per_base_model
    • ‫MODEL_NAME: השם של המודל שבו אתם משתמשים.
  4. כדי לשנות את המכסה, לוחצים על More ואז על Edit quota.
  5. מזינים את ערך המכסה החדש בחלונית ולוחצים על שליחת בקשה.

היסק באצווה

המיכסות והמגבלות של משימות באצווה להסקת מסקנות זהות בכל האזורים.

מגבלות על מספר המשימות של הסקת מסקנות באצווה במקביל במודלים של Gemini

אין מכסות מוגדרות מראש להסקת מסקנות באצווה במודלים של Gemini. במקום זאת, שירות ה-Batch מספק גישה למאגר גדול של משאבים משותפים, שמוקצים באופן דינמי על סמך הזמינות בזמן אמת של המודל והביקוש למודל בקרב כל הלקוחות. כשיש יותר לקוחות פעילים והקיבולת של המודל מלאה, יכול להיות שהבקשות שלכם לעיבוד באצווה יתווספו לתור עד שתתפנה קיבולת.

מכסות של משימות הסקה אצווה בו-זמניות במודלים שאינם Gemini

בטבלה הבאה מפורטות המכסות של מספר משימות ההסקה באצווה שפועלות במקביל, שלא חלות על מודלים של Gemini:
Quota ערך
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs 4
אם מספר המשימות שנשלחו חורג מהמכסה שהוקצתה, המשימות מועברות לתור ומתבצע עיבוד שלהן כשהקיבולת של המכסה מתפנה.

הצגה ועריכה של המכסות במסוף Google Cloud

כדי לראות ולערוך את המכסות במסוף Google Cloud :
  1. עוברים לדף Quotas and System Limits (מכסות ומגבלות מערכת).
  2. כניסה לדף Quotas and System Limits

  3. כדי לשנות את המכסה, מעתיקים את המאפיין aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs ומשנים את הערך שלו בFilter. מקישים על Enter.
  4. לוחצים על סמל האפשרויות הנוספות (3 נקודות) בסוף השורה ובוחרים באפשרות עריכת המכסה.
  5. מזינים את ערך המכסה החדש בחלונית ולוחצים על שליחת בקשה.

מכסות של מדיניות פיקוח בשפה טבעית

המכסות הבאות חלות על מדיניות פיקוח בשפה טבעית בפרויקט נתון בכל אזור:
תיאור מכסה מדד
קבלת או הצגת רשימה של משאבי מדיניות פיקוח בשפה טבעית לדקה 600 aiplatform.googleapis.com/semantic_governance/policy_read_requests
יצירה, עדכון או מחיקה של משאבי מדיניות פיקוח בשפה טבעית לדקה 60 aiplatform.googleapis.com/semantic_governance/policy_write_requests
קבלת משאבים של מנוע מדיניות פיקוח בשפה טבעית לדקה 600 aiplatform.googleapis.com/semantic_governance/engine_read_requests
עדכון או ביטול הקצאת משאבים של מנוע מדיניות הפיקוח בשפה טבעית מדי דקה 60 aiplatform.googleapis.com/semantic_governance/engine_write_requests
מספר משאבי מדיניות הפיקוח בשפה טבעית לכל פרויקט בכל מיקום. 1,000 aiplatform.googleapis.com/semantic_governance/policy_count

הצגה ועריכה של המכסות במסוף Google Cloud

כדי לראות ולערוך את המכסות במסוף Google Cloud :
  1. עוברים לדף Quotas and System Limits (מכסות ומגבלות מערכת).
  2. כניסה לדף Quotas and System Limits

  3. כדי לשנות את המכסה, מעתיקים את המאפיין aiplatform.googleapis.com/semantic_governance/policy_write_requests ומשנים את הערך שלו בFilter. מקישים על Enter.
  4. לוחצים על סמל האפשרויות הנוספות (3 נקודות) בסוף השורה ובוחרים באפשרות עריכת המכסה.
  5. מזינים את ערך המכסה החדש בחלונית ולוחצים על שליחת בקשה.

מנוע RAG ב-Gemini Enterprise Agent Platform

לכל שירות שמשתמש ב-RAG Engine כדי לבצע יצירה משופרת באחזור (RAG), חלות המכסות הבאות, והמכסה נמדדת כבקשות לדקה (RPM).
שירות מכסה מדד
ממשקי API לניהול נתונים של RAG Engine ‫60 סל״ד VertexRagDataService requests per minute per region
RetrievalContexts API ‫600 סל"ד VertexRagService retrieve requests per minute per region
base_model: textembedding-gecko ‫1,500 סל"ד Online prediction requests per base model per minute per region per base_model

מסנן נוסף שאפשר לציין הוא base_model: textembedding-gecko
אלה המגבלות הרלוונטיות:
שירות הגבלה מדד
בקשות ImportRagFiles בו-זמניות ‫3 RPM VertexRagService concurrent import requests per region
מספר הקבצים המקסימלי לכל בקשת ImportRagFiles 10,000 VertexRagService import rag files requests per region

שירות הערכה של AI גנרטיבי

שירות ההערכה של AI גנרטיבי משתמש ב-Gemini 2.5 Flash כמודל שופט ברירת המחדל למדדים מבוססי-מודל. בקשה אחת להערכה של מדד שמבוסס על מודל עשויה להוביל לכמה בקשות בסיסיות לשירות ההערכה של AI גנרטיבי. השימוש בכל מודל מחושב ברמת הארגון, כלומר כל בקשה שמופנית למודל judge לצורך הסקת מסקנות על סמך המודל והערכה מבוססת-מודל תורמת לשימוש במודל. בטבלה הבאה מוצגות מכסות לשירות ההערכה של AI גנרטיבי ולמודל השופט הבסיסי:
בקשה להגדלת המכסה מכסה שמוגדרת כברירת מחדל
בקשות לשירות הערכה של AI גנרטיבי לדקה ‫1,000 בקשות לכל פרויקט לכל אזור
קצב העברת הנתונים של Gemini תלוי במודל ובאפשרות הצריכה
הרצות הערכה בו-זמניות ‫20 הפעלות הערכה בו-זמניות לכל פרויקט בכל אזור

אם אתם מקבלים שגיאה שקשורה למכסות בזמן השימוש בשירות להערכת AI גנרטיבי, יכול להיות שתצטרכו לשלוח בקשה להגדלת המכסה. מידע נוסף זמין במאמר בנושא איך רואים ומנהלים את המכסות.

מגבלה ערך
פסק זמן של בקשה לשירות הערכה של AI גנרטיבי ‫60 שניות

כשמשתמשים בשירות להערכת AI גנרטיבי בפעם הראשונה בפרויקט חדש, יכול להיות שיהיה עיכוב של עד שתי דקות בהגדרה הראשונית. אם הבקשה הראשונה נכשלת, צריך להמתין כמה דקות ואז לנסות שוב. בדרך כלל, בקשות להערכה נוספת מסתיימות תוך 60 שניות.

מספר הטוקנים המקסימלי של הקלט והפלט למדדים שמבוססים על מודל תלוי במודל שמשמש כמודל השופט. רשימת המודלים מופיעה במאמר בנושא מודלים של Google.

מכסות של Gemini Enterprise Agent Platform Pipelines

כל משימת כוונון משתמשת בצינורות של Gemini Enterprise Agent Platform. מידע נוסף זמין במאמר מכסות ומגבלות של פייפליינים בפלטפורמת Agent Platform.

המאמרים הבאים

סקירה כללית

מידע על Standard PayGo, אפשרות צריכה בפלטפורמת הסוכנים שמאפשרת לשלם רק על המשאבים שצורכים, בלי לדרוש התחייבויות כספיות מראש.

Resource

מכסות ומגבלות מערכת שקשורות ל-Agent Platform, לא כולל מכסות ומגבלות מערכת ספציפיות למוצרים.

סקירה כללית

במאמר הזה מוסבר איך Google Cloud מגבילה את כמות המשאבים שאפשר להשתמש בהם בפרויקט בענן ב-Google Cloud, ואיך המכסות חלות על מגוון סוגי משאבים, כולל חומרה, תוכנה ורכיבי רשת.