Standard PayGo

תשלום לפי שימוש Standard (Standard PayGo) הוא אפשרות צריכה לשימוש בחבילת מודלי ה-AI הגנרטיבי של Gemini Enterprise Agent Platform, כולל משפחת מודלי Gemini.

בשיטת התשלום הרגילה לפי שימוש, אתם משלמים רק על המשאבים שאתם צורכים, בלי התחייבויות כספיות מראש. כדי לספק ביצועים צפויים יותר לעומסי עבודה שניתנים להרחבה, במסלול הרגיל של תשלום לפי שימוש משולבת מערכת של רמות שימוש. Agent Platform מתאימה באופן דינמי את קיבולת התפוקה הבסיסית של הארגון, על סמך ההוצאה הכוללת על שירותים כשירים של Agent Platform במהלך תקופה מתגלגלת של 30 יום. ככל שההוצאות של הארגון גדלות, הוא עובר אוטומטית לרמות גבוהות יותר שמספקות גישה מוגברת למשאבים משותפים וסף ביצועים גבוה יותר. אם אתם צריכים ביצועים עקביים יותר מאלה של Standard PayGo, כדאי לכם לשקול להשתמש ב-Priority PayGo. למידע על הקצאת משאבים לפי התפוקה שנקבעה, ראו הקצאת משאבים לפי התפוקה שנקבעה.

רמות שימוש ותפוקה

כל רמת שימוש בתמחור הרגיל לפי שימוש נועדה לספק תפוקה בסיסית, שנמדדת בטוקנים לדקה (TPM), ומשמשת כרף ביצועים צפוי לתנועה בארגון. מגבלות התפוקה מבוססות על בקשות שנשלחות לנקודת הקצה הגלובלית. שימוש בנקודת הקצה הגלובלית הוא שיטה מומלצת, כי היא מספקת גישה למאגר גדול יותר של קיבולת תפוקה במספר אזורים, ומאפשרת לנתב את הבקשות למיקום עם הזמינות הגבוהה ביותר כדי למקסם את הביצועים.

התנועה שלכם לא מוגבלת באופן מוחלט לתקרת התפוקה הבסיסית. Agent Platform מאפשרת לתעבורת נתונים לחרוג מהמגבלה הזו על בסיס האפשרות הטובה ביותר. עם זאת, בתקופות של ביקוש גבוה בפלטפורמת הסוכנים, יכול להיות שהביצועים של תנועת הגולשים העודפת הזו יהיו פחות יציבים. כדי לשפר את הביצועים ולצמצם את הסיכוי לקבלת השגיאות האלה, מומלץ גם לפזר את תנועת הגולשים בצורה אחידה ככל האפשר במהלך כל דקה. לא לשלוח בקשות בזינוקים חדים ברמה השנייה. נפח תנועה גבוה ומהיר יכול להוביל להגבלת קצב הבקשות גם אם השימוש הממוצע שלכם לדקה נמוך מהמגבלה. חלוקה שווה יותר של קריאות ה-API עוזרת למערכת לנהל את העומס בצורה צפויה ומשפרת את הביצועים הכוללים.

החבילות הבאות זמינות בתוכנית Standard PayGo:

משפחה שנקראת רמה הוצאות של לקוחות (30 ימים) מודל TPM לתנועה (ברמת הארגון)
מודלים של Gemini Pro רמה 1 ‫10$ – 250$ 500,000
קבוצה 2 ‫$250 – $2,000 1,000,000
רמה 3 ‫$2,000 – $50,000 ‫2,000,000
שכבה 4 > $50,000 ‫10,000,000
מסלול מותאם אישית לקבלת מידע נוסף, אפשר לפנות לצוות המכירות
מודלים של Gemini Flash ו-Flash-Lite רמה 1 ‫10$ – 250$ ‫2,000,000
קבוצה 2 ‫$250 – $2,000 4,000,000
רמה 3 ‫$2,000 – $50,000 ‫10,000,000
שכבה 4 > $50,000 ‫50,000,000
מסלול מותאם אישית לקבלת מידע נוסף, אפשר לפנות לצוות המכירות

שימו לב: מגבלת התפוקה שמוצגת למשפחת מודלים חלה בנפרד על כל מודל במשפחה הזו. לדוגמה, לקוח ברמה 3 מקבל תפוקה בסיסית של 10,000,000 TPM ל-Gemini 3.5 Flash. השימוש באחת מהמגבלות האלה לא משפיע על קצב העברת הנתונים של מודלים אחרים. אין מגבלה נפרדת על מספר הבקשות לדקה (RPM) לכל רמה. בקשות ל-Gemini עם קלט רב-אופני כפופות למגבלות התעריף של המערכת.

איך פועלות רמות השימוש

רמת השימוש נקבעת באופן אוטומטי לפי ההוצאה הכוללת של הארגון על שירותים כשירים של Agent Platform במהלך תקופה של 30 יום. ככל שההוצאות של הארגון גדלות, המערכת מעלה אתכם לרמה גבוהה יותר עם תפוקה גבוהה יותר.

חישוב ההוצאות

החישוב הזה כולל מגוון רחב של שירותים, החל מחיזוי בכל משפחות מודלי Gemini ועד למעבד, ל-GPU ולמופעי TPU של Agent Platform, וגם מק"טים שמבוססים על התחייבות לשימוש, כמו הקצאת משאבים לפי התפוקה שנקבעה.

אפשר ללחוץ כדי לקבל מידע נוסף על המק"טים שכלולים בחישוב ההוצאות.

בטבלה הבאה מפורטות הקטגוריות של Google Cloud המק"טים שנכללים בחישוב ההוצאה הכוללת.

קטגוריה תיאור של מק"טים כלולים
המודלים של Gemini כל משפחות מודלי Gemini (למשל, 2.0,‏ 2.5,‏ 3.0 בגרסאות Pro,‏ Flash ו-Lite) לחיזויים בכל המודלים (טקסט, תמונה, אודיו, וידאו), כולל וריאציות של אצווה, הקשר ארוך, כוונון ו'חשיבה'
התכונות של המודלים של Gemini כל המהדורות הרלוונטיות של Gemini לתכונות כמו שמירת נתונים במטמון, אחסון במטמון ורמות עדיפות, בכל האופנים ובכל גרסאות המודלים
Agent Platform CPU תחזיות אונליין ותחזיות באצווה בכל קבוצות המכונות שמבוססות על CPU (למשל, C2,‏ C3,‏ E2,‏ N1,‏ N2 והווריאציות שלהן)
Agent Platform GPU תחזיות אונליין ותחזיות באצווה בכל המקרים שבהם נעשה שימוש ב-GPU של NVIDIA להאצת הביצועים (לדוגמה, סדרות A100,‏ H100,‏ H200,‏ B200,‏ L4,‏ T4,‏ V100 ו-RTX)
Agent Platform TPU תחזיות אונליין ותחזיות באצווה בכל המכונות שמבוססות על TPU (למשל, TPU-v5e,‏ v6e)
ניהול ועמלות כל המק"טים של 'דמי ניהול' שמשויכים למופעים שונים של תחזיות בפלטפורמת הסוכנים
Provisioned Throughput כל המק"טים של התחייבות לשימוש ב-הקצאת משאבים לפי התפוקה שנקבעה
שירותים נוספים שירותים ייעודיים כמו 'LLM Grounding for Gemini... with Google Search tool'

אימות רמת השימוש

כדי לבדוק את רמת השימוש בארגון, עוברים אל לוח הבקרה של Agent Platform במסוף Google Cloud . כדי לראות את רמת השימוש בלוח הבקרה, צריך את התפקיד Agent Platform Viewer (roles/aiplatform.viewer) בפרויקט ואת התפקיד Billing Account Viewer (roles/billing.viewer) בחשבון לחיוב.

מעבר ללוח הבקרה של Agent Platform

אימות ההוצאות

כדי לבדוק את ההוצאות ב-Agent Platform, נכנסים לחיוב ב-Cloud במסוףGoogle Cloud . הערה: ההוצאות נצברות ברמת הארגון.

כניסה לחיוב ב-Cloud

שגיאות של עומס על משאבים (429)

אם מופיעה השגיאה 429, זה לא אומר שהגעתם למכסה קבועה. היא מציינת שיש תחרות זמנית גבוהה על משאב משותף ספציפי. מומלץ להטמיע אסטרטגיה של ניסיונות חוזרים עם השהיה מעריכית לפני ניסיון חוזר (exponential backoff) כדי לטפל בשגיאות האלה, כי הזמינות בסביבה הדינמית הזו יכולה להשתנות במהירות. בנוסף לאסטרטגיה לניסיונות חוזרים, מומלץ להשתמש בנקודת הקצה הגלובלית. בניגוד לנקודת קצה אזורית (לדוגמה, us-central1), נקודת הקצה הגלובלית מנתבת את הבקשות באופן דינמי לאזור עם הקיבולת הזמינה הגדולה ביותר באותו רגע. כך האפליקציה יכולה לגשת למאגר גדול יותר של קיבולת משותפת בכמה אזורים, מה שמגדיל משמעותית את הסיכוי להגדלת הקיבולת באופן זמני ומקטין את הסיכוי לשגיאות 429.

כדי לקבל את התוצאות הטובות ביותר, מומלץ לשלב בין השימוש בנקודת הקצה הגלובלית לבין החלקת התנועה. מומלץ להימנע משליחת בקשות בעומסים חדים ברמה השנייה, כי עומס גבוה ומידי עלול להוביל לוויסות, גם אם השימוש הממוצע לדקה נמצא במסגרת מגבלת התפוקה הבסיסית. פיזור אחיד יותר של קריאות ה-API עוזר למערכת לנהל את העומס בצורה צפויה ומשפר את הביצועים הכוללים. מידע נוסף על טיפול בשגיאות של מיצוי משאבים זמין במאמרים פיתוח אפליקציות LLM עמידות והפחתת שגיאות 429 וקוד שגיאה 429.

מודלים נתמכים

המודלים הבאים של Gemini שזמינים לכלל המשתמשים (GA) והמודלים שלהם שעברו התאמה עדינה מפוקחת תומכים בתשלום לפי שימוש רגיל עם רמות שימוש:

לחצו כדי להרחיב את רשימת המודלים הנתמכים

המודלים הבאים של Gemini ו-GA, וגם המודלים שעברו כוונון עדין בפיקוח, תומכים בשיטת התשלום הרגילה לפי שימוש, אבל רמות השימוש לא חלות על המודלים האלה:

חשוב לזכור שהרמות האלה לא רלוונטיות למודלים בגרסת טרום-השקה (Preview). כדי לקבל את המידע הכי מדויק ועדכני, מומלץ לעיין במסמכי התיעוד הרשמיים של כל מודל.

מעקב אחרי קצב העברת הנתונים והביצועים

כדי לעקוב אחרי צריכת הטוקנים בזמן אמת בארגון, עוברים אל Metrics Explorer ב-Cloud Monitoring.

לדף Metrics Explorer

מידע נוסף על מעקב אחר תנועת נתונים בנקודות קצה של מודלים זמין במאמר מעקב אחר מודלים.

שימו לב: רמות השימוש חלות ברמת הארגון. מידע על הגדרת היקף הנראות כדי לשרטט את התפוקה בכמה פרויקטים בארגון זמין במאמר הגדרת היקפי נראות לשאילתות בכמה פרויקטים.

המאמרים הבאים

Resource

מכסות ומגבלות שקשורות ל-Agent Platform, לא כולל מגבלות ספציפיות למוצרים.

סקירה כללית

במאמר הזה מוסבר איך Google Cloud מגבילה את כמות המשאבים שאפשר להשתמש בהם בפרויקט בענן ב-Google Cloud, ואיך המכסות חלות על מגוון סוגי משאבים, כולל חומרה, תוכנה ורכיבי רשת.