Provisioned Throughput for Gemini Live API

בקטע הזה מוסבר איך הקצאת משאבים לפי התפוקה שנקבעה פועלת עם Gemini Live API לצורך ספירת טוקנים ואכיפת מכסה.

‫Gemini Live API מאפשר אינטראקציות מולטימודאליות עם זמן טעינה נמוך, באמצעות זיכרון סשן ששומר על ההקשר בין הפניות. למידע על יכולות נוספות ומגבלות על סשנים, אפשר לעיין במסמכי העיון של Gemini Live API.

כל סשן צריך להיות מוקדש כולו ל-Provisioned Throughput או ל-PayGo. אין תמיכה בשימוש בשני סוגי החיוב במהלך אותו סשן. אם חורגים מהמכסה של הקצאת משאבים לפי התפוקה שנקבעה במהלך סשן פעיל, המערכת מאפשרת חריגה זמנית כדי למנוע שגיאות, ורושמת את החריגה כחלק מהמכסה הכוללת. כדי למנוע עליות פתאומיות בשימוש, כדאי לרכוש מספיק יחידות GSU כדי לתמוך בביקוש בשיא.

יש תמיכה בהעברת נתונים בין סשנים. כשמתחילים סשן, המערכת מעריכה את כותרת הבקשה ומוודאת שהמכסה של Provisioned Throughput זמינה. אם המכסה לא מספיקה, ברירת המחדל של הסשן החדש היא PayGo.

מכיוון שזיכרון הסשן מעביר את הפלטים של התור הקודם כקלט לבקשות הבאות, הקצאת משאבים לפי התפוקה שנקבעה מחשבת את המכסה על סמך אסימונים נכנסים חדשים ואסימונים מצטברים של הסשן. כתוצאה מכך, המספר הכולל של הטוקנים שעברו עיבוד לכל בקשה יגדל ככל שהסשן יתקדם, עד שתגיעו למגבלת הסשן שהוגדרה מראש. מצב הסשן, כולל הזיכרון של הסשן, זמין כל עוד הסשן פעיל.

כשמעריכים את התפוקה המוקצית הנדרשת, חשוב להביא בחשבון את אסימוני הזיכרון של הסשן. חשוב לדעת: טוקנים של אווטארים של סרטוני פלט לא נכללים בזיכרון הסשן. דפוסי תנועה היסטוריים של PayGo יכולים לשמש כבסיס שימושי לחישוב הצרכים שלכם ב-GSU.

חלונות האכיפה של המכסה משתנים בהתאם למספר יחידות ה-GSU שרכשתם עבור המודל, והם כפופים לשינויים.

Gemini 3.8 Live API

חלונות זמן לאכיפת מכסות

חלונות אכיפת המכסות הבאים חלים על גדלים שונים של GSU עבור מודל Gemini 3.8 Live API:

  • ‫1-9 יחידות GSU: 45 שניות
  • ‫10+ יחידות GSU: 5 שניות

הערכים שמופיעים לא תלויים בחביון של הבקשה. הזמן שנדרש לעיבוד הבקשה לא זהה לחלון הזמן לאכיפת המכסה. שימו לב: כדי שיהיה אפשר לעבד את הבקשות שקשורות לאווטאר הווידאו של המודל הזה, צריך לרכוש לפחות 10 יחידות GSU של הקצאת משאבים לפי התפוקה שנקבעה. אם נרכשו פחות מ-10 יחידות GSU, כל הפגישה שמבוססת על אווטאר וידאו תעבור לשיטת התשלום לפי שימוש.

חלונות האכיפה גדולים יותר כשמדובר בכמויות קטנות יותר של GSU, כדי להבטיח שעיבוד הבקשות הקטנות יסתיים בהצלחה בתוך חלון הזמן. ככל שמספר יחידות ה-GSU של מודל עולה, לא נדרשים חלונות זמן ארוכים יותר כדי לעבד בקשה. אם אתם צריכים לעבד פלט בתדירות גבוהה יותר באמצעות הקצאת משאבים לפי התפוקה שנקבעה, מומלץ להגדיל את מספר יחידות ה-GSU שרכשתם ולבדוק את חלון האכיפה המתאים. חלונות האכיפה תלויים באלגוריתמים של העורף, והם עשויים להשתנות.

הערכה של הדרישות ל-GSU

נבחן דוגמה של עומס עבודה פוטנציאלי ונבין איך כלי ההערכה יספק המלצה לגבי המודל הזה, וגם יסביר איך הבקשות מעובדות ואיך מחושבים שיעורי השחיקה. משתמש מתכנן להשתמש ב-Live API עבור צ'אטבוט שצפויים בו 10 סשנים בו-זמנית, והמשך הוא 5 דקות (300 שניות). צפויים 30 סבבים של שיחה בכל סשן, והמשתמש מציין חלון הקשר מקסימלי של 6,000 טוקנים להפעלת הסשן. הצורה של הבקשות מופיעה בהמשך:

שדה ערך לדוגמה
מספר משוער של סשנים בו-זמנית 10
משך צפוי (בשניות) 300
המספר הממוצע של תורות לכל סשן 30
חלון ההקשר המקסימלי (טוקנים של טריגר) 6,000
מספר הטוקנים הממוצע של טקסט הקלט בכל תור 20
מספר הטוקנים הממוצע של קלט האודיו בכל תור 200
מספר הטוקנים הממוצע של תמונות או סרטונים בכל תור 50
מספר הטוקנים הממוצע של טקסט הפלט בכל תור 100
מספר הטוקנים הממוצע של פלט אודיו לכל תור 200
האם האווטאר בסרטון הפלט מופעל? כן

טוקנים של קלט לכל תור:

חשבו את מכפלת הסכום של אופנויות הקלט ושיעורי הירידה שלהן:

  • מספר הטוקנים הממוצע של טקסט הקלט בכל תור * קצב הירידה של טקסט הקלט = 20 * 1 = 20

  • מספר הטוקנים הממוצע של קלט האודיו בכל תור * קצב ההתקדמות של קלט האודיו = 200 * 4 = 800

  • מספר ממוצע של טוקנים של תמונות או סרטונים לקלט בכל תור * קצב השחיקה של תמונת הקלט = 50 * 1.4 = 70

סך האסימונים של הקלט אחרי התאמה ל-Burndown לכל תור = 20 + 800 + 70 = 890

טוקנים של פלט בכל תור:

חשבו את מכפלת הסכום של אופנויות הפלט ושיעורי הירידה שלהן. שימו לב שטוקנים של אווטארים בסרטון הפלט מייצגים 6,192 טוקנים קבועים לכל 25 טוקנים של אודיו:

  • מספר הטוקנים הממוצע של טקסט הפלט לכל תור * קצב ההפחתה של טקסט הפלט = 100 * 6 = 600

  • מספר ממוצע של טוקנים של אודיו לכל תור * שיעור ההפחתה של פלט האודיו = 200 * 16 = 3,200

  • האם האווטאר בסרטון הפלט מופעל? כן, לכן מכפילים את הפלט של טוקן האודיו ב-(6,192/25) ומחילים את קצב השחיקה של טוקן האווטאר של פלט הווידאו: 200 * (6,192/25) * 1.4 = 69,350

הסכום הכולל של טוקנים בפלט אחרי ההתאמה ל-burndown לכל תור = 600 + 3,200 + 69,350 = 73,150

טוקנים של חלון ההקשר לכל תור:

בכל תור, חלון ההקשר צובר טוקנים של קלט ופלט גולמיים (לא כולל טוקנים של אווטאר בסרטון פלט) עד שהוא מגיע לאורך המקסימלי של חלון ההקשר ומפסיק לגדול. הטוקנים נספרים במגבלת חלון ההקשר כטוקנים גולמיים (ללא החלת שיעורי ירידה). עם זאת, כשחלון ההקשר מוזן לבקשות הקלט של התור הבא כזיכרון סשן, האסימונים בחלון ההקשר צריכים להיות מותאמים לשיעורי ההפחתה המתאימים של הקלט על סמך המודאליות שלהם.

הוספת סך כל הטוקנים הגולמיים בכל סשן בלי להתחשב בשיעורי השחיקה.

  • מספר הטוקנים הממוצע של טקסט קלט לכל תור + מספר הטוקנים הממוצע של אודיו קלט לכל תור + מספר הטוקנים הממוצע של תמונות או סרטונים של קלט לכל תור + מספר הטוקנים הממוצע של טקסט פלט לכל תור + מספר הטוקנים הממוצע של אודיו פלט לכל תור = 20 + 200 + 50 + 100 + 200 = 570

לאחר מכן מחשבים את היחס בין כל כמות טוקנים גולמית לבין הסכום הכולל. אנחנו יכולים להתעלם מטוקנים של פלט אווטאר של סרטון כחלק מהחישוב של חלון ההקשר.

  • יחס טקסט הקלט = 20/570 = 0.035
  • יחס קלט האודיו = 200/570 = 0.351
  • יחס תמונת הקלט/הסרטון = 50/570 = 0.088
  • יחס פלט הטקסט = 100/570 = 0.175
  • יחס פלט האודיו = 200/570 = 0.351

לאחר מכן מחשבים את סכום המכפלה של היחסים, חלון ההקשר המקסימלי ושיעורי ההתקדמות כאילו כולם היו שיטות קלט.

  • יחס טקסט הקלט * חלון ההקשר המקסימלי * שחיקת טקסט הקלט = 0.035 * 6,000 * 1 = 210

  • יחס אודיו לקלט * חלון ההקשר המקסימלי * ירידה של אודיו לקלט = 0.351 * 6,000 * 4 = 8,424

  • יחס תמונה/סרטון קלט * חלון ההקשר המקסימלי * תמונה/סרטון קלט ירידה = ‎0.088 * 6,000 * 1.4 = 739

  • יחס טקסט הפלט * חלון ההקשר המקסימלי * ירידת טקסט הקלט = 0.175 * 6,000 * 1 = 1,050

  • יחס פלט האודיו * חלון ההקשר המקסימלי * ירידה של קלט האודיו = 0.351 * 6,000 * 4 = 8,424

במגבלת חלון ההקשר המקסימלית של 6,000 טוקנים גולמיים, מספר הטוקנים הכולל בחלון ההקשר שעובר עיבוד בכל תור הוא 210 + 8,424 + 739 + 1,050 + 8,424 = 18,847.

חישוב GSU:

(מספר הטוקנים של הקלט לכל תור + מספר הטוקנים של הפלט לכל תור + מספר הטוקנים של חלון ההקשר לכל תור) * מספר התורות הממוצע לכל סשן * מספר הסשנים הצפויים בו-זמנית * (1/משך הזמן הצפוי) * (1 GSU / 1,350 TPS) = (890 + 73,150 + 18,847) * 30 * 10 * (1/300) * (1/1,350) = 68.8, rounded up gives 69 GSUs.

עיבוד הבקשה

נציג דוגמה לאופן שבו בקשות מעובדות בהקשר של הקצאת משאבים לפי התפוקה שנקבעה למודל הזה. נניח שיש 3 בקשות.

פרטי בקשה מספר 1 – קלט אודיו ווידאו, פלט אודיו

  • משך: 10 שניות
  • טוקנים שנשלחו (אודיו): 10 שניות x ‏25 טוקנים לשנייה = 250 טוקנים
  • טוקנים שנשלחו (סרטון): 10 שניות x 258 טוקנים/פריים לשנייה = 2,580 טוקנים
  • טוקנים של פלט אודיו שהתקבלו על סמך אופי הבקשה: 100 טוקנים
  • זיכרון הסשן המעודכן = 250 + 2,580 + 100 = 2,930 טוקנים

פרטי בקשה מס' 2 – קלט אודיו עם זיכרון סשן, פלט אודיו

  • משך: 40 שניות
  • טוקנים שנשלחו (אודיו): 40 שניות x‏ 25 טוקנים לשנייה = 1,000 טוקנים
  • הזיכרון של הסשן אחרי בקשה מס' 1 = 2,930 טוקנים
  • סך הטוקנים של הקלט שנשלחו: טוקנים שנשלחו בבקשה הזו + זיכרון הסשן מבקשה מספר 1 = 1,000 + 2,930 = 3,930 טוקנים
  • פלט של טוקנים של אודיו שהתקבלו על סמך אופי הבקשה: 200 טוקנים
  • זיכרון הפעילות המעודכן = 3,930 + 200 = 4,130 טוקנים

פרטי בקשה מספר 3 – אודיו ווידאו כקלט עם זיכרון סשן, אודיו ווידאו של אווטאר כפלט

  • משך: 10 שניות
  • טוקנים שנשלחו (אודיו): 10 שניות x ‏25 טוקנים לשנייה = 250 טוקנים
  • טוקנים שנשלחו (סרטון): 10 שניות x 258 טוקנים/פריים לשנייה = 2,580 טוקנים
  • זיכרון הסשן אחרי בקשה מס' 2 = 4,130 טוקנים
  • סה"כ טוקנים של קלט שנשלחו: טוקנים שנשלחו בבקשה הזו + זיכרון מהסשן מבקשה מספר 2 = 250 + 2,580 + 4,130 = 6,960 טוקנים
  • פלט של טוקנים של אווטארים בסרטונים שהתקבלו על סמך אופי הבקשה: 61,920 טוקנים
  • טוקנים של פלט אודיו שמתקבלים על סמך אופי הבקשה: 250 טוקנים
  • זיכרון מעודכן של הסשן = 6,960 + 250 = 7,210 טוקנים

הסבר על אסימונים שעברו עיבוד

  • בבקשה מספר 1, המערכת מעבדת רק את אסימוני הקלט והפלט מהבקשה הנוכחית, כי אין אסימונים נוספים בזיכרון של הסשן. כל הטוקנים שעברו עיבוד מרכיבים עכשיו את הזיכרון של הסשן.

  • בקשה מספר 2 מעבדת את אסימוני הקלט והפלט מהבקשה המתמשכת וגם כוללת את זיכרון הסשן מבקשה מספר 1. כל האסימונים של זיכרון הסשן מחילים את שיעור ההפחתה של אסימון קלט תואם.

  • בקשה מספר 3 מעבדת את אסימוני הקלט והפלט מהבקשה המתמשכת וגם כוללת את זיכרון הסשן מבקשה מספר 2. כל האסימונים של זיכרון הסשן מחילים את שיעור ההפחתה של אסימון קלט תואם.

אם עיבוד בקשה מספר 3 נמשך בדיוק שנייה אחת אחרי שהיא נשלחה, הטוקנים המותאמים לשריפה המיושמים על מכסת הקצאת משאבים לפי התפוקה שנקבעה עבור מודל זה יהיו כדלקמן:

  • טוקנים של קלט אודיו * שיעור ההפחתה של קלט האודיו = 250 * 4 = 1,000

  • טוקנים של קלט הסרטון * שיעור השחיקה של קלט הסרטון = 2,580 * 1.4 = 3,612

  • זיכרון סשן אודיו * קצב ירידה של קלט אודיו = (250 + 100 + 1,000 + 200) * 4 = 6,200

  • זיכרון הסשן של הסרטון * שיעור הירידה של סרטון הקלט = 2,580 * 1.4 = 3,612

  • טוקנים של אווטאר בסרטון הפלט * קצב השחיקה של אווטאר בסרטון הפלט = 61,920 * 1.4 = 86,688

  • טוקנים של פלט אודיו × קצב ירידה של פלט אודיו = 250 × 16 = 4,000

הוספת הסכום הכולל מספקת 105,112 אסימונים מותאמים ל-burndown.

Gemini 2.5 Flash Live API Native Audio

עיבוד הבקשה

פרטי בקשה מספר 1 – קלט אודיו ווידאו, פלט אודיו

  • משך: 10 שניות
  • טוקנים שנשלחו (אודיו): 10 שניות x ‏25 טוקנים לשנייה = 250 טוקנים
  • טוקנים שנשלחו (סרטון): 10 שניות x 258 טוקנים/פריים לשנייה = 2,580 טוקנים
  • טוקנים של פלט אודיו שהתקבלו על סמך אופי הבקשה: 100 טוקנים
  • זיכרון הסשן המעודכן = 250 + 2,580 + 100 = 2,930 טוקנים

פרטי בקשה מס' 2 – קלט אודיו עם זיכרון סשן, פלט אודיו

  • משך: 40 שניות

  • טוקנים שנשלחו (אודיו): 40 שניות x‏ 25 טוקנים לשנייה = 1,000 טוקנים

  • הזיכרון של הסשן אחרי בקשה מס' 1 = 2,930 טוקנים

  • סה"כ טוקנים של קלט שנשלחו: טוקנים שנשלחו בבקשה הזו + זיכרון הסשן מבקשה מספר 1 = 1,000 + 2,930 = 3,930 טוקנים

  • פלט של טוקנים של אודיו שהתקבלו על סמך אופי הבקשה: 200 טוקנים

  • זיכרון הפעילות המעודכן = 3,930 + 200 = 4,130 טוקנים

הסבר על אסימונים שעברו עיבוד

  • בבקשה מספר 1, המערכת מעבדת רק את אסימוני הקלט והפלט מהבקשה הנוכחית, כי אין אסימונים נוספים בזיכרון של הסשן. כל הטוקנים שעברו עיבוד מרכיבים עכשיו את הזיכרון של הסשן.

  • בקשה מספר 2 מעבדת את אסימוני הקלט והפלט מהבקשה המתמשכת וגם כוללת את זיכרון הסשן מבקשה מספר 1. כל האסימונים של זיכרון הסשן מחילים את שיעור ההפחתה של אסימון קלט תואם.

אם עיבוד בקשה מספר 2 נמשך בדיוק שנייה אחת אחרי שהיא נשלחה, הטוקנים המותאמים לשריפה המיושמים על מכסת הקצאת משאבים לפי התפוקה שנקבעה עבור המודל הזה יהיו כדלקמן:

  • טוקנים של קלט אודיו * קצב הירידה של קלט האודיו = 1,000 * 6 = 6,000
  • זיכרון סשן אודיו * קצב ירידה של אודיו קלט = (250 + 100) * 6 = 2,100
  • זיכרון הסשן של הסרטון * שיעור ההפחתה של סרטון הקלט = 2,580 * 6 = 15,480
  • טוקנים של פלט אודיו × קצב הפחתה של פלט אודיו = 200 × 24 = 4,800

הוספת הסכום הכולל מספקת 28,380 טוקנים מותאמים ל-burndown.

המאמרים הבאים