מודלים נתמכים

בטבלאות הבאות מוצגים המודלים שתומכים בהקצאת משאבים לפי התפוקה שנקבעה, נפח התפוקה לכל יחידת קנה מידה של AI גנרטיבי (GSU) ושיעורי הניצול של כל מודל.

המודלים של Google

הקצאת משאבים לפי התפוקה שנקבעה תומכת רק במודלים שאתם קוראים להם ישירות מהפרויקט באמצעות מזהה המודל הספציפי, ולא באמצעות כינוי של מודל. כדי להשתמש ב-הקצאת משאבים לפי התפוקה שנקבעה כדי לבצע קריאות ל-API של מודל, צריך להשתמש במזהה הגרסה הספציפי של המודל (לדוגמה, gemini-2.0-flash-001) ולא בכינוי של גרסת המודל.

הקצאת משאבים לפי התפוקה שנקבעה מבטיחה קיבולת לבקשות של המודל, אבל היא לא כוללת מכסות של כלים אחרים שבהם אתם עשויים להשתמש, כמו Grounding, ולא עוקפת אותן. בהתאם לגודל עומס העבודה, יכול להיות שתצטרכו לבקש מכסה נוספת לכלים האלה בנפרד.

בנוסף, הקצאת משאבים לפי התפוקה שנקבעה לא תומך במודלים שמופעלים על ידי מוצרים אחרים של Gemini Enterprise Agent Platform, כמו Vertex AI Agents ו-חיפוש מבוסס סוכנים. לדוגמה, אם אתם מבצעים קריאות ל-API של Gemini 3.5 Flash בזמן השימוש בחיפוש מבוסס סוכנים, ההזמנה שלכם להקצאת משאבים לפי התפוקה שנקבעה עבור Gemini 3.5 Flash לא תבטיח את הקריאות שבוצעו על ידי חיפוש מבוסס סוכנים.

הקצאת משאבים לפי התפוקה שנקבעה לא תומכת בקריאות של חיזוי באצווה.

בטבלה הבאה מוצגים נתוני התפוקה, הגידול ברכישה ושיעורי הירידה של מודלים של Google שתומכים בהקצאת משאבים לפי התפוקה שנקבעה. התפוקה לשנייה מוגדרת כקלט ההנחיה והפלט שנוצר בכל הבקשות לשנייה.

כדי לדעת כמה אסימונים נדרשים לעומס העבודה, אפשר לעיין בSDK tokenizer או ב-countTokens API.

מודל העברת נתונים לשנייה לכל GSU יחידות הגדלה מינימלית של רכישת GSU שיעורי התקדמות

Gemini 3.6 Flash

הגרסה הנתמכת האחרונה: gemini-3.6-flash

675 טוקנים 1 ‫1 טוקן של טקסט קלט = 1 טוקן
‫1 טוקן של תמונת קלט = 1 טוקן
‫1 טוקן של סרטון קלט = 1 טוקן
‫1 טוקן של אודיו קלט = 1 טוקן
‫1 טוקן של טקסט קלט במטמון = 0.1 טוקנים
‫1 טוקן של תמונת קלט במטמון = 0.1 טוקנים
‫1 טוקן של סרטון קלט במטמון = 0.1 טוקנים
‫1 טוקן של אודיו קלט במטמון = 0.1 טוקנים
‫1 טוקן של תגובת טקסט פלט = 5 טוקנים

Gemini 3.5 Flash-Lite

הגרסה הנתמכת האחרונה: gemini-3.5-flash-lite

3,360 טוקנים 1 ‫1 טוקן של טקסט קלט = 1 טוקן
‫1 טוקן של תמונת קלט = 1 טוקן
‫1 טוקן של סרטון קלט = 1 טוקן
‫1 טוקן של אודיו קלט = 1 טוקן
‫1 טוקן של טקסט קלט במטמון = 0.1 טוקנים
‫1 טוקן של תמונת קלט במטמון = 0.1 טוקנים
‫1 טוקן של סרטון קלט במטמון = 0.1 טוקנים
‫1 טוקן של אודיו קלט במטמון = 0.1 טוקנים
‫1 טוקן של תגובת טקסט בפלט = 9 טוקנים

Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite)

הגרסה הנתמכת האחרונה: gemini-3.1-flash-lite-image

4030 טוקנים 1 ‫1 טוקן של טקסט קלט = 1 טוקן
‫1 טוקן של תמונת קלט = 1 טוקן
‫1 טוקן של סרטון קלט = 1 טוקן
‫1 טוקן של טקסט תגובה בפלט = 6 טוקנים
‫1 טוקן של טקסט נימוק בפלט = 6 טוקנים
‫1 טוקן של תמונה בפלט = 120 טוקנים

Gemini 3 Pro Image

הגרסה הנתמכת האחרונה: gemini-3-pro-image

500 טוקנים 1 ‫1 טוקן של טקסט קלט = 1 טוקן
‫1 טוקן של תמונת קלט = 1 טוקן
‫1 טוקן של טקסט תגובה בפלט = 6 טוקנים
‫1 טוקן של טקסט נימוק בפלט = 6 טוקנים
‫1 טוקן של תמונה בפלט = 60 טוקנים

Gemini 3.1 Flash Image

הגרסה הנתמכת האחרונה: gemini-3.1-flash-image

2015 טוקנים 1 ‫1 טוקן של טקסט קלט = 1 טוקן
‫1 טוקן של תמונת קלט = 1 טוקן
‫1 טוקן של סרטון קלט = 1 טוקן
‫1 טוקן של טקסט תגובה בפלט = 6 טוקנים
‫1 טוקן של טקסט נימוק בפלט = 6 טוקנים
‫1 טוקן של תמונה בפלט = 120 טוקנים

Gemini 3.5 Flash

הגרסה הנתמכת האחרונה: gemini-3.5-flash

675 טוקנים 1 ‫1 טוקן של טקסט קלט = 1 טוקן
‫1 טוקן של תמונת קלט = 1 טוקן
‫1 טוקן של סרטון קלט = 1 טוקן
‫1 טוקן של אודיו קלט = 1 טוקן
‫1 טוקן של טקסט קלט במטמון = 0.1 טוקנים
‫1 טוקן של תמונת קלט במטמון = 0.1 טוקנים
‫1 טוקן של סרטון קלט במטמון = 0.1 טוקנים
‫1 טוקן של אודיו קלט במטמון = 0.1 טוקנים
‫1 טוקן של טקסט פלט = 6 טוקנים

Gemini 3.1 Flash-Lite

הגרסה הנתמכת האחרונה: gemini-3.1-flash-lite

4030 טוקנים 1 ‫1 טוקן של טקסט קלט = 1 טוקן
‫1 טוקן של תמונת קלט = 1 טוקן
‫1 טוקן של סרטון קלט = 1 טוקן
‫1 טוקן של אודיו קלט = 2 טוקנים
‫1 טוקן של טקסט קלט במטמון = 0.1 טוקנים
‫1 טוקן של תמונת קלט במטמון = 0.1 טוקנים
‫1 טוקן של סרטון קלט במטמון = 0.1 טוקנים
‫1 טוקן של אודיו קלט במטמון = 0.2 טוקנים
‫1 טוקן של טקסט תגובה בפלט = 6 טוקנים
‫1 טוקן של טקסט נימוק בפלט = 6 טוקנים

Gemini 3.1 Pro

הגרסה העדכנית הנתמכת: gemini-3.1-pro-preview (תצוגה מקדימה)

500 טוקנים 1 פחות מ-200,000 טוקנים של קלט:
1 טוקן של טקסט קלט = 1 טוקן
1 טוקן של תמונת קלט = 1 טוקן
1 טוקן של סרטון קלט = 1 טוקן
1 טוקן של אודיו קלט = 1 טוקן
1 טוקן של קלט ממטמון = 0.1 טוקנים
1 טוקן של טקסט תשובה של פלט = 6 טוקנים
1 טוקן של טקסט נימוק של פלט = 6 טוקנים

יותר מ-200,000 טוקנים של קלט:
1 טוקן של טקסט קלט = 2 טוקנים
1 טוקן של תמונת קלט = 2 טוקנים
1 טוקן של סרטון קלט = 2 טוקנים
1 טוקן של אודיו קלט = 2 טוקנים
1 טוקן של קלט ממטמון = 0.2 טוקנים
1 טוקן של טקסט תשובה של פלט = 9 טוקנים
1 טוקן של טקסט נימוק של פלט = 9 טוקנים

Gemini 3 Flash

הגרסה העדכנית הנתמכת: gemini-3-flash-preview (תצוגה מקדימה)

2015 טוקנים 1 ‫1 טוקן של טקסט קלט = 1 טוקן
‫1 טוקן של תמונת קלט = 1 טוקן
‫1 טוקן של סרטון קלט = 1 טוקן
‫1 טוקן של אודיו קלט = 2 טוקנים
‫1 טוקן של טקסט קלט, תמונה או סרטון במטמון = 0.1 טוקנים
‫1 טוקן של אודיו קלט במטמון = 0.2 טוקנים
‫1 טוקן של טקסט תגובה בפלט = 6 טוקנים
‫1 טוקן של טקסט נימוק בפלט = 6 טוקנים

Gemini 2.5 Pro

הגרסה הנתמכת האחרונה: gemini-2.5-pro

650 טוקנים 1 פחות מ-200,000 טוקנים של קלט:
1 טוקן של טקסט קלט = 1 טוקן
1 טוקן של תמונת קלט = 1 טוקן
1 טוקן של סרטון קלט = 1 טוקן
1 טוקן של אודיו קלט = 1 טוקן
1 טוקן של טקסט תגובה של פלט = 8 טוקנים
1 טוקן של טקסט נימוק של פלט = 8 טוקנים

יותר מ-200,000 טוקנים של קלט:
1 טוקן של טקסט קלט = 2 טוקנים
1 טוקן של תמונת קלט = 2 טוקנים
1 טוקן של סרטון קלט = 2 טוקנים
1 טוקן של אודיו קלט = 2 טוקנים
1 טוקן של טקסט תגובה של פלט = 12 טוקנים
1 טוקן של טקסט נימוק של פלט = 12 טוקנים

Gemini 2.5 Flash Image

הגרסה הנתמכת האחרונה: gemini-2.5-flash-image

2,690 טוקנים 1 ‫1 טוקן של טקסט קלט = 1 טוקן
‫1 טוקן של תמונת קלט = 1 טוקן
‫1 טוקן של טקסט פלט = 9 טוקנים
‫1 טוקן של תמונת פלט = 100 טוקנים

Gemini 2.5 Flash

הגרסה הנתמכת האחרונה: gemini-2.5-flash

2690 טוקנים 1 ‫1 טוקן של טקסט קלט = 1 טוקן
‫1 טוקן של תמונת קלט = 1 טוקן
‫1 טוקן של סרטון קלט = 1 טוקן
‫1 טוקן של אודיו קלט = 4 טוקנים
‫1 טוקן של טקסט תגובה בפלט = 9 טוקנים
‫1 טוקן של טקסט נימוק בפלט = 9 טוקנים

Gemini 2.5 Flash-Lite

הגרסה הנתמכת העדכנית (GA): gemini-2.5-flash-lite

הגרסה הנתמכת העדכנית (גרסת Preview): gemini-2.5-flash-lite-preview-09-2025

8,070 טוקנים 1 טוקן אחד של טקסט קלט = טוקן אחד
טוקן אחד של תמונת קלט = טוקן אחד
טוקן אחד של סרטון קלט = טוקן אחד
טוקן אחד של אודיו קלט = 3 טוקנים
טוקן אחד של טקסט תגובה בפלט = 4 טוקנים
טוקן אחד של טקסט נימוק בפלט = 4 טוקנים

Gemini 2.5 Flash עם אודיו מקורי של Gemini Live API

הגרסה הנתמכת האחרונה: gemini-live-2.5-flash-native-audio

1,620 טוקנים 1 ‫1 טוקן של טקסט קלט = 1 טוקן
‫1 טוקן של אודיו קלט = 6 טוקנים
‫1 טוקן של סרטון קלט = 6 טוקנים
‫1 טוקן של תמונה קלט = 6 טוקנים
‫1 טוקן של זיכרון הפעלה של קלט = 1 טוקן
‫1 טוקן של טקסט פלט = 4 טוקנים
‫1 טוקן של אודיו פלט = 24 טוקנים

התנסות וירטואלית

הגרסה הנתמכת האחרונה: virtual-try-on-001

0.02 תמונות 1 תמונה אחת לשנייה = 0.02 טוקנים

Veo 3.1 Lite Generate

הגרסה הנתמכת האחרונה: veo-3.1-lite-generate-001

0.0350 משך הסרטון בשניות (720p) 1 ‫1 (720p) שנייה של סרטון פלט = 1 שנייה של סרטון פלט
משך הסרטון והאודיו בשניות (720p) 1 ‫1 (720p) פלט של סרטון + אודיו לשנייה = 1.75 שניות של פלט סרטון
שניות של סרטון (1080p) 1 שנייה אחת של סרטון פלט (1080p) = 1.75 שניות של סרטון פלט (720p)
שניות של וידאו ואודיו (1080p) 1 שנייה אחת של פלט וידאו+אודיו (1080p) = 2.33 שניות של פלט וידאו (720p)

Veo 3.1

הגרסה הנתמכת האחרונה: veo-3.1-generate-001

0.0040 שניות צפייה בסרטון 1 שנייה אחת של פלט וידאו = שנייה אחת של פלט וידאו
משך הצפייה בסרטון עם אודיו – שניות 1 שנייה אחת של פלט וידאו + אודיו = 2 שניות של פלט וידאו

Veo 3.1 Fast

הגרסה הנתמכת האחרונה: veo-3.1-fast-generate-001

0.01 משך הסרטון בשניות (720p) 1 ‫1 (720p) שניית סרטון פלט = 1 שניית סרטון פלט
סרטון + אודיו שניות (720p) 1 סרטון פלט אחד (720p) + שנייה אחת של אודיו = 1.30 שניות של סרטון פלט
שניות של סרטון (1080p) 1 שנייה אחת של סרטון פלט (1080p) = 1.30 שניות של סרטון פלט (720p)
סרטון + אודיו שניות (1080p) 1 ‫1 (1080p) שניות של פלט וידאו + אודיו = 1.60 (720p) שניות של פלט וידאו
משך סרטון (4k) 1 שנייה אחת של סרטון פלט (4k) = 3.40 שניות של סרטון פלט (720p)
סרטון + אודיו שניות (4k) 1 סרטון פלט אחד (4k) + אודיו לשנייה = 4 שניות של סרטון פלט (720p)

Veo 3

הגרסה הנתמכת האחרונה: veo-3.0-generate-001

0.0040 שניות צפייה בסרטון 1 שנייה אחת של פלט וידאו = שנייה אחת של פלט וידאו
משך הצפייה בסרטון עם אודיו – שניות 1 שנייה אחת של פלט וידאו + אודיו = 2 שניות של פלט וידאו

Veo 3 Fast

הגרסה הנתמכת האחרונה: veo-3.0-fast-generate-001

0.01 משך הסרטון בשניות (720p) 1 ‫1 (720p) שניית סרטון פלט = 1 שניית סרטון פלט
סרטון + אודיו שניות (720p) 1 סרטון פלט אחד (720p) + שנייה אחת של אודיו = 1.30 שניות של סרטון פלט
שניות של סרטון (1080p) 1 שנייה אחת של סרטון פלט (1080p) = 1.30 שניות של סרטון פלט (720p)
סרטון + אודיו שניות (1080p) 1 ‫1 (1080p) שניות של פלט וידאו + אודיו = 1.60 (720p) שניות של פלט וידאו

מידע על היכולות של מודל ועל מגבלות הקלט או הפלט שלו זמין במסמכי העזרה של המודל.

אתם יכולים לשדרג למודלים חדשים כשהם יהיו זמינים. מידע על זמינות המודלים ותאריכי ההוצאה משימוש מופיע במאמר מודלים של Google.

מידע נוסף על מיקומים נתמכים זמין במאמר מיקומים זמינים.

מודלים של השותפים

בטבלה הבאה מוצגים נתוני התפוקה, הגידול ברכישה ושיעורי הירידה של מודלים של שותפים שתומכים בהקצאת משאבים לפי התפוקה שנקבעה. מודלים של Claude נמדדים בטוקנים לשנייה, שמוגדרים כסך הטוקנים של הקלט והפלט בכל הבקשות לשנייה.

מודל התפוקה לכל GSU (טוקנים/שנייה) רכישת מינימום של GSU הגדלת מספר המשתמשים ב-GSU שיעורי התקדמות
‫Anthropic's Claude Opus 5 on Google Cloud 210 1 1 ‫1 טוקן קלט = 1 טוקן
‫1 טוקן פלט = 5 טוקנים
‫1 טוקן של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
‫1 טוקן של כתיבה למטמון למשך שעה = 2 טוקנים
‫1 טוקן של גישה למטמון = 0.1 טוקן
‫Anthropic's Claude Sonnet 5 on Google Cloud 350 25 1 ‫1 טוקן קלט = 1 טוקן
‫1 טוקן פלט = 5 טוקנים
‫1 טוקן של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
‫1 טוקן של כתיבה למטמון למשך שעה = 2 טוקנים
‫1 טוקן של גישה למטמון = 0.1 טוקן
‫Anthropic's Claude Fable 5 on Google Cloud 105 1 1 ‫1 טוקן קלט = 1 טוקן
‫1 טוקן פלט = 5 טוקנים
‫1 טוקן של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
‫1 טוקן של כתיבה למטמון למשך שעה = 2 טוקנים
‫1 טוקן של גישה למטמון = 0.1 טוקן
‫Anthropic's Claude Opus 4.8 on Google Cloud 210 35 1 ‫1 טוקן קלט = 1 טוקן
‫1 טוקן פלט = 5 טוקנים
‫1 טוקן של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
‫1 טוקן של כתיבה למטמון למשך שעה = 2 טוקנים
‫1 טוקן של גישה למטמון = 0.1 טוקן
‫Anthropic's Claude Opus 4.7 on Google Cloud 210 35 1 ‫1 טוקן קלט = 1 טוקן
‫1 טוקן פלט = 5 טוקנים
‫1 טוקן של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
‫1 טוקן של כתיבה למטמון למשך שעה = 2 טוקנים
‫1 טוקן של גישה למטמון = 0.1 טוקן
‫Anthropic's Claude Sonnet 4.6 on Google Cloud 350 25 1 ‫1 טוקן קלט = 1 טוקן
‫1 טוקן פלט = 5 טוקנים
‫1 טוקן של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
‫1 טוקן של כתיבה למטמון למשך שעה = 2 טוקנים
‫1 טוקן של גישה למטמון = 0.1 טוקן
‫Anthropic's Claude Opus 4.6 ב-Google Cloud 210 35 1 ‫1 טוקן קלט = 1 טוקן
‫1 טוקן פלט = 5 טוקנים
‫1 טוקן של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
‫1 טוקן של כתיבה למטמון למשך שעה = 2 טוקנים
‫1 טוקן של גישה למטמון = 0.1 טוקן
‫Anthropic's Claude Opus 4.5 on Google Cloud 210 35 1 ‫1 טוקן קלט = 1 טוקן
‫1 טוקן פלט = 5 טוקנים
‫1 טוקן של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
‫1 טוקן של כתיבה למטמון למשך שעה = 2 טוקנים
‫1 טוקן של גישה למטמון = 0.1 טוקן
‫Anthropic's Claude Sonnet 4.5 on Google Cloud 350 25 1 פחות מ-200,000 טוקנים של קלט:
טוקן קלט אחד = טוקן אחד
טוקן פלט אחד = 5 טוקנים
טוקן אחד של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
טוקן אחד של כתיבה למטמון למשך שעה = 2 טוקנים
טוקן אחד של גישה למטמון = 0.1 טוקן

200,000 טוקנים של קלט או יותר:
טוקן קלט אחד = 2 טוקנים
טוקן פלט אחד = 7.5 טוקנים
טוקן אחד של כתיבה למטמון למשך 5 דקות = 2.5 טוקנים
טוקן אחד של כתיבה למטמון למשך שעה = 4 טוקנים
טוקן אחד של גישה למטמון = 0.2 טוקן
‫Anthropic's Claude Opus 4.1 on Google Cloud 70 35 1 ‫1 טוקן קלט = 1 טוקן
‫1 טוקן פלט = 5 טוקנים
‫1 טוקן של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
‫1 טוקן של כתיבה למטמון למשך שעה = 2 טוקנים
‫1 טוקן של גישה למטמון = 0.1 טוקן
‫Anthropic's Claude Haiku 4.5 on Google Cloud ‫1,050 8 1 פחות מ-200,000 טוקנים של קלט:
1 טוקן של קלט = 1 טוקן
1 טוקן של פלט = 5 טוקנים
1 כתיבה למטמון של טוקן למשך 5 דקות = 1.25 טוקנים
1 כתיבה למטמון של טוקן למשך שעה = 2 טוקנים
1 טוקן של פגיעה במטמון = 0.1 טוקן
‫Anthropic's Claude Opus 4 on Google Cloud 70 35 1 ‫1 טוקן קלט = 1 טוקן
‫1 טוקן פלט = 5 טוקנים
‫1 טוקן של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
‫1 טוקן של כתיבה למטמון למשך שעה = 2 טוקנים
‫1 טוקן של גישה למטמון = 0.1 טוקן
‫Anthropic's Claude Sonnet 4 on Google Cloud 350 25 1 פחות מ-200,000 טוקנים של קלט:
טוקן קלט אחד = טוקן אחד
טוקן פלט אחד = 5 טוקנים
טוקן אחד של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
טוקן אחד של כתיבה למטמון למשך שעה = 2 טוקנים
טוקן אחד של גישה למטמון = 0.1 טוקן

200,000 טוקנים של קלט או יותר:
טוקן קלט אחד = 2 טוקנים
טוקן פלט אחד = 7.5 טוקנים
טוקן אחד של כתיבה למטמון למשך 5 דקות = 2.5 טוקנים
טוקן אחד של כתיבה למטמון למשך שעה = 4 טוקנים
טוקן אחד של גישה למטמון = 0.2 טוקן
‫Anthropic's Claude 3.7 Sonnet on Google Cloud (הוצא משימוש) 350 25 1 ‫1 טוקן קלט = 1 טוקן
‫1 טוקן פלט = 5 טוקנים
‫1 טוקן של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
‫1 טוקן של פגיעה במטמון = 0.1 טוקן
‫Anthropic's Claude 3.5 Sonnet v2 on Google Cloud (הוצא משימוש) 350 25 1 ‫1 טוקן קלט = 1 טוקן
‫1 טוקן פלט = 5 טוקנים
‫1 טוקן של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
‫1 טוקן של פגיעה במטמון = 0.1 טוקן
‫Anthropic's Claude 3.5 Haiku on Google Cloud (הוצא משימוש) 2,000 10 1 ‫1 טוקן קלט = 1 טוקן
‫1 טוקן פלט = 5 טוקנים
‫1 טוקן של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
‫1 טוקן של כתיבה למטמון למשך שעה = 2 טוקנים
‫1 טוקן של גישה למטמון = 0.1 טוקן
‫Anthropic's Claude 3 Opus on Google Cloud 70 35 1 ‫1 טוקן קלט = 1 טוקן
‫1 טוקן פלט = 5 טוקנים
‫1 טוקן של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
‫1 טוקן של פגיעה במטמון = 0.1 טוקן
‫Anthropic's Claude 3 Haiku on Google Cloud (הוצא משימוש) 4,200 5 1 ‫1 טוקן קלט = 1 טוקן
‫1 טוקן פלט = 5 טוקנים
‫1 טוקן של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
‫1 טוקן של כתיבה למטמון למשך שעה = 2 טוקנים
‫1 טוקן של גישה למטמון = 0.1 טוקן
‫Anthropic's Claude 3.5 Sonnet on Google Cloud (הוצא משימוש) 350 25 1 ‫1 טוקן קלט = 1 טוקן
‫1 טוקן פלט = 5 טוקנים
‫1 טוקן של כתיבה למטמון למשך 5 דקות = 1.25 טוקנים
‫1 טוקן של פגיעה במטמון = 0.1 טוקן

מידע על מיקומים נתמכים זמין במאמר זמינות אזורית של Anthropic Claude. כדי להזמין הקצאת משאבים לפי התפוקה שנקבעה למודלים של Anthropic, צריך לפנות אל Google Cloud נציג החשבון.

מודלים פתוחים

בטבלה הבאה מוצגים נתוני התפוקה, הגידול ברכישה ושיעורי הירידה של מודלים פתוחים שתומכים בהקצאת משאבים לפי התפוקה שנקבעה.

מודל התפוקה לכל GSU (טוקנים/שנייה) רכישת מינימום של GSU הגדלת מספר המשתמשים ב-GSU שיעורי התקדמות

DeepSeek-OCR

הגרסה הנתמכת האחרונה: deepseek-ocr-maas

3,360 1 1 ‫1 טוקן של טקסט קלט = 1 טוקן
‫1 טוקן של תמונת קלט = 1 טוקן
‫1 טוקן של טקסט פלט = 4 טוקנים

DeepSeek-V3.2

DeepSeek-V3.2

הגרסה הנתמכת האחרונה: deepseek-v3.2-maas

1,680 1 1 טוקן אחד של טקסט קלט = טוקן אחד
טוקן אחד של טקסט פלט = 4 טוקנים

Gemma 4 26B A4B IT

הגרסה הנתמכת האחרונה: gemma-4-26b-a4b-it-maas

התמיכה בהקצאת משאבים לפי התפוקה שנקבעה במודל הזה מחויבת לפי אותם מק"טים כמו במודלים של Google, אבל היא כפופה ליכולות של המודל הפתוח.

6,725 1 1 ‫1 טוקן של טקסט קלט = 1 טוקן
‫1 טוקן של תמונת קלט = 1 טוקן
‫1 טוקן של טקסט פלט = 4 טוקנים

Kimi K2 Thinking

הגרסה הנתמכת האחרונה: kimi-k2-thinking-maas

1,680 1 1 טוקן אחד של טקסט קלט = טוקן אחד
טוקן אחד של טקסט פלט = 4 טוקנים

Llama 3.3 70B

הגרסה הנתמכת האחרונה: llama-3.3-70b-instruct-maas

1,400 1 1 טוקן אחד של טקסט קלט = טוקן אחד
טוקן אחד של טקסט פלט = טוקן אחד

Llama 4 Maverick 17B-128E

הגרסה הנתמכת האחרונה: llama-4-maverick-17b-128e-instruct-maas

2,800 1 1 ‫1 טוקן של טקסט קלט = 1 טוקן
‫1 טוקן של תמונת קלט = 1 טוקן
‫1 טוקן של טקסט פלט = 4 טוקנים

Llama 4 Scout 17B-16E

הגרסה הנתמכת האחרונה: llama-4-scout-17b-16e-instruct-maas

4,035 1 1 ‫1 טוקן של טקסט קלט = 1 טוקן
‫1 טוקן של תמונת קלט = 1 טוקן
‫1 טוקן של טקסט פלט = 3 טוקנים

MiniMax M2

הגרסה הנתמכת האחרונה: minimax-m2-maas

3,360 1 1 טוקן אחד של טקסט קלט = טוקן אחד
טוקן אחד של טקסט פלט = 4 טוקנים

OpenAI gpt-oss 120B

הגרסה הנתמכת האחרונה: gpt-oss-120b-maas

11,205 1 1 טוקן אחד של טקסט קלט = טוקן אחד
טוקן אחד של טקסט פלט = 4 טוקנים

OpenAI gpt-oss 20B

הגרסה הנתמכת האחרונה: gpt-oss-20b-maas

14,405 1 1 טוקן אחד של טקסט קלט = טוקן אחד
טוקן אחד של טקסט פלט = 4 טוקנים

Qwen3 235B

הגרסה הנתמכת האחרונה: qwen3-235b-a22b-instruct-2507-maas

4,035 1 1 טוקן אחד של טקסט קלט = טוקן אחד
טוקן אחד של טקסט פלט = 4 טוקנים

Qwen3 Coder

הגרסה הנתמכת האחרונה: qwen3-coder-480b-a35b-instruct-maas

1,010 1 1 טוקן אחד של טקסט קלט = טוקן אחד
טוקן אחד של טקסט פלט = 4 טוקנים

Qwen3-Next-80B Instruct

הגרסה הנתמכת האחרונה: qwen3-next-80b-a3b-instruct-maas

6,725 1 1 ‫1 טוקן של טקסט קלט = 1 טוקן
‫1 טוקן של טקסט פלט = 8 טוקנים

Qwen3-Next-80B Thinking

הגרסה הנתמכת האחרונה: qwen3-next-80b-a3b-thinking-maas

6,725 1 1 ‫1 טוקן של טקסט קלט = 1 טוקן
‫1 טוקן של טקסט פלט = 8 טוקנים

GLM 4.7

הגרסה הנתמכת האחרונה: glm-4.7-maas

1,685 1 1 טוקן אחד של טקסט קלט = טוקן אחד
טוקן אחד של טקסט פלט = 4 טוקנים

GLM 5

הגרסה הנתמכת האחרונה: glm-5-maas

1,010 1 1 טוקן אחד של טקסט קלט = טוקן אחד
טוקן אחד של טקסט פלט = 3 טוקנים

יכולות זמינות למודלים של Google ולמודלים פתוחים

בטבלה הבאה מפורטות היכולות שזמינות עם הקצאת משאבים לפי התפוקה שנקבעה למודלים של Google ולמודלים פתוחים:

יכולת המודלים של Google מודלים פתוחים (גרסת טרום-השקה)
הזמנה דרך מסוף Google Cloud כן כן
תמיכה בנקודות קצה גלובליות מידע נוסף על תמיכה במודל של נקודת קצה גלובלית מידע נוסף על תמיכה במודל של נקודת קצה גלובלית
תמיכה במודלים שעברו כוונון עדין מונחה כן לא
תמיכה בשימוש במפתחות API כן לא
משולב עם שמירת מטמון של הקשר משתמע כן לא רלוונטי
משולב עם שמירת מטמון של הקשרים מפורשים כן לא רלוונטי
עיבוד באמצעות למידת מכונה זמין באזורים מסוימים. פרטים נוספים מופיעים במאמר בנושא הקצאת משאבים לפי התפוקה שנקבעה של אזור יחיד. לא רלוונטי
תנאי הזמנה זמינים שבוע, חודש, 3 חודשים ושנה שבוע, חודש, 3 חודשים ושנה
שינוי הזמנה דרך המסוף כן לא
סטטוסים של הזמנות: בהמתנה לבדיקה, אושרה, פעילה, פג תוקף כן כן
חריגות מהמכסה מועברות כברירת מחדל לתשלום לפי שימוש כן כן
שליטה בכותרת של ה-API: משתמשים בערך dedicated כדי להשתמש רק בנפח התפוקה שהוקצה, או בערך shared כדי להשתמש רק בתשלום לפי שימוש כן כן
מעקב: מדדים, מרכזי בקרה והתראות כן כן

תמיכה במודל של נקודת קצה גלובלית

הקצאת משאבים לפי התפוקה שנקבעה תומכת בנקודת הקצה הגלובלית עבור מודלים של Google ומודלים פתוחים.

כברירת מחדל, תעבורת נתונים שחורגת ממכסת הקצאת המשאבים לפי התפוקה שנקבעה משתמשת בנקודת הקצה הגלובלית.

כדי להקצות Provisioned Throughput לנקודת הקצה הגלובלית של מודל, בוחרים באפשרות global כאזור כשמבצעים הזמנה של Provisioned Throughput.

מודלים של Google עם תמיכה בנקודת קצה גלובלית

בטבלה הבאה מפורטים המודלים של Google שבהם יש תמיכה בנקודת הקצה הגלובלית של הקצאת משאבים לפי התפוקה שנקבעה:

דגם הגרסה הנתמכת האחרונה של המודל
Gemini 3.6 Flash gemini-3.6-flash
Gemini 3.5 Flash-Lite gemini-3.5-flash-lite
Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite) gemini-3.1-flash-lite-image
Gemini 3 Pro Image gemini-3-pro-image
Gemini 3.1 Flash Image gemini-3.1-flash-image
Gemini 3.5 Flash gemini-3.5-flash
Gemini 3.1 Flash-Lite gemini-3.1-flash-lite
Gemini 3.1 Pro גרסת טרום-השקה gemini-3.1-pro-preview
Gemini 3 Flash תצוגה מקדימה gemini-3-flash-preview
Gemini 2.5 Pro gemini-2.5-pro
Gemini 2.5 Flash Image gemini-2.5-flash-image
Gemini 2.5 Flash gemini-2.5-flash
Gemini 2.5 Flash-Lite gemini-2.5-flash-lite

מודלים פתוחים עם תמיכה בנקודת קצה גלובלית

בטבלה הבאה מפורטים המודלים הפתוחים שבהם יש תמיכה בנקודת הקצה הגלובלית של Provisioned Throughput:

מודל הגרסה העדכנית ביותר של המודל שנתמכת
DeepSeek-OCR deepseek-ocr-maas
DeepSeek-V3.2 deepseek-v3.2-maas
Kimi K2 Thinking kimi-k2-thinking-maas
MiniMax M2 minimax-m2-maas
‫OpenAI gpt-oss 120B gpt-oss-120b-maas
Qwen3-Next-80B Instruct qwen3-next-80b-a3b-instruct-maas
Qwen3-Next-80B Thinking qwen3-next-80b-a3b-thinking-maas
‫GLM 4.7 glm-4.7-maas
GLM 5 glm-5-maas

תמיכה במודל שעבר כוונון עדין מונחה

יש תמיכה ב-Google במודלים שתומכים בכוונון מפוקח (SFT):

  • אפשר להחיל את הקצאת המשאבים לפי התפוקה שנקבעה גם על מודלים בסיסיים וגם על גרסאות של המודלים הבסיסיים האלה שעברו כוונון עדין בפיקוח.

  • נקודות קצה של מודלים שעברו כוונון עדין בפיקוח ומספר מודלי הבסיס התואמים שלהן נספרים במסגרת אותה מכסת הקצאת משאבים לפי התפוקה שנקבעה.

    לדוגמה, אם רכשתם הקצאת משאבים לפי התפוקה שנקבעה עבור gemini-3.1-flash-lite לפרויקט ספציפי, בקשות שמוגשות מגרסאות מפוקחות של gemini-3.1-flash-lite שעברו התאמה אישית ונוצרו במסגרת הפרויקט הזה יקבלו עדיפות. משתמשים בכותרת המתאימה כדי לשלוט בהתנהגות התנועה.

החל מ-Gemini 3, שיעורי השחיקה של הסקת מסקנות במודל שעבר כוונון עדין גבוהים יותר בהשוואה להסקת מסקנות במודל בסיסי. הפרימיום הזה הוא יחסי למסקנה המכווננת פרימיום עבור המודל. לדוגמה, אם עלות ההסקה של מודל שעבר כוונון עדין גבוהה ב-50% מעלות ההסקה של מודל בסיסי, קצב השחיקה של ההסקה של מודל שעבר כוונון עדין יהיה גבוה ב-50%. במקרה הזה, אם ההסקה של מודל הבסיס של טוקן אחד של טקסט קלט הייתה טוקן אחד, אז ההסקה של המודל שעבר התאמה עדינה של טוקן אחד של טקסט קלט תהיה 1.5 טוקנים.

לפני Gemini 3, נקודות הקצה של מודלים שעברו כוונון עדין בפיקוח והמודל הבסיסי התואם שלהן נכללו באותה מכסת Provisioned Throughput עם אותם שיעורי ירידה.

המאמרים הבאים