תשלום לפי שימוש עם עדיפות (Priority PayGo) הוא אפשרות צריכה שמספקת ביצועים עקביים יותר מאשר תשלום לפי שימוש רגיל (Standard PayGo), בלי ההתחייבות מראש של תפוקת נתונים שהוקצתה.
כשמשתמשים ב-Priority PayGo, החיוב הוא לפי השימוש בטוקן, בתעריף גבוה יותר מאשר ב-Standard PayGo. מידע על התמחור זמין בדף התמחור של Gemini Enterprise Agent Platform.
מתי כדאי להשתמש ב-PayGo בעדיפות גבוהה
תשלום לפי שימוש בעדיפות מתאים במיוחד לעומסי עבודה קריטיים לעסק עם דפוסי תנועה משתנים או בלתי צפויים. הנה כמה תרחישים לדוגמה:
- עוזרים וירטואליים שפונים ללקוחות
- תהליכי עבודה של סוכנים ואינטראקציות בין סוכנים
- סימולציות מחקר
מודלים ומיקומים נתמכים
תשלום לפי שימוש עם עדיפות נתמך בנקודת הקצה global ובנקודות הקצה us ו-eu שכוללות מספר אזורים. ב-Priority PayGo אין תמיכה בנקודות קצה אזוריות, כמו us-central1.
המודלים הבאים תומכים בתשלום לפי שימוש עם עדיפות:
gemini-3.8-flashgemini-3.7-flashgemini-3.6-flashgemini-3.5-flash-litegemini-3.5-flashgemini-3.1-flash-litegemini-3.1-pro-previewgemini-3-flash-previewgemini-2.5-progemini-2.5-flashgemini-2.5-flash-lite
שימוש ב-Priority PayGo
כדי לשלוח בקשות ל-Gemini API באמצעות תשלום לפי שימוש עם עדיפות, צריך לכלול את הכותרת X-Vertex-AI-LLM-Shared-Request-Type בבקשה. יש שתי דרכים להשתמש ב-Priority PayGo:
שימוש במכסת התפוקה שהוקצתה (אם זמינה) ומעבר לשיטת התשלום לפי שימוש עם עדיפות.
שימוש רק ב-Priority PayGo.
בדוגמאות הבאות נעשה שימוש בנקודת הקצה global. כדי לשלוח את הבקשות לנקודת קצה (endpoint) מרובת-אזורים, מחליפים את global ב-us או ב-eu. בבקשות REST, צריך גם להחליף את שם המארח aiplatform.googleapis.com ב-aiplatform.us.rep.googleapis.com או ב-aiplatform.eu.rep.googleapis.com. מידע נוסף זמין במאמר בנושא נקודות קצה (endpoint) מרובות אזורים.
שימוש ב-Priority PayGo כשמשתמשים ב-Provisioned Throughput כברירת מחדל
כדי לנצל את מכסת התפוקה הזמינה לפני שמשתמשים בחיוב לפי שימוש עם עדיפות, צריך לכלול את הכותרת X-Vertex-AI-LLM-Shared-Request-Type: priority בבקשות, כמו בדוגמאות הבאות.
Python
התקנה
pip install --upgrade google-genai
מידע נוסף מופיע ב מאמרי העזרה בנושא SDK.
מגדירים משתני סביבה כדי להשתמש ב-Google Gen AI SDK עם Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
אתחול של לקוח GenAI לשימוש ב-PayGo עם עדיפות. אחרי שמבצעים את השלב הזה, לא צריך לבצע התאמות נוספות בקוד כדי ליצור אינטראקציה עם Gemini API באמצעות תשלום לפי שימוש עם עדיפות באותו לקוח.
from google import genai from google.genai.types import HttpOptions client = genai.Client( vertexai=True, project='your_project_id', location='global', http_options=HttpOptions( api_version="v1", headers={ "X-Vertex-AI-LLM-Shared-Request-Type": "priority" }, ) )
REST
אחרי שמגדירים את הסביבה, אפשר להשתמש ב-REST כדי לבדוק פרומפט טקסטואלי. הדוגמה הבאה שולחת בקשה לנקודת הקצה של מודל בעל התוכן הדיגיטלי.
לפני שמשתמשים בנתוני הבקשה, צריך להחליף את הנתונים הבאים:
-
PROJECT_ID: מזהה הפרויקט. . -
MODEL_ID: מזהה המודל של המודל שרוצים להפעיל עבורו את התשלום לפי שימוש עם עדיפות. רשימת הדגמים שתומכים בתשלום לפי שימוש עם עדיפות זמינה במאמר גרסאות של מודלים. PROMPT_TEXT: ההנחיות לטקסט שצריך לכלול בהנחיה. JSON.
curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-H "X-Vertex-AI-LLM-Shared-Request-Type: priority" \
"https://aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/global/publishers/google/models/MODEL_ID:generateContent" -d \
$'{
"contents": {
"role": "model",
"parts": { "text": "PROMPT_TEXT" }
}
}'
אתם אמורים לקבל תגובת JSON שדומה לזו:
{
"candidates": [
{
"content": {
"role": "model",
"parts": [
{
"text": "Response to sample request."
}
]
},
"finishReason": "STOP"
}
],
"usageMetadata": {
"promptTokenCount": 3,
"candidatesTokenCount": 900,
"totalTokenCount": 1957,
"trafficType": "ON_DEMAND_PRIORITY",
"thoughtsTokenCount": 1054
}
}
- משתמשים בשיטה
generateContentכדי לבקש שהתשובה תוחזר אחרי שהיא נוצרה במלואה. כדי לצמצם את תפיסת זמן האחזור בקרב קהל אנושי, אפשר להזרים את התשובה בזמן שהיא נוצרת באמצעות השיטהstreamGenerateContent. - מזהה המודל הרב-אופני מופיע בסוף כתובת ה-URL לפני השיטה
(לדוגמה,
gemini-3.5-flash). יכול להיות שהדוגמה הזו תתמוך גם במודלים אחרים.
שימוש רק ב-Priority PayGo
כדי להשתמש רק בשיטת התשלום PayGo עם עדיפות, צריך לכלול בבקשות את הכותרות X-Vertex-AI-LLM-Request-Type: shared ו-X-Vertex-AI-LLM-Shared-Request-Type: priority, כמו בדוגמאות הבאות.
Python
התקנה
pip install --upgrade google-genai
מידע נוסף מופיע ב מאמרי העזרה בנושא SDK.
מגדירים משתני סביבה כדי להשתמש ב-Google Gen AI SDK עם Vertex AI:
# Replace the `GOOGLE_CLOUD_PROJECT` and `GOOGLE_CLOUD_LOCATION` values # with appropriate values for your project. export GOOGLE_CLOUD_PROJECT=GOOGLE_CLOUD_PROJECT export GOOGLE_CLOUD_LOCATION=global export GOOGLE_GENAI_USE_ENTERPRISE=True
אתחול של לקוח GenAI לשימוש ב-PayGo עם עדיפות. אחרי שמבצעים את השלב הזה, לא צריך לבצע התאמות נוספות בקוד כדי ליצור אינטראקציה עם Gemini API באמצעות תשלום לפי שימוש עם עדיפות באותו לקוח.
from google import genai from google.genai.types import HttpOptions client = genai.Client( vertexai=True, project='your_project_id', location='global', http_options=HttpOptions( api_version="v1", headers={ "X-Vertex-AI-LLM-Request-Type": "shared", "X-Vertex-AI-LLM-Shared-Request-Type": "priority" }, ) )
REST
לפני שמשתמשים בנתוני הבקשה, צריך להחליף את הנתונים הבאים:
-
PROJECT_ID: מזהה הפרויקט. . -
MODEL_ID: מזהה המודל של המודל שרוצים להפעיל עבורו את התשלום לפי שימוש עם עדיפות. רשימת הדגמים שתומכים בתשלום לפי שימוש עם עדיפות זמינה במאמר גרסאות של מודלים. PROMPT_TEXT: ההנחיות לטקסט שצריך לכלול בהנחיה. JSON.
curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-H "X-Vertex-AI-LLM-Request-Type: shared" \
-H "X-Vertex-AI-LLM-Shared-Request-Type: priority" \
"https://aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/global/publishers/google/models/MODEL_ID:generateContent" -d \
$'{
"contents": {
"role": "model",
"parts": { "text": "PROMPT_TEXT" }
}
}'
אתם אמורים לקבל תגובת JSON שדומה לזו:
{
"candidates": [
{
"content": {
"role": "model",
"parts": [
{
"text": "Response to sample request."
}
]
},
"finishReason": "STOP"
}
],
"usageMetadata": {
"promptTokenCount": 3,
"candidatesTokenCount": 900,
"totalTokenCount": 1957,
"trafficType": "ON_DEMAND_PRIORITY",
"thoughtsTokenCount": 1054
}
}
- משתמשים בשיטה
generateContentכדי לבקש שהתשובה תוחזר אחרי שהיא נוצרה במלואה. כדי לצמצם את תפיסת זמן האחזור בקרב קהל אנושי, אפשר להזרים את התשובה בזמן שהיא נוצרת באמצעות השיטהstreamGenerateContent. - מזהה המודל הרב-אופני מופיע בסוף כתובת ה-URL לפני השיטה
(לדוגמה,
gemini-3.5-flash). יכול להיות שהדוגמה הזו תתמוך גם במודלים אחרים.
אימות השימוש ב-PayGo בעדיפות גבוהה
כדי לבדוק אם הבקשה השתמשה בתשלום לפי שימוש עם עדיפות, אפשר לעיין בתשובה ולחפש את סוג התנועה, כמו בדוגמאות הבאות.
Python
אפשר לבדוק אם נעשה שימוש ב-Priority PayGo לבקשה מהשדה traffic_type בתשובה. אם הבקשה שלכם עובדה באמצעות PayGo עם עדיפות, הערך של השדה traffic_type הוא ON_DEMAND_PRIORITY.
sdk_http_response=HttpResponse( headers=<dict len=9> ) candidates=[Candidate( avg_logprobs=-0.539712212302468, content=Content( parts=[ Part( text="""Response to sample request. """ ), ], role='model' ), finish_reason=<FinishReason.STOP: 'STOP'> )] create_time=datetime.datetime(2025, 12, 3, 20, 32, 55, 916498, tzinfo=TzInfo(0)) model_version='gemini-2.5-flash' prompt_feedback=None response_id='response_id' usage_metadata=GenerateContentResponseUsageMetadata( candidates_token_count=1408, candidates_tokens_details=[ ModalityTokenCount( modality=<MediaModality.TEXT: 'TEXT'>, token_count=1408 ), ], prompt_token_count=5, prompt_tokens_details=[ ModalityTokenCount( modality=<MediaModality.TEXT: 'TEXT'>, token_count=5 ), ], thoughts_token_count=1356, total_token_count=2769, traffic_type=<TrafficType.ON_DEMAND_PRIORITY: 'ON_DEMAND_PRIORITY'> ) automatic_function_calling_history=[] parsed=None
REST
אפשר לבדוק אם נעשה שימוש ב-Priority PayGo לבקשה מהשדה trafficType בתשובה. אם הבקשה שלכם עובדה באמצעות PayGo עם עדיפות, הערך של השדה trafficType הוא ON_DEMAND_PRIORITY.
{ "candidates": [ { "content": { "role": "model", "parts": [ { "text": "Response to sample request." } ] }, "finishReason": "STOP" } ], "usageMetadata": { "promptTokenCount": 3, "candidatesTokenCount": 900, "totalTokenCount": 1957, "trafficType": "ON_DEMAND_PRIORITY", "thoughtsTokenCount": 1054 } }
מגבלות על קצב העברת הנתונים
ב-Priority PayGo יש מגבלת קצב העברת נתונים בסיסית ברמת הארגון לכל מודל:
- מודלים של Gemini Pro: 10,000,000 טוקנים לדקה
- מודלים של Gemini Flash ו-Flash-Lite: 50,000,000 טוקנים לדקה
המגבלות האלה זמינות לארגון שלכם באופן מיידי. אין תקופת הסתגלות, ולא צריך להשתמש בשירות באופן קבוע כדי להגיע אליהם. בדומה לתמחור רגיל לפי שימוש, מגבלת התפוקה שמוצגת למשפחת מודלים חלה באופן עצמאי על כל מודל במשפחה.
התנועה מעל המגבלה לא משודרגת אוטומטית. אם יש קיבולת זמינה, פלטפורמת הסוכנים ממשיכה לטפל בתנועה הזו בעדיפות, והחיוב הוא לפי התעריפים של תשלום לפי שימוש בעדיפות. הבקשות משודרגות ל-Standard PayGo רק כשאין קיבולת פנויה לטיפול בהן בעדיפות, והן מחויבות לפי התעריפים של Standard PayGo.
אפשר לבדוק מהתשובה אם הבקשה שודרגה. בבקשות ששודרגו לאחור לשיטת התשלום הרגילה לפי שימוש, סוג התנועה מוגדר כ-ON_DEMAND. מידע נוסף זמין במאמר אימות השימוש ב-PayGo עם עדיפות.
כדי להקטין את הסיכוי לשדרוג לאחור, מומלץ להחליק את התנועה בכל דקה במקום לשלוח עליות חדות ברמה השנייה. אם עומס העבודה שלכם מחייב מגבלה גבוהה יותר, תוכלו לפנות לצוות המכירות. אם אתם צריכים קיבולת מובטחת וייעודית לעומסי עבודה, כדאי לעיין במאמר בנושא תפוקה שהוקצתה.
המאמרים הבאים
- מידע נוסף על נפח נתונים מוקצה זמין במאמר נפח נתונים מוקצה.
- מידע על מכסות ומגבלות ב-Agent Platform זמין במאמר בנושא מכסות ומגבלות ב-Gemini Enterprise Agent Platform.
- מידע נוסף על Google Cloud מכסות ומגבלות מערכת זמין במאמרי העזרה בנושא מכסות ב-Cloud.