מודלים של xAI Grok זמינים לשימוש כממשקי API מנוהלים בפלטפורמת הסוכנים של Gemini Enterprise. אתם יכולים להזרים את התשובות כדי לצמצם את זמן האחזור שמשתמשי הקצה חווים. תשובה מוזרמת משתמשת באירועים שנשלחים מהשרת (SSE) כדי להזרים את התשובה באופן מצטבר.
מודלים מנוהלים של xAI
המודלים הבאים של xAI זמינים לשימוש ב-Gemini Enterprise Agent Platform. כדי לגשת למודל של xAI, עוברים לכרטיס המודל שלו ב-Model Garden.
Grok 4.3
Grok 4.3 הוא מודל הדגל של xAI.
Grok 4.20 (חשיבה רציונלית)
Grok 4.20 (Reasoning) הוא מודל הדגל של xAI, עם שיעור הזיות נמוך מוביל בתעשייה. הוא מצטיין במשימות של הבנת מסמכים ובהפעלת כלים אגנטיים לטווח ארוך.
מעבר לכרטיס המודל של Grok 4.20 (Reasoning)
Grok 4.20 (Non-reasoning)
Grok 4.20 (ללא נימוק) הוא המודל המוביל של xAI שלא מבוסס על חשיבה, והוא מתאפיין בשיעור נמוך של הזיות בהשוואה למודלים אחרים בתחום. הוא מצטיין בתרחישי שימוש שרגישים לזמן האחזור, כמו תמיכת לקוחות וסיווג.
מעבר לכרטיס מודל Grok 4.20 (ללא נימוק)
Grok 4.1 Fast (הסקת מסקנות)
Grok 4.1 Fast (Reasoning) הוא המודל הכי חסכוני של xAI, עם יכולות חזקות של הפעלת כלים וסינתזה יעילה של מאגר ידע. מצטיין במשימות חיפוש שכוללות נתונים מהאינטרנט וכלי מאגר ידע פנימיים.
מעבר לכרטיס המודל Grok 4.1 Fast (Reasoning)
Grok 4.1 Fast (ללא נימוקים)
Grok 4.1 Fast (ללא יכולת חשיבה) הוא המודל הכי חסכוני של xAI שאינו מבוסס על חשיבה, והוא מותאם לביצועים עם זמן אחזור נמוך. הוא מצטיין במשימות בהיקף גדול כמו סיכום וסיווג.
מעבר לכרטיס מודל Grok 4.1 Fast (Non-reasoning)
שימוש במודלים של xAI
במודלים מנוהלים, אפשר להשתמש בפקודות curl כדי לשלוח בקשות לנקודת הקצה של Gemini Enterprise Agent Platform באמצעות שמות המודלים הבאים. מידע על יצירת שיחות עם מודלים של xAI באמצעות סטרימינג או ללא סטרימינג זמין במאמר קריאה לממשקי API של מודלים פתוחים.
במודלים מנוהלים, אפשר להשתמש בפקודות curl כדי לשלוח בקשות לנקודת הקצה של Gemini Enterprise Agent Platform באמצעות שמות המודלים הבאים:
- ל-Grok 4.3, משתמשים ב-
grok-4.3 - Grok 4.20 (Reasoning),
grok-4.20-reasoning - ל-Grok 4.20 (ללא נימוקים), משתמשים ב-
grok-4.20-non-reasoning - כדי להשתמש ב-Grok 4.1 Fast (Reasoning), משתמשים ב-
grok-4.1-fast-reasoning - כדי להשתמש ב-Grok 4.1 Fast (ללא נימוקים), צריך להשתמש ב-
grok-4.1-fast-non-reasoning
מכסות של Grok
למודלים של Grok יש מכסה גלובלית. המכסה מצוינת בשאילתות לדקה (QPM) ובטוקנים לדקה (TPM). המדד TPM כולל גם אסימוני קלט וגם אסימוני פלט.
כדי לשמור על הביצועים הכוללים של השירות ועל שימוש מקובל, יכול להיות שהמכסות המקסימליות ישתנו בהתאם לחשבון, ובמקרים מסוימים הגישה עשויה להיות מוגבלת. אפשר לראות את המכסות של הפרויקט בדף Quotas & Systems Limits במסוף Google Cloud . צריך גם לוודא שיש לכם את המכסות הבאות:
global_generate_content_requests_per_minute_per_project_per_base_modelמגדיר את מכסת השאילתות לדקה.ב-TPM, יש שני ערכי מכסה שחלים על דגמים מסוימים:
global_generate_content_input_tokens_per_minute_per_base_modelמגדיר את מכסת הקלט של TPM ו- global_generate_content_output_tokens_per_minute_per_base_modelמגדיר את מכסת הפלט של TPM.
כדי לראות אילו מודלים סופרים את טוקני הקלט והפלט בנפרד, אפשר לעיין בדפים של המודלים הספציפיים.