מודלים של Mistral AI

מודלים של Mistral AI ב-Gemini Enterprise Agent Platform הם מודלים מנוהלים לחלוטין וחסרי שרתים (serverless) שזמינים כממשקי API. כדי להשתמש במודל AI של Mistral ב-Agent Platform, שולחים בקשה ישירות לנקודת קצה ל-API של Agent Platform. מודלים של Mistral AI משתמשים ב-API מנוהל, ולכן אין צורך להקצות או לנהל תשתית.

אתם יכולים להזרים את התשובות כדי לצמצם את זמן האחזור שמשתמשי הקצה חווים. תגובה שמוזרמת משתמשת באירועים שנשלחים מהשרת (SSE) כדי להזרים את התגובה באופן מצטבר.

התשלום על מודלים של Mistral AI מתבצע לפי שימוש (תשלום לפי שימוש). למידע על תמחור לפי שימוש, אפשר לעיין במחירי המודלים של Mistral AI בדף התמחור של Gemini Enterprise Agent Platform.

מודלים זמינים של Mistral AI

המודלים הבאים זמינים מ-Mistral AI לשימוש ב-Gemini Enterprise Agent Platform. כדי לגשת למודל Mistral AI, עוברים לכרטיס המודל שלו ב-Model Garden.

Mistral Medium 3 מודל מולטי-מודאלי רב-תכליתי שנועד לחשיבה רציונלית משופרת, לתכנות, להבנת מסמכים עם הקשר ארוך, לתפוקה גבוהה של צומת יחיד ולתהליכי עבודה Agentic Workflows.
Mistral OCR (25.05) ‫API לזיהוי תווים אופטי (OCR) להבנה של מסמכים עשירים, לחילוץ תמונות, טבלאות, גרפים ועיצוב LaTeX משולבים לצינורות RAG מרובי-אופנים.
Mistral Small 3.1 (25.03) מודל רב-תכליתי עם זמן אחזור נמוך וחלון הקשר של 128,000 טוקנים, שעבר אופטימיזציה לצ'אט יעיל, לתכנות ולביצוע הוראות.
‫Codestral 2 מודל מתמחה ליצירת קוד, שנועד להשלמה מדויקת של קוד חלקי (FIM), לסקר קוד, לארגון הקוד מחדש (Refactoring) ולכלים למפתחים.

שימוש במודלים של Mistral AI

אפשר להשתמש בפקודות curl כדי לשלוח בקשות לנקודת הקצה של Gemini Enterprise Agent Platform באמצעות שמות המודלים הבאים:

  • ל-Mistral Medium 3, משתמשים ב-mistral-medium-3
  • ל-Mistral OCR (25.05), משתמשים ב-mistral-ocr-2505
  • ל-Mistral Small 3.1 ‏ (25.03), משתמשים ב-mistral-small-2503
  • ב-Codestral 2, משתמשים ב-codestral-2

מידע נוסף על השימוש ב-Mistral AI SDK זמין ב מסמכי התיעוד של Mistral AI Gemini Enterprise Agent Platform.

לפני שמתחילים

כדי להשתמש במודלים של Mistral AI עם Gemini Enterprise Agent Platform, צריך לבצע את השלבים הבאים. כדי להשתמש ב-Gemini Enterprise Agent Platform, צריך להפעיל את Agent Platform API ‏(aiplatform.googleapis.com). אם כבר יש לכם פרויקט קיים שבו Agent Platform API מופעל, אתם יכולים להשתמש בפרויקט הזה במקום ליצור פרויקט חדש.

  1. נכנסים לחשבון Google Cloud . אנחנו ממליצים למשתמשים חדשים ב- Google Cloud ליצור חשבון כדי שיוכלו להעריך את הביצועים של המוצרים שלנו בתרחישים מהעולם האמיתי. לקוחות חדשים מקבלים בחינם גם קרדיט בשווי 300$ להרצה, לבדיקה ולפריסה של עומסי העבודה.
  2. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  3. Verify that billing is enabled for your Google Cloud project.

  4. Enable the Gemini Enterprise Agent Platform API, if it is not already enabled.

    Roles required to enable APIs

    To enable APIs, you need the serviceusage.services.enable permission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.

    Enable the API

  5. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  6. Verify that billing is enabled for your Google Cloud project.

  7. Enable the Gemini Enterprise Agent Platform API, if it is not already enabled.

    Roles required to enable APIs

    To enable APIs, you need the serviceusage.services.enable permission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.

    Enable the API

  8. עוברים לאחד מכרטיסי המודל הבאים ב-Model Garden ולוחצים על Enable:

איך מתקשרים למודל של Mistral AI באמצעות סטרימינג

בדוגמה הבאה מבוצעת קריאה להזרמת נתונים למודל של Mistral AI.

REST

אחרי שמגדירים את הסביבה, אפשר להשתמש ב-REST כדי לבדוק פרומפט טקסטואלי. בדוגמה הבאה מוצגת שליחה של בקשה לנקודת הקצה של מודל בעל התוכן הדיגיטלי.

לפני שמשתמשים בנתוני הבקשה, צריך להחליף את הנתונים הבאים:

  • ‫LOCATION: אזור שתומך במודלים של Mistral AI.
  • ‫MODEL: שם המודל שרוצים להשתמש בו. בגוף הבקשה, לא כוללים את מספר גרסת המודל @.
  • ROLE: התפקיד שמשויך להודעה. אפשר לציין user או assistant. ההודעה הראשונה חייבת להשתמש בתפקיד user. המודלים פועלים בתורות מתחלפות של user ו-assistant. אם ההודעה האחרונה משתמשת בתפקיד assistant, תוכן התגובה ממשיך מיד מהתוכן שבהודעה הזו. אתם יכולים להשתמש בזה כדי להגביל חלק מהתשובה של המודל.
  • ‫STREAM: ערך בוליאני שמציין אם התגובה מועברת בסטרימינג או לא. הזרמת התשובה כדי לצמצם את תפיסת זמן האחזור של משתמש הקצה. הערך true מאפשר להציג את התשובה באופן שוטף, והערך false מאפשר להציג את התשובה כשהיא מוכנה.
  • ‫CONTENT: התוכן, כמו טקסט, של ההודעה user או assistant.
  • MAX_OUTPUT_TOKENS: המספר המקסימלי של טוקנים שאפשר ליצור בתשובה. טוקן הוא בערך 3.5 תווים. ‫100 טוקנים תואמים בערך ל-60 עד 80 מילים.

    כדי לקבל תשובות קצרות יותר, מציינים ערך נמוך יותר, וכדי לקבל תשובות ארוכות יותר, מציינים ערך גבוה יותר.

ה-method של ה-HTTP וכתובת ה-URL:

POST https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:streamRawPredict

גוף בקשת JSON:

{
"model": MODEL,
  "messages": [
   {
    "role": "ROLE",
    "content": "CONTENT"
   }],
  "max_tokens": MAX_TOKENS,
  "stream": true
}

כדי לשלוח את הבקשה עליכם לבחור אחת מהאפשרויות הבאות:

curl

שומרים את גוף הבקשה בקובץ בשם request.json ומריצים את הפקודה הבאה:

curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-d @request.json \
"https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:streamRawPredict"

PowerShell

שומרים את גוף הבקשה בקובץ בשם request.json ומריצים את הפקודה הבאה:

$cred = gcloud auth print-access-token
$headers = @{ "Authorization" = "Bearer $cred" }

Invoke-WebRequest `
-Method POST `
-Headers $headers `
-ContentType: "application/json; charset=utf-8" `
-InFile request.json `
-Uri "https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:streamRawPredict" | Select-Object -Expand Content

אתם אמורים לקבל תגובת JSON שדומה לזו:

ביצוע קריאה אוניטרית למודל Mistral AI

בדוגמה הבאה מבוצעת קריאה אוניטרית למודל של Mistral AI.

REST

אחרי שמגדירים את הסביבה, אפשר להשתמש ב-REST כדי לבדוק פרומפט טקסטואלי. בדוגמה הבאה מוצגת שליחה של בקשה לנקודת הקצה של מודל בעל התוכן הדיגיטלי.

לפני שמשתמשים בנתוני הבקשה, צריך להחליף את הנתונים הבאים:

  • ‫LOCATION: אזור שתומך במודלים של Mistral AI.
  • ‫MODEL: שם המודל שרוצים להשתמש בו. בגוף הבקשה, לא כוללים את מספר גרסת המודל @.
  • ROLE: התפקיד שמשויך להודעה. אפשר לציין user או assistant. ההודעה הראשונה חייבת להשתמש בתפקיד user. המודלים פועלים בתורות מתחלפות של user ו-assistant. אם ההודעה האחרונה משתמשת בתפקיד assistant, תוכן התגובה ממשיך מיד מהתוכן שבהודעה הזו. אתם יכולים להשתמש בזה כדי להגביל חלק מהתשובה של המודל.
  • ‫STREAM: ערך בוליאני שמציין אם התגובה מועברת בסטרימינג או לא. הזרמת התשובה כדי לצמצם את תפיסת זמן האחזור של משתמש הקצה. הערך true מאפשר להציג את התשובה באופן שוטף, והערך false מאפשר להציג את התשובה כשהיא מוכנה.
  • ‫CONTENT: התוכן, כמו טקסט, של ההודעה user או assistant.
  • MAX_OUTPUT_TOKENS: המספר המקסימלי של טוקנים שאפשר ליצור בתשובה. טוקן הוא בערך 3.5 תווים. ‫100 טוקנים תואמים בערך ל-60 עד 80 מילים.

    כדי לקבל תשובות קצרות יותר, מציינים ערך נמוך יותר, וכדי לקבל תשובות ארוכות יותר, מציינים ערך גבוה יותר.

ה-method של ה-HTTP וכתובת ה-URL:

POST https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:rawPredict

גוף בקשת JSON:

{
"model": MODEL,
  "messages": [
   {
    "role": "ROLE",
    "content": "CONTENT"
   }],
  "max_tokens": MAX_TOKENS,
  "stream": false
}

כדי לשלוח את הבקשה עליכם לבחור אחת מהאפשרויות הבאות:

curl

שומרים את גוף הבקשה בקובץ בשם request.json ומריצים את הפקודה הבאה:

curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-d @request.json \
"https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:rawPredict"

PowerShell

שומרים את גוף הבקשה בקובץ בשם request.json ומריצים את הפקודה הבאה:

$cred = gcloud auth print-access-token
$headers = @{ "Authorization" = "Bearer $cred" }

Invoke-WebRequest `
-Method POST `
-Headers $headers `
-ContentType: "application/json; charset=utf-8" `
-InFile request.json `
-Uri "https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:rawPredict" | Select-Object -Expand Content

אתם אמורים לקבל תגובת JSON שדומה לזו:

זמינות אזורית ומכסות של מודלים של Mistral AI

במודלים של Mistral AI, המכסה חלה על כל אזור שבו המודל זמין. המכסה מצוינת בשאילתות לדקה (QPM) ובטוקנים לדקה (TPM). המדד TPM כולל גם אסימוני קלט וגם אסימוני פלט.

דגם אזור מכסות חלון ההקשר
Mistral Medium 3
us-central1
  • QPM: 90
  • TPM: 315,000
‫128,000
europe-west4
  • QPM: 90
  • TPM: 315,000
‫128,000
Mistral OCR (25.05)
us-central1
  • QPM: 30
  • דפים לכל בקשה: 30 (דף אחד = מיליון טוקנים של קלט ומיליון טוקנים של פלט)
‫30 דפים
europe-west4
  • QPM: 30
  • דפים לכל בקשה: 30 (דף אחד = מיליון טוקנים של קלט ומיליון טוקנים של פלט)
‫30 דפים
Mistral Small 3.1 (25.03)
us-central1
  • QPM: 60
  • TPM: 200,000
‫128,000
europe-west4
  • QPM: 60
  • TPM: 200,000
‫128,000
Codestral 2
us-central1
  • QPM: 1,100
  • קלט TPM: 1,100,000
  • פלט TPM: ‏ 110,000
‫128,000 טוקנים
europe-west4
  • QPM: 1,100
  • קלט TPM: 1,100,000
  • פלט TPM: ‏ 110,000
‫128,000 טוקנים

אם אתם רוצים להגדיל את המכסות שלכם ב-Agent Platform, אתם יכולים להשתמש במסוף Google Cloud כדי לבקש הגדלה של המכסה. מידע נוסף על מכסות זמין במאמר סקירה כללית על מכסות ב-Cloud.