Model AI Mistral

Model AI Mistral di Gemini Enterprise Agent Platform menawarkan model yang terkelola sepenuhnya dan serverless sebagai API. Untuk menggunakan model AI Mistral di Agent Platform, kirim permintaan langsung ke endpoint API Agent Platform. Karena model Mistral AI menggunakan API terkelola, tidak perlu menyediakan atau mengelola infrastruktur.

Anda dapat melakukan streaming respons untuk mengurangi persepsi latensi pengguna akhir. Respons yang di-streaming menggunakan peristiwa yang dikirim server (SSE) untuk melakukan streaming respons secara bertahap.

Anda membayar model AI Mistral saat menggunakannya (bayar sesuai penggunaan). Untuk harga bayar sesuai penggunaan, lihat harga model Mistral AI di halaman harga Gemini Enterprise Agent Platform.

Model Mistral AI yang tersedia

Model berikut tersedia dari Mistral AI untuk digunakan di Gemini Enterprise Agent Platform. Untuk mengakses model AI Mistral, buka kartu model Model Garden-nya.

Mistral Medium 3 Model multimodal serbaguna yang dirancang untuk penalaran tingkat lanjut, pemrograman, pemahaman dokumen dengan konteks panjang, throughput tinggi node tunggal, dan alur kerja agentik.
Mistral OCR (25.05) Optical Character Recognition API untuk pemahaman dokumen yang kaya, mengekstrak gambar, tabel, grafik, dan format LaTeX yang saling terkait untuk pipeline RAG multimodal.
Mistral Small 3.1 (25.03) Model multimodal serbaguna dengan latensi rendah dan jendela konteks 128.000 token, yang dioptimalkan untuk chat, pemrograman, dan mengikuti perintah yang sangat efisien.
Codestral 2 Model pembuatan kode khusus yang dibuat untuk penyelesaian isi di tengah (FIM) dengan presisi tinggi, peninjauan kode, refaktorisasi, dan alat developer.

Menggunakan model AI Mistral

Anda dapat menggunakan perintah curl untuk mengirim permintaan ke endpoint Gemini Enterprise Agent Platform menggunakan nama model berikut:

  • Untuk Mistral Medium 3, gunakan mistral-medium-3
  • Untuk Mistral OCR (25.05), gunakan mistral-ocr-2505
  • Untuk Mistral Small 3.1 (25.03), gunakan mistral-small-2503
  • Untuk Codestral 2, gunakan codestral-2

Untuk mengetahui informasi selengkapnya tentang cara menggunakan Mistral AI SDK, lihat dokumentasi Mistral AI Gemini Enterprise Agent Platform.

Sebelum memulai

Untuk menggunakan model AI Mistral dengan Gemini Enterprise Agent Platform, Anda harus melakukan langkah-langkah berikut. Agent Platform API (aiplatform.googleapis.com) harus diaktifkan untuk menggunakan Gemini Enterprise Agent Platform. Jika sudah memiliki project dengan Agent Platform API yang diaktifkan, Anda dapat menggunakan project tersebut, bukan membuat project baru.

  1. Login ke akun Google Cloud Anda. Jika Anda baru menggunakan Google Cloud, buat akun untuk mengevaluasi performa produk kami dalam skenario dunia nyata. Pelanggan baru juga mendapatkan kredit gratis senilai $300 untuk menjalankan, menguji, dan men-deploy workload.
  2. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  3. Verify that billing is enabled for your Google Cloud project.

  4. Enable the Gemini Enterprise Agent Platform API, if it is not already enabled.

    Roles required to enable APIs

    To enable APIs, you need the serviceusage.services.enable permission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.

    Enable the API

  5. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  6. Verify that billing is enabled for your Google Cloud project.

  7. Enable the Gemini Enterprise Agent Platform API, if it is not already enabled.

    Roles required to enable APIs

    To enable APIs, you need the serviceusage.services.enable permission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.

    Enable the API

  8. Buka salah satu kartu model Model Garden berikut, lalu klik Aktifkan:

Melakukan panggilan streaming ke model Mistral AI

Contoh berikut melakukan panggilan streaming ke model AI Mistral.

REST

Setelah menyiapkan lingkungan, Anda dapat menggunakan REST untuk menguji perintah teks. Contoh berikut mengirimkan permintaan ke endpoint model penayang.

Sebelum menggunakan salah satu data permintaan, lakukan penggantian berikut:

  • LOCATION: Region yang mendukung model Mistral AI.
  • MODEL: Nama model yang ingin Anda gunakan. Di isi permintaan, kecualikan nomor versi model @.
  • ROLE: Peran yang terkait dengan pesan. Anda dapat menentukan user atau assistant. Pesan pertama harus menggunakan peran user. Model beroperasi dengan giliran user dan assistant yang bergantian. Jika pesan terakhir menggunakan peran assistant, maka konten respons akan langsung dilanjutkan dari konten dalam pesan tersebut. Anda dapat menggunakan ini untuk membatasi sebagian respons model.
  • STREAM: Boolean yang menentukan apakah respons di-streaming atau tidak. Streaming respons Anda untuk mengurangi persepsi latensi penggunaan akhir. Setel ke true untuk melakukan streaming respons dan false untuk menampilkan respons sekaligus.
  • CONTENT: Konten, seperti teks, dari pesan user atau assistant.
  • MAX_OUTPUT_TOKENS: Jumlah maksimum token yang dapat dibuat dalam respons. Token terdiri dari sekitar 3,5 karakter. 100 token setara dengan sekitar 60-80 kata.

    Tentukan nilai yang lebih rendah untuk respons yang lebih singkat dan nilai yang lebih tinggi untuk potensi respons yang lebih panjang.

Metode HTTP dan URL:

POST https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:streamRawPredict

Meminta isi JSON:

{
"model": MODEL,
  "messages": [
   {
    "role": "ROLE",
    "content": "CONTENT"
   }],
  "max_tokens": MAX_TOKENS,
  "stream": true
}

Untuk mengirim permintaan Anda, pilih salah satu opsi berikut:

curl

Simpan isi permintaan dalam file bernama request.json, dan jalankan perintah berikut:

curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-d @request.json \
"https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:streamRawPredict"

PowerShell

Simpan isi permintaan dalam file bernama request.json, dan jalankan perintah berikut:

$cred = gcloud auth print-access-token
$headers = @{ "Authorization" = "Bearer $cred" }

Invoke-WebRequest `
-Method POST `
-Headers $headers `
-ContentType: "application/json; charset=utf-8" `
-InFile request.json `
-Uri "https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:streamRawPredict" | Select-Object -Expand Content

Anda akan melihat respons JSON yang mirip seperti berikut:

Melakukan panggilan unary ke model AI Mistral

Contoh berikut melakukan panggilan unary ke model AI Mistral.

REST

Setelah menyiapkan lingkungan, Anda dapat menggunakan REST untuk menguji perintah teks. Contoh berikut mengirimkan permintaan ke endpoint model penayang.

Sebelum menggunakan salah satu data permintaan, lakukan penggantian berikut:

  • LOCATION: Region yang mendukung model Mistral AI.
  • MODEL: Nama model yang ingin Anda gunakan. Di isi permintaan, kecualikan nomor versi model @.
  • ROLE: Peran yang terkait dengan pesan. Anda dapat menentukan user atau assistant. Pesan pertama harus menggunakan peran user. Model beroperasi dengan giliran user dan assistant yang bergantian. Jika pesan terakhir menggunakan peran assistant, maka konten respons akan langsung dilanjutkan dari konten dalam pesan tersebut. Anda dapat menggunakan ini untuk membatasi sebagian respons model.
  • STREAM: Boolean yang menentukan apakah respons di-streaming atau tidak. Streaming respons Anda untuk mengurangi persepsi latensi penggunaan akhir. Setel ke true untuk melakukan streaming respons dan false untuk menampilkan respons sekaligus.
  • CONTENT: Konten, seperti teks, dari pesan user atau assistant.
  • MAX_OUTPUT_TOKENS: Jumlah maksimum token yang dapat dibuat dalam respons. Token terdiri dari sekitar 3,5 karakter. 100 token setara dengan sekitar 60-80 kata.

    Tentukan nilai yang lebih rendah untuk respons yang lebih singkat dan nilai yang lebih tinggi untuk potensi respons yang lebih panjang.

Metode HTTP dan URL:

POST https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:rawPredict

Meminta isi JSON:

{
"model": MODEL,
  "messages": [
   {
    "role": "ROLE",
    "content": "CONTENT"
   }],
  "max_tokens": MAX_TOKENS,
  "stream": false
}

Untuk mengirim permintaan Anda, pilih salah satu opsi berikut:

curl

Simpan isi permintaan dalam file bernama request.json, dan jalankan perintah berikut:

curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-d @request.json \
"https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:rawPredict"

PowerShell

Simpan isi permintaan dalam file bernama request.json, dan jalankan perintah berikut:

$cred = gcloud auth print-access-token
$headers = @{ "Authorization" = "Bearer $cred" }

Invoke-WebRequest `
-Method POST `
-Headers $headers `
-ContentType: "application/json; charset=utf-8" `
-InFile request.json `
-Uri "https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:rawPredict" | Select-Object -Expand Content

Anda akan melihat respons JSON yang mirip seperti berikut:

Ketersediaan dan kuota region model AI Mistral

Untuk model AI Mistral, kuota berlaku untuk setiap region tempat model tersedia. Kuotanya ditentukan dalam kueri per menit (QPM) dan token per menit (TPM). TPM mencakup token input dan output.

Model Wilayah Kuota Jendela konteks
Mistral Medium 3
us-central1
  • QPM: 90
  • TPM: 315.000
128.000
europe-west4
  • QPM: 90
  • TPM: 315.000
128.000
Mistral OCR (25.05)
us-central1
  • QPM: 30
  • Halaman per permintaan: 30 (1 halaman = 1 juta token input dan 1 juta token output)
30 halaman
europe-west4
  • QPM: 30
  • Halaman per permintaan: 30 (1 halaman = 1 juta token input dan 1 juta token output)
30 halaman
Mistral Small 3.1 (25.03)
us-central1
  • QPM: 60
  • TPM: 200.000
128.000
europe-west4
  • QPM: 60
  • TPM: 200.000
128.000
Codestral 2
us-central1
  • QPM: 1.100
  • Input TPM: 1.100.000
  • Output TPM: 110.000
128.000 token
europe-west4
  • QPM: 1.100
  • Input TPM: 1.100.000
  • Output TPM: 110.000
128.000 token

Jika ingin meningkatkan kuota untuk Platform Agen, Anda dapat menggunakan konsol Google Cloud untuk meminta penambahan kuota. Untuk mempelajari lebih lanjut kuota, lihat Ringkasan Kuota Cloud.