Model AI Mistral di Gemini Enterprise Agent Platform menawarkan model yang terkelola sepenuhnya dan serverless sebagai API. Untuk menggunakan model AI Mistral di Agent Platform, kirim permintaan langsung ke endpoint API Agent Platform. Karena model Mistral AI menggunakan API terkelola, tidak perlu menyediakan atau mengelola infrastruktur.
Anda dapat melakukan streaming respons untuk mengurangi persepsi latensi pengguna akhir. Respons yang di-streaming menggunakan peristiwa yang dikirim server (SSE) untuk melakukan streaming respons secara bertahap.
Anda membayar model AI Mistral saat menggunakannya (bayar sesuai penggunaan). Untuk harga bayar sesuai penggunaan, lihat harga model Mistral AI di halaman harga Gemini Enterprise Agent Platform.
Model Mistral AI yang tersedia
Model berikut tersedia dari Mistral AI untuk digunakan di Gemini Enterprise Agent Platform. Untuk mengakses model AI Mistral, buka kartu model Model Garden-nya.
Menggunakan model AI Mistral
Anda dapat menggunakan perintah curl untuk mengirim permintaan ke endpoint Gemini Enterprise Agent Platform menggunakan nama model berikut:
- Untuk Mistral Medium 3, gunakan
mistral-medium-3 - Untuk Mistral OCR (25.05), gunakan
mistral-ocr-2505 - Untuk Mistral Small 3.1 (25.03), gunakan
mistral-small-2503 - Untuk Codestral 2, gunakan
codestral-2
Untuk mengetahui informasi selengkapnya tentang cara menggunakan Mistral AI SDK, lihat dokumentasi Mistral AI Gemini Enterprise Agent Platform.
Sebelum memulai
Untuk menggunakan model AI Mistral dengan Gemini Enterprise Agent Platform, Anda harus melakukan langkah-langkah berikut. Agent Platform API
(aiplatform.googleapis.com) harus diaktifkan untuk menggunakan
Gemini Enterprise Agent Platform. Jika sudah memiliki project dengan
Agent Platform API yang diaktifkan, Anda dapat menggunakan project tersebut, bukan membuat
project baru.
- Login ke akun Google Cloud Anda. Jika Anda baru menggunakan Google Cloud, buat akun untuk mengevaluasi performa produk kami dalam skenario dunia nyata. Pelanggan baru juga mendapatkan kredit gratis senilai $300 untuk menjalankan, menguji, dan men-deploy workload.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Gemini Enterprise Agent Platform API, if it is not already enabled.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Gemini Enterprise Agent Platform API, if it is not already enabled.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.- Buka salah satu kartu model Model Garden berikut, lalu klik Aktifkan:
Melakukan panggilan streaming ke model Mistral AI
Contoh berikut melakukan panggilan streaming ke model AI Mistral.
REST
Setelah menyiapkan lingkungan, Anda dapat menggunakan REST untuk menguji perintah teks. Contoh berikut mengirimkan permintaan ke endpoint model penayang.
Sebelum menggunakan salah satu data permintaan, lakukan penggantian berikut:
- LOCATION: Region yang mendukung model Mistral AI.
- MODEL: Nama model yang ingin Anda gunakan. Di
isi permintaan, kecualikan nomor versi model
@. - ROLE: Peran yang terkait dengan
pesan. Anda dapat menentukan
useratauassistant. Pesan pertama harus menggunakan peranuser. Model beroperasi dengan giliranuserdanassistantyang bergantian. Jika pesan terakhir menggunakan peranassistant, maka konten respons akan langsung dilanjutkan dari konten dalam pesan tersebut. Anda dapat menggunakan ini untuk membatasi sebagian respons model. - STREAM: Boolean yang menentukan
apakah respons di-streaming atau tidak. Streaming respons Anda untuk mengurangi persepsi latensi penggunaan akhir. Setel ke
trueuntuk melakukan streaming respons danfalseuntuk menampilkan respons sekaligus. - CONTENT: Konten, seperti
teks, dari pesan
useratauassistant. - MAX_OUTPUT_TOKENS:
Jumlah maksimum token yang dapat dibuat dalam respons. Token terdiri dari sekitar 3,5 karakter. 100 token setara dengan sekitar 60-80 kata.
Tentukan nilai yang lebih rendah untuk respons yang lebih singkat dan nilai yang lebih tinggi untuk potensi respons yang lebih panjang.
Metode HTTP dan URL:
POST https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:streamRawPredict
Meminta isi JSON:
{
"model": MODEL,
"messages": [
{
"role": "ROLE",
"content": "CONTENT"
}],
"max_tokens": MAX_TOKENS,
"stream": true
}
Untuk mengirim permintaan Anda, pilih salah satu opsi berikut:
curl
Simpan isi permintaan dalam file bernama request.json,
dan jalankan perintah berikut:
curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-d @request.json \
"https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:streamRawPredict"
PowerShell
Simpan isi permintaan dalam file bernama request.json,
dan jalankan perintah berikut:
$cred = gcloud auth print-access-token
$headers = @{ "Authorization" = "Bearer $cred" }
Invoke-WebRequest `
-Method POST `
-Headers $headers `
-ContentType: "application/json; charset=utf-8" `
-InFile request.json `
-Uri "https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:streamRawPredict" | Select-Object -Expand Content
Anda akan melihat respons JSON yang mirip seperti berikut:
Melakukan panggilan unary ke model AI Mistral
Contoh berikut melakukan panggilan unary ke model AI Mistral.
REST
Setelah menyiapkan lingkungan, Anda dapat menggunakan REST untuk menguji perintah teks. Contoh berikut mengirimkan permintaan ke endpoint model penayang.
Sebelum menggunakan salah satu data permintaan, lakukan penggantian berikut:
- LOCATION: Region yang mendukung model Mistral AI.
- MODEL: Nama model yang ingin Anda gunakan. Di
isi permintaan, kecualikan nomor versi model
@. - ROLE: Peran yang terkait dengan
pesan. Anda dapat menentukan
useratauassistant. Pesan pertama harus menggunakan peranuser. Model beroperasi dengan giliranuserdanassistantyang bergantian. Jika pesan terakhir menggunakan peranassistant, maka konten respons akan langsung dilanjutkan dari konten dalam pesan tersebut. Anda dapat menggunakan ini untuk membatasi sebagian respons model. - STREAM: Boolean yang menentukan
apakah respons di-streaming atau tidak. Streaming respons Anda untuk mengurangi persepsi latensi penggunaan akhir. Setel ke
trueuntuk melakukan streaming respons danfalseuntuk menampilkan respons sekaligus. - CONTENT: Konten, seperti
teks, dari pesan
useratauassistant. - MAX_OUTPUT_TOKENS:
Jumlah maksimum token yang dapat dibuat dalam respons. Token terdiri dari sekitar 3,5 karakter. 100 token setara dengan sekitar 60-80 kata.
Tentukan nilai yang lebih rendah untuk respons yang lebih singkat dan nilai yang lebih tinggi untuk potensi respons yang lebih panjang.
Metode HTTP dan URL:
POST https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:rawPredict
Meminta isi JSON:
{
"model": MODEL,
"messages": [
{
"role": "ROLE",
"content": "CONTENT"
}],
"max_tokens": MAX_TOKENS,
"stream": false
}
Untuk mengirim permintaan Anda, pilih salah satu opsi berikut:
curl
Simpan isi permintaan dalam file bernama request.json,
dan jalankan perintah berikut:
curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "Content-Type: application/json; charset=utf-8" \
-d @request.json \
"https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:rawPredict"
PowerShell
Simpan isi permintaan dalam file bernama request.json,
dan jalankan perintah berikut:
$cred = gcloud auth print-access-token
$headers = @{ "Authorization" = "Bearer $cred" }
Invoke-WebRequest `
-Method POST `
-Headers $headers `
-ContentType: "application/json; charset=utf-8" `
-InFile request.json `
-Uri "https://LOCATION-aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/LOCATION/publishers/mistralai/models/MODEL:rawPredict" | Select-Object -Expand Content
Anda akan melihat respons JSON yang mirip seperti berikut:
Ketersediaan dan kuota region model AI Mistral
Untuk model AI Mistral, kuota berlaku untuk setiap region tempat model tersedia. Kuotanya ditentukan dalam kueri per menit (QPM) dan token per menit (TPM). TPM mencakup token input dan output.
| Model | Wilayah | Kuota | Jendela konteks |
|---|---|---|---|
| Mistral Medium 3 | |||
us-central1 |
|
128.000 | |
europe-west4 |
|
128.000 | |
| Mistral OCR (25.05) | |||
us-central1 |
|
30 halaman | |
europe-west4 |
|
30 halaman | |
| Mistral Small 3.1 (25.03) | |||
us-central1 |
|
128.000 | |
europe-west4 |
|
128.000 | |
| Codestral 2 | |||
us-central1 |
|
128.000 token | |
europe-west4 |
|
128.000 token |
Jika ingin meningkatkan kuota untuk Platform Agen, Anda dapat menggunakan konsol Google Cloud untuk meminta penambahan kuota. Untuk mempelajari lebih lanjut kuota, lihat Ringkasan Kuota Cloud.