Ringkasan pemilihan rute model
Perutean model untuk Gateway API adalah lapisan pengelolaan traffic terkelola yang menerima permintaan perintah yang kompatibel dengan OpenAI, mentranskode permintaan tersebut saat dalam proses, dan merutekannya ke model Gemini Enterprise Agent Platform tertentu. Perutean model berfungsi sebagai alternatif terkelola untuk proxy sisi klien seperti LiteLLM, yang menyediakan infrastruktur terpusat untuk mengelola siklus proses agen AI.
Perutean model memindahkan logika perutean ke edge jaringan dan terintegrasi dengan Model Garden Agent Platform untuk pengoptimalan host yang sama. Arsitektur ini menghilangkan persyaratan untuk menghosting, menskalakan, dan memelihara server proxy yang tidak terkelola, sehingga mengurangi biaya operasional dan biaya infrastruktur.
Cakupan dan perjalanan pengguna
Perutean model mendukung perjalanan pengguna inti berikut:
- Pemilihan model: Developer AI menggunakan model terbuka dari Model as a Service (MaaS) di Agent Platform Model Garden. Model ini adalah model Gemini, Anthropic Claude, atau OpenAI GPT.
- Penulisan spesifikasi: Developer AI membuat atau memperbarui konfigurasi perute model dalam spesifikasi OpenAPI 3.x untuk mereferensikan model yang di-deploy.
- Deployment Gateway API: Developer AI men-deploy konfigurasi API dan instance Gateway API menggunakan spesifikasi OpenAPI yang dibuat.
- Perutean perintah: Aplikasi klien mengirim permintaan perintah yang kompatibel dengan OpenAI ke gateway, yang merutekan permintaan dan menerjemahkan payload berdasarkan nama model yang ditentukan dalam payload JSON.
Versi mendatang Gateway API direncanakan untuk mendukung perjalanan pengguna tambahan.
Manfaat perutean model
Menerapkan perutean model di Gateway API memberikan keuntungan berikut:
- Pengelolaan terpusat: Gabungkan pengelolaan traffic AI dalam satu gateway terkelola, sehingga menggantikan konfigurasi perutean sisi klien yang terfragmentasi.
- Mengurangi overhead operasional: Hilangkan biaya infrastruktur dan beban pemeliharaan yang terkait dengan men-deploy server proxy mandiri.
- Performa yang dioptimalkan untuk edge: Periksa perintah dan arahkan traffic di edge jaringan, dengan memanfaatkan integrasi langsung dengan endpoint Model Garden Agent Platform.
- Antarmuka klien standar: Memungkinkan aplikasi klien berinteraksi dengan antarmuka REST yang kompatibel dengan OpenAI secara seragam sambil mengirimkan permintaan secara dinamis ke beragam model dasar di bawahnya.
Persona dan kasus penggunaan
Perutean model memenuhi persyaratan persona berikut:
- Platform Engineer: Menyediakan solusi infrastruktur terkelola untuk menggantikan logika perutean sisi klien di seluruh deployment AI perusahaan.
- Developer AI: Ekspos endpoint API standar yang secara dinamis merutekan permintaan di antara berbagai model dasar (seperti Gemini Pro, Gemini Flash, atau Anthropic Claude) berdasarkan parameter payload permintaan.
- Admin Tata Kelola: Menerapkan kebijakan akses terpusat (seperti autentikasi dan kuota) dan memantau volume traffic AI secara keseluruhan di seluruh organisasi.
Kasus penggunaan yang didukung
Selama Pratinjau Publik, perutean model mendukung perutean yang hanya berdasarkan tag atau nama model (misalnya, "model": "gemini-3.5-flash-lite") yang ditentukan dalam payload JSON permintaan klien yang kompatibel dengan OpenAI.
Arsitektur dan alur permintaan
Perutean model beroperasi sebagai lapisan perutean terkelola dalam bidang data Gateway API. Saat aplikasi klien mengirim permintaan perintah yang kompatibel dengan OpenAI ke gateway, urutan berikut akan terjadi:
- Penyadapan permintaan: Gateway menyadap permintaan
POSTyang masuk (misalnya,POST /chat/completions). - Pemeriksaan payload: Router model memeriksa atribut
modeldalam payload JSON yang masuk (misalnya,{"model": "claude-opus-4-7", "messages": [...]}). - Evaluasi aturan: Router mencocokkan string
modeldengan aturan perutean yang ditentukan dalam spesifikasi OpenAPI Anda. Jika tidak ada aturan yang cocok, router akan memilih model default yang dikonfigurasi. - Transcoding saat dalam proses: Gateway mentranskode permintaan yang kompatibel dengan OpenAI ke skema prediksi Agent Platform tujuan.
- Pengiriman backend: Gateway mengirimkan permintaan yang ditranskode ke endpoint Model Garden Agent Platform yang ditetapkan dan menampilkan respons model kepada klien.
Performa dan batasan
Sebelum menerapkan perutean model, tinjau batasan teknis berikut:
- Batasan host: Perutean model hanya mendukung perutean ke model MaaS yang telah di-deploy sebelumnya dan dihosting di Model Garden Agent Platform. Semua model yang dirujuk oleh satu router memiliki nama host yang sama (misalnya, endpoint global
aiplatform.googleapis.comatau satu endpoint regional sepertius-central1-aiplatform.googleapis.com). - Persyaratan spesifikasi: Perutean model memerlukan spesifikasi OpenAPI 3.x dan ekstensi OpenAPI 3.x Gateway API yang sesuai. Spesifikasi OpenAPI 2.0 (Swagger) tidak didukung.
- Update gateway: Anda tidak dapat mengupdate gateway yang ada yang di-deploy tanpa perutean model untuk mengaktifkan perutean model, dan Anda juga tidak dapat mengupdate gateway yang di-deploy dengan perutean model untuk menonaktifkan atau menghapus perutean model. Untuk mengganti mode perutean, Anda harus membuat dan men-deploy konfigurasi API dan instance gateway baru.
- Konfigurasi campuran: Spesifikasi OpenAPI tidak dapat berisi campuran operasi perutean model dan non-model. Semua operasi dalam spesifikasi harus menggunakan perutean model atau perutean gateway standar.
- Kontrol Layanan VPC: Gateway perutean model tidak mendukung Kontrol Layanan VPC. Anda tidak dapat menggunakan perimeter Kontrol Layanan VPC dengan instance Gateway API yang mengaktifkan perutean model.
- Streaming dan protokol yang tidak didukung: Perutean model mendukung streaming respons (peristiwa yang dikirim server), tetapi tidak mendukung streaming sisi permintaan, gRPC, WebSockets, atau Gemini Live.
- Modalitas yang didukung: Selama Pratinjau Publik, perutean model mengasumsikan permintaan perintah berbasis teks yang diformat sebagai payload JSON yang kompatibel dengan OpenAI dan merutekan berdasarkan tag atau nama
modelsecara eksklusif dalam payload. - Kolom payload yang diperlukan: Payload permintaan JSON yang masuk harus menyertakan atribut
model. Selama Pratinjau Publik, jika kolommodeltidak ada dalam payload permintaan klien, gateway akan memproses permintaan secara tidak benar, bukan menolaknya dengan error. Selalu pastikan permintaan klien menentukan kolommodeldalam payload JSON. - Batasan runtime: Batas dan perilaku layanan infrastruktur hosting gateway standar berlaku untuk endpoint perutean model Anda:
- Waktu tunggu maksimum: Gateway menerapkan waktu tunggu permintaan maksimum 3.600 detik (1 jam), yang berlaku untuk permintaan streaming yang berjalan lama.
- Latensi cold start: Jika instance gateway Anda diskalakan ke nol selama periode tidak ada aktivitas, permintaan awal mungkin mengalami latensi cold start, yang dapat memengaruhi jalur inferensi AI yang sensitif terhadap latensi.
- Jalur URL yang dicadangkan: Anda tidak dapat menggunakan jalur URL yang dicadangkan seperti
/eventlog, jalur yang diawali dengan/_ah/, atau jalur tertentu yang diakhiri denganz(untuk mencegah konflik, hindari penggunaan nama jalur yang diakhiri denganz). - Dekode karakter URL: Gateway secara otomatis mendekode karakter tertentu yang dienkode dalam URL permintaan sebelum memproses permintaan (misalnya,
%41didekode menjadiA).