Baik Anda membuat agen, menjalankan model inferensi, atau berintegrasi dengan berbagai layanan AI, Cloud Run memberikan skalabilitas, fleksibilitas, dan kemudahan penggunaan yang diperlukan untuk mewujudkan inovasi AI Anda.
Halaman ini menyoroti beberapa kasus penggunaan tingkat tinggi untuk menghosting, membangun, dan men-deploy workload AI di Cloud Run.
Mengapa menggunakan Cloud Run untuk workload AI?
Cloud Run menawarkan beberapa keunggulan untuk memastikan aplikasi AI Anda dapat diskalakan, fleksibel, dan dapat dikelola. Beberapa sorotan mencakup:
- Dukungan container yang fleksibel: Kemas aplikasi dan dependensinya dalam container, atau gunakan bahasa, library, atau framework yang didukung. Pelajari lebih lanjut tentang Kontrak runtime container Cloud Run.
- Endpoint HTTP: Setelah men-deploy layanan atau instance Cloud Run, Anda akan menerima endpoint URL Cloud Run yang aman dan siap pakai. Cloud Run menyediakan streaming melalui dukungan encoding transfer terpisah HTTP, HTTP/2, dan WebSockets.
- Penskalaan otomatis atau manual: Untuk layanan Cloud Run, Cloud Run akan otomatis menskalakan layanan Anda berdasarkan permintaan. Hal ini memastikan Anda hanya membayar sesuai penggunaan, sehingga ideal untuk workload AI yang tidak dapat diprediksi. Anda juga dapat menetapkan layanan ke penskalaan manual berdasarkan kebutuhan traffic dan penggunaan CPU. Untuk instance Cloud Run, penskalaan otomatis tidak berlaku; instance tersebut berjalan sebagai singleton yang Anda mulai dan hentikan secara manual.
Dukungan GPU: Percepat model AI Anda dengan mengonfigurasi resource Cloud Run dengan GPU. Layanan Cloud Run dengan GPU yang diaktifkan dapat diperkecil skalanya hingga nol untuk menghemat biaya saat tidak digunakan.
Ekosistem terintegrasi: Terhubung dengan lancar ke layanan lain, seperti Vertex AI, BigQuery, Cloud SQL, Memorystore, Pub/Sub, AlloyDB untuk PostgreSQL, Cloud CDN, Secret Manager, dan domain kustom untuk membangun pipeline AI end-to-end yang komprehensif. Google Cloud Google Cloud Observability juga menyediakan alat pemantauan dan logging bawaan untuk memahami performa aplikasi dan memecahkan masalah secara efektif.
- Siap digunakan perusahaan: Cloud Run menawarkan konektivitas VPC langsung, keamanan terperinci, dan kontrol jaringan.
Kasus penggunaan AI utama
Berikut beberapa cara Anda dapat menggunakan Cloud Run untuk mendukung aplikasi AI Anda:
Menghosting agen dan bot AI
Cloud Run adalah platform yang ideal untuk menghosting logika backend untuk agen AI, chatbot, dan asisten virtual. Agen ini dapat mengatur panggilan ke model AI seperti Gemini di Vertex AI, mengelola status, dan berintegrasi dengan berbagai alat dan API.
- Microservice untuk agen: Deploy kemampuan agen individual sebagai layanan atau instance Cloud Run terpisah. Lihat Menghosting agen AI untuk mempelajari lebih lanjut.
- Komunikasi Agent2Agent (A2A): Buat sistem agen kolaboratif menggunakan A2A protocol. Lihat Menghosting agen A2A untuk mempelajari lebih lanjut.
- Server Model Context Protocol (MCP): Terapkan server MCP untuk memberikan konteks standar ke LLM dari alat dan sumber data Anda. Lihat Menghosting server MCP untuk mempelajari lebih lanjut.
Menyajikan model AI/ML untuk inferensi
Deploy model machine learning terlatih Anda sebagai endpoint HTTP yang dapat diskalakan.
- Inferensi real-time: Sajikan prediksi dari model yang dibuat dengan framework seperti TensorFlow, PyTorch, scikit-learn, atau menggunakan model terbuka seperti Gemma. Lihat Menjalankan Gemma 3 di Cloud Run untuk contohnya.
- Akselerasi GPU: Gunakan GPU NVIDIA untuk mempercepat inferensi untuk model yang lebih menuntut. Lihat Mengonfigurasi GPU untuk layanan untuk mempelajari lebih lanjut.
- Berintegrasi dengan Vertex AI: Sajikan model yang dilatih atau di-deploy di Vertex AI, menggunakan Cloud Run sebagai frontend yang dapat diskalakan.
- Pisahkan file model besar dari container Anda: Adaptor Cloud Storage FUSE memungkinkan Anda memasang bucket Cloud Storage, dan membuatnya dapat diakses sebagai direktori lokal di dalam container Cloud Run Anda.
Membangun sistem Retrieval-Augmented Generation (RAG)
Buat aplikasi RAG dengan menghubungkan layanan atau instance Cloud Run ke sumber data Anda.
- Database vektor: Hubungkan ke database vektor yang dihosting di
Cloud SQL (dengan
pgvector), AlloyDB untuk PostgreSQL, Memorystore for Redis, atau penyimpanan vektor khusus lainnya untuk mengambil konteks yang relevan untuk LLM Anda. Lihat contoh infrastruktur penggunaan Cloud Run untuk menghosting aplikasi AI generatif berkemampuan RAG dan pemrosesan data menggunakan Vertex AI dan Penelusuran Vektor. - Akses data: Ambil data dari Cloud Storage, BigQuery, Firestore, atau API lainnya untuk memperkaya perintah.
Menghosting backend dan API yang didukung AI
Buat API dan microservice yang menyematkan kemampuan AI.
- API cerdas: Kembangkan API yang menggunakan LLM untuk natural language understanding, analisis sentimen, terjemahan, ringkasan, dan sebagainya.
- Alur kerja otomatis: Buat layanan yang memicu tindakan berbasis AI berdasarkan peristiwa atau permintaan.
Membuat prototipe dan bereksperimen dengan ide
Ulangi ide AI dengan cepat.
- Deployment cepat: Pindahkan prototipe dengan cepat dari lingkungan seperti Vertex AI Studio, Google AI Studio, atau notebook Jupyter ke deployment yang dapat diskalakan di Cloud Run dengan konfigurasi minimal.
- Pembagian traffic: Gunakan fitur pembagian traffic Cloud Run untuk melakukan pengujian A/B pada berbagai model, perintah, atau konfigurasi, dan Google Cloud Observability untuk memantau metrik (latensi, rasio error, biaya) guna mengukur keberhasilan pengujian A/B.
Langkah berikutnya
Bergantung pada pemahaman Anda tentang konsep AI dan kasus penggunaan AI Anda, jelajahi resource AI Cloud Run.