Untuk membuat aplikasi AI, sediakan cluster Google Kubernetes Engine (GKE) pribadi yang aman dan dioptimalkan untuk workload AI, lalu deploy workload Anda menggunakan diagram helm. Panduan ini menjelaskan template berikut, yang dapat Anda sesuaikan untuk men-deploy aplikasi AI:
Cluster GKE Inferensi yang telah Dilatih AI: buat infrastruktur dasar yang diperlukan untuk penayangan model berperforma tinggi. Template ini menyiapkan cluster GKE pribadi yang aman dan dioptimalkan untuk inferensi AI.
Workload GKE Inferensi yang telah dilatih AI (Pratinjau): men-deploy diagram helm yang menyertakan konfigurasi untuk workload AI. Gunakan diagram Helm untuk men-deploy model Gemma terlatih menggunakan mesin penayangan vLLM. Workload dikonfigurasi untuk permintaan resource GPU yang efisien dan Horizontal Pod Autoscaler (HPA) untuk menskalakan berdasarkan penggunaan cache GPU.
Misalnya, Anda dapat men-deploy template cluster dan workload untuk memenuhi kebutuhan bisnis berikut:
| Contoh | Kebutuhan bisnis | Penerapan |
|---|---|---|
| Analisis video real-time | Sebuah perusahaan keamanan perlu memproses streaming video dari ratusan kamera untuk mendeteksi anomali atau objek tertentu secara real-time. | Deploy model pemrosesan video di node pool yang mendukung GPU. GPU dapat memproses permintaan throughput tinggi dan latensi rendah dari streaming video serentak. |
| Pemrosesan dokumen khusus | Perusahaan asuransi perlu mengekstrak informasi secara otomatis dari ribuan formulir klaim harian, yang berisi tata letak dan tulisan tangan yang bervariasi. | Gunakan cluster GKE untuk menghosting model kustom, dan pastikan data tidak pernah keluar dari lingkungan yang aman selama pemrosesan. |
| Mesin pemberi saran bervolume tinggi | Platform e-commerce perlu menyajikan rekomendasi produk yang dipersonalisasi kepada pengguna selama acara belanja liburan yang paling ramai. | Gunakan Google Kubernetes Engine Gateway API untuk merutekan volume traffic pengguna yang tinggi ke model rekomendasi. Gateway API dapat menangani lonjakan traffic tiba-tiba tanpa penurunan latensi. |
Arsitektur
Gambar berikut menunjukkan komponen dan koneksi dalam template:
Berikut ini deskripsi konfigurasi komponen dalam template ini:
Cluster GKE Standar: cluster pribadi yang aman tempat workload AI Anda berjalan.
Tabel berikut menjelaskan konfigurasi cluster dalam template ini:
Konfigurasi Tujuan node_locationsdisetel ke["us-central1-a", "us-central1-b", "us-central1-c"].Memastikan ketersediaan tinggi dan ketahanan dengan menyebarkan node cluster di tiga zona di region us-central1.enable_intranode_visibilitydisetel ketrue.Mengaktifkan visibilitas untuk traffic pod-ke-pod di node yang sama dalam Log Aliran VPC. Visibilitas ini diperlukan untuk pemantauan jaringan, pemecahan masalah, dan analisis keamanan. gateway_api_configdiaktifkan menggunakan{"channel":"CHANNEL_STANDARD"}.API GKE Inference Gateway membantu Anda mengelola traffic masuk ke layanan Kubernetes Anda. API ini membantu Anda mengonfigurasi perutean terperinci, load balancing lanjutan, dan lampiran kebijakan terpusat. private_cluster_config.enable_private_endpointdisetel kefalse.private_cluster_config.enable_private_nodesadalahtrue.control_plane_endpoints_config.dns_endpoint_config.allow_external_trafficdisetel ketrue.Memastikan bahwa node pekerja tempat model AI Anda berjalan memiliki alamat IP pribadi. Tindakan ini mengisolasi node Anda dari internet publik. Bidang kontrol GKE dikonfigurasi agar dapat diakses secara publik sehingga Anda dapat mengelola cluster di luar jaringan Virtual Private Cloud (VPC). release_channeldisetel ke{"channel":"REGULAR"}.Memastikan cluster GKE Anda menerima update yang stabil dan dapat diprediksi, sehingga memberikan keseimbangan antara fitur baru dan keandalan. Node pool GKE: sekelompok worker node yang menjalankan container aplikasi.
Tabel berikut menjelaskan konfigurasi kumpulan node dalam template ini:
Konfigurasi Tujuan autoscaling.min_node_countdisetel ke0.autoscaling.max_node_countdisetel ke3(defaultnya adalah100).Node pool dapat diturunkan skalanya sepenuhnya saat tidak ada beban kerja AI yang berjalan, sehingga mengurangi biaya selama periode tidak ada aktivitas. Batas atas untuk penskalaan membantu mengontrol biaya dan konsumsi resource. Parameter node_config.guest_acceleratorditambahkan.gpu_driver_installation_config.gpu_driver_version:disetel ke"LATEST".gpu_sharing_configdiaktifkan denganTIME_SHARING.max_shared_clients_per_gpu:disetel ke2.Menentukan penggunaan GPU NVIDIA L4 untuk tugas inferensi AI. Driver GPU yang diperlukan akan diinstal secara otomatis. Beberapa workload yang lebih kecil dapat berbagi satu GPU. node_config.machine_typediubah menjadi"g2-standard-8".Jenis mesin ini dirancang khusus untuk melengkapi GPU L4. vCPU (8) dan memori (32 GB) dibuat untuk mendukung GPU dan menjalankan aplikasi inferensi AI Anda. node_config.oauth_scopesmencakuphttps://www.googleapis.com/auth/cloud-platform.Akun layanan node memiliki akses luas ke layanan Google Cloud , sehingga memungkinkan interaksi API untuk tugas seperti mencatat log, memantau, dan menarik image container. node_config.shielded_instance_config.enable_secure_bootdisetel ketrue.Booting Aman membantu melindungi node Anda dari malware level booting dengan memverifikasi tanda tangan kriptografi bootloader dan kernel sebelum dieksekusi.
Konfigurasi diagram Helm
Tabel berikut mencantumkan konfigurasi helm chart, yang telah disesuaikan untuk men-deploy dan menskalakan layanan inferensi AI di GKE.
| Konfigurasi | Tujuan |
|---|---|
replicaCount: 1 |
Membuat satu replika awal. |
image.repository: vllm/vllm-openai |
Menggunakan image vLLM, library yang dioptimalkan untuk inferensi Model Bahasa Besar (LLM), yang diekspos menggunakan API yang kompatibel dengan OpenAI. |
model.id: google/gemma-7b-it |
Mendefinisikan model yang di-tune untuk mengikuti petunjuk Gemma 7B sebagai model yang akan disajikan. |
model.hfSecret: hf-secret |
Menunjukkan bahwa model memerlukan autentikasi menggunakan Secret Kubernetes untuk pengelolaan kredensial yang aman. |
resources.limits dan requests untuk nvidia.com/gpu: "1" |
Memastikan bahwa setiap pod mendapatkan GPU khusus. |
nodeSelector.cloud.google.com/gke-accelerator: nvidia-l4 |
Memastikan pod model AI Anda dijadwalkan secara eksklusif di node GKE Standard yang dilengkapi dengan GPU NVIDIA L4, yang ideal untuk inferensi berperforma tinggi dan hemat biaya. |
hpa.enabled: true |
Mengaktifkan Horizontal Pod Autoscaler, yang memungkinkan aplikasi menskalakan jumlah pod secara otomatis (antara minReplicas: 1 dan maxReplicas: 10) berdasarkan targetCPUUtilizationPercentage: 80%. Memastikan performa selama beban puncak dan efisiensi biaya selama penggunaan rendah. |
tensorParallelSize: 1 |
Menunjukkan bahwa model tidak dibagi di beberapa GPU dalam satu pod. |
maxModelLen: 512 |
Mengontrol panjang urutan maksimum yang dapat diproses oleh model Gemma 7B. |
service.type: ClusterIP |
Layanan dikonfigurasi untuk akses internal dalam cluster. |
pdb.enabled: true dan minAvailable: 1 |
Anggaran Disrupsi Pod diaktifkan untuk memastikan ketersediaan tinggi. Setidaknya satu replika model AI Anda tetap tersedia selama gangguan sukarela seperti pemeliharaan node. |
Buat aplikasi AI Anda
Gunakan template AI Pre-trained Inference cluster GKE dan workload untuk men-deploy aplikasi AI Anda.
Men-deploy infrastruktur AI Anda
Konfigurasi dan deploy template cluster GKE Inferensi yang telah Dilatih AI untuk membuat infrastruktur dasar tempat workload AI Anda berjalan.
Duplikasikan dan deploy template cluster GKE Inferensi yang telah Dilatih AI sebagai aplikasi.
Cluster GKE dibuat dalam project deployment yang Anda pilih.
Konfigurasi komponen. Untuk informasi selengkapnya, lihat referensi berikut:
Klik Deploy. Aplikasi akan di-deploy setelah beberapa menit.
Di panel Application details, klik tab Outputs.
Identifikasi cluster_id untuk aplikasi Anda. Anda akan menggunakan informasi ini saat men-deploy diagram helm.
Men-deploy workload AI Anda
Gunakan template workload GKE Inferensi yang Dilatih AI untuk men-deploy workload AI ke cluster yang Anda buat. Anda akan men-deploy helm chart yang mencakup konfigurasi workload AI Anda.
Dari halaman Google catalog, pada template AI Pre-trained Inference GKE workload, klik Create new application.
Di kolom Name, masukkan nama unik untuk aplikasi Anda.
Di area GKE Deployment Target, lakukan hal berikut:
Dari Project list, pilih project tempat Anda men-deploy cluster GKE dari aplikasi AI Pre-trained Inference GKE cluster.
Dari daftar Region, pilih region tempat Anda men-deploy cluster GKE.
Dari daftar Clusters, pilih cluster GKE yang di-deploy.
Dari daftar Namespace, masukkan namespace tempat Anda men-deploy cluster GKE. Jika Anda tidak mengubah nama, masukkan
default.Klik Create application.
Aplikasi dibuat dan file konfigurasi ditampilkan.
Di panel Helm chart, lakukan hal berikut:
Tinjau detail konfigurasi.
Opsional: sesuaikan konfigurasi untuk memenuhi kebutuhan unik Anda.
Untuk men-deploy helm chart ke cluster Anda, klik Deploy.
Untuk mengetahui langkah-langkah mendetail, lihat Men-deploy aplikasi.
Setelah beberapa menit, konfigurasi helm chart akan di-deploy ke cluster GKE Anda.
Langkah berikutnya
- Untuk mempelajari cara menduplikasi dan menyesuaikan template, lihat Panduan memulai: Menyesuaikan dan men-deploy template Google.
- Tentukan konfigurasi Anda sendiri dengan mendesain template aplikasi.
- Identifikasi praktik terbaik arsitektur umum dengan Google Cloud Framework Arsitektur.