Dokumen ini memberikan arsitektur tingkat tinggi untuk sistem AI multi-agen dua arah yang live, di Google Cloud. Sistem ini membantu pengguna menyelesaikan tugas teknis, seperti merakit komponen yang rumit, mendiagnosis kerusakan peralatan, atau menavigasi prosedur perbaikan yang kompleks. Sistem AI agentic memberikan panduan teknis yang mendasar dan pemantauan keamanan otomatis melalui aliran data multimodal dua arah yang berkelanjutan.
Audiens yang dituju untuk dokumen ini mencakup arsitek, developer, dan administrator yang membangun dan mengelola infrastruktur dan aplikasi AI di cloud. Dokumen ini mengasumsikan bahwa Anda memiliki pemahaman dasar tentang agen dan model AI. Dokumen ini tidak memberikan panduan khusus untuk mendesain dan membuat kode agen AI.
Bagian deployment dokumen ini mencantumkan contoh kode yang dapat Anda gunakan untuk mempelajari cara membangun dan men-deploy sistem AI multi-agen.
Arsitektur
Diagram berikut menunjukkan tampilan tingkat tinggi arsitektur yang menggunakan sistem AI multi-agen untuk mengaktifkan streaming data multimodal dua arah yang live:
Arsitektur dalam diagram sebelumnya memiliki dua alur kerja: panduan teknis dan pemantauan keamanan.
- Alur kerja panduan teknis memungkinkan pengguna menerima solusi yang dinarasikan secara real-time untuk pertanyaan teknis yang kompleks. Alur kerja ini menggunakan model Gemini Live untuk memproses streaming multimodal dan berkoordinasi dengan subagen untuk mengambil informasi produk yang mendasar dari database pengetahuan.
- Alur kerja pemantauan keamanan menyediakan deteksi bahaya otomatis untuk memastikan keamanan pengguna selama prosedur teknis. Alur kerja ini menggunakan Gemini untuk menganalisis segmen video live, mengidentifikasi potensi risiko, dan memicu peringatan langsung melalui dasbor klien.
Tab berikut menyediakan diagram arsitektur yang menunjukkan alur kerja panduan teknis dan pemantauan keamanan:
Alur kerja panduan teknis
Diagram berikut menunjukkan arsitektur mendetail untuk alur kerja panduan teknis.
Diagram sebelumnya menunjukkan aliran data berikut:
-
Pengguna memulai sesi dengan mengajukan pertanyaan teknis lisan melalui dasbor klien. Misalnya, teknisi dapat mengarahkan kamera ke panel kontrol dan bertanya, "Tolong, apa arti lampu error merah yang berkedip ini?"
-
Dasbor klien membuat koneksi WebSocket persisten antara frontend dan server backend.
-
Pesan WebSocket mengemas data multimedia mentah ke dalam objek
Blob. Komponen Agent Development Kit (ADK)LiveRequestQueueterus melakukan streaming data input ke agen dispatcher. -
Agen dispatcher mendeteksi perintah audio atau visual yang memerlukan panduan teknis dan mengirimkan streaming input ke model Gemini Live.
-
Model Gemini Live menelusuri data mentah untuk mengidentifikasi peristiwa. Peristiwa adalah kata kunci audio, seperti "assemble" atau "help", atau isyarat visual, seperti gestur tangan.
Gemini mengevaluasi setiap peristiwa untuk menentukan apakah peristiwa tersebut relevan dengan pertanyaan pengguna. Misalnya, gestur tangan atau kata pengisi mungkin tidak relevan, sehingga Gemini tidak memproses peristiwa tersebut.
-
Untuk setiap peristiwa yang relevan, Gemini mengaktifkan panggilan fungsi untuk mengevaluasi apakah peristiwa tersebut memerlukan konteks tambahan. Bergantung pada apakah konteks tambahan diperlukan, Gemini atau agen arsitek akan mengirimkan respons kembali ke agen dispatcher.
-
Jika memerlukan lebih banyak konteks, Gemini akan mencari kartu agen arsitek agent card untuk memahami cara menyusun permintaannya.
-
Gemini mengirimkan permintaan terstruktur ke agen dispatcher. Permintaan tersebut berisi detail peristiwa, seperti jenis produk, nomor model, jenis peristiwa, dan atribut.
-
Agen dispatcher menggunakan protokol Agent2Agent (A2A) untuk mengirimkan permintaan terstruktur ke agen arsitek.
-
Agen arsitek mengirimkan kueri melalui konektor Akses VPC Serverless . Konektor ini memungkinkan agen mengakses resource secara aman di jaringan Virtual Private Cloud (VPC) yang digunakan untuk resource penyimpanan dalam arsitektur ini.
-
Konektor Akses VPC Serverless berinteraksi dengan data yang di-cache yang disimpan di Memorystore for Redis Cluster. Jika data tidak tersedia di lapisan yang di-cache, agen arsitek akan berinteraksi dengan instance Compute Engine yang menghosting database pengetahuan.
-
Agen arsitek menerima informasi produk dari cache data atau database pengetahuan. Agen arsitek mengirimkan informasi produk ke Gemini untuk membuat respons. Misalnya, "Kode error 3B: Kipas tidak berfungsi. Tindakan yang disarankan: Periksa apakah ada penghalang.
Agen arsitek mengirimkan informasi produk kembali ke agen dispatcher.
Jika tidak memerlukan lebih banyak konteks, Gemini akan membuat respons langsung terhadap permintaan pengguna.
-
-
Agen dispatcher menerima respons dari Gemini atau dari agen arsitektur, dan membuat respons multimodal:
-
Menggunakan model Gemini Live dan fungsi
run_liveuntuk membuat respons multimodal yang berisi solusi teknis. -
Menyimpan respons sebagai objek
Blob. -
Mengirimkan solusi teknis melalui buffer streaming dan koneksi WebSocket persisten untuk memberikan solusi teknis ke dasbor klien.
-
-
Dasbor klien mengekstrak data
Blobdari solusi teknis untuk memberikan panduan yang dinarasikan secara langsung dan memperbarui UI dengan transkripsi yang relevan. Loop permintaan selesai saat streaming dua arah aktif dipertahankan.
Alur kerja pemantauan keamanan
Diagram berikut menunjukkan arsitektur mendetail untuk alur kerja pemantauan keamanan.
Diagram sebelumnya menunjukkan aliran data berikut:
- Dasbor klien membuat koneksi
WebSocket persisten
antara frontend dan server backend untuk mengamati streaming video
live. Pesan WebSocket mengemas data multimedia mentah ini ke dalam
Blobobjek, dan mengirimkannya secara terus-menerus ke buffer streaming menggunakan komponenLiveRequestQueueADK. - Buffer streaming mengarahkan streaming input ke a streaming tool yang berjalan dalam loop latar belakang berkelanjutan untuk mendeteksi bahaya dalam the frame video.
- Alat streaming mengirimkan frame video terbaru dari buffer streaming ke Gemini.
- Gemini mengamati frame video
untuk mencari bahaya, seperti cahaya terang atau uap.
- Jika tidak ada bahaya yang terdeteksi, tidak ada yang terjadi.
- Jika bahaya terdeteksi,
Gemini akan membuat respons multimodal yang berisi jenis bahaya, atribut, serta
lokasi dan menyimpannya sebagai objek
Blob. Gemini mengirimkan respons peringatan bahaya kembali ke alat streaming.
- Alat streaming meneruskan respons peringatan bahaya ke streaming buffer.
- Buffer streaming menggunakan koneksi WebSocket persisten untuk memberikan solusi teknis ke dasbor klien.
- Dasbor klien mengekstrak data
Blobdari solusi teknis untuk memberikan panduan yang dinarasikan secara langsung dan memperbarui UI dengan transkripsi yang relevan. Tindakan ini menyelesaikan loop permintaan sekaligus mempertahankan streaming dua arah yang aktif.
Produk yang digunakan
Arsitektur referensi ini menggunakan produk dan alat berikut: Google Cloud
- Cloud Run: Platform komputasi serverless yang dapat Anda gunakan untuk menjalankan container langsung pada infrastruktur Google yang bersifat skalabel.
- Gemini: Serangkaian model AI multimodal yang dikembangkan oleh Google.
- Gemini Enterprise Agent Platform: Platform komprehensif yang memungkinkan Anda membangun, menskalakan, mengatur, dan mengoptimalkan agen AI tingkat perusahaan.
- Agent Development Kit (ADK): Serangkaian alat dan library untuk mengembangkan, menguji, dan men-deploy agen AI.
- Protokol Agent2Agent (A2A): Protokol terbuka yang memungkinkan komunikasi dan interoperabilitas antar-agen, terlepas dari bahasa pemrograman dan runtime-nya.
- Akses VPC Serverless: Layanan yang memungkinkan lingkungan serverless Anda terhubung ke resource di jaringan Virtual Private Cloud.
- Virtual Private Cloud (VPC): Sistem virtual yang menyediakan fungsionalitas jaringan global dan skalabel untuk workload Anda Google Cloud . VPC mencakup Peering Jaringan VPC, Private Service Connect, akses layanan pribadi, dan VPC Bersama.
- Cluster Memorystore untuk Redis: Layanan penyimpanan data dalam memori yang terkelola sepenuhnya untuk Redis.
- Compute Engine: Layanan komputasi yang aman dan dapat disesuaikan yang memungkinkan Anda membuat dan menjalankan VM di infrastruktur Google.
Untuk mengetahui informasi tentang memilih komponen alternatif untuk sistem AI agentic Anda, termasuk framework, runtime agen, alat, memori, dan pola desain, lihat Memilih komponen arsitektur AI agentic.
Kasus penggunaan
Arsitektur referensi ini dirancang untuk kasus penggunaan yang memerlukan sintesis real-time dari streaming data multimodal dua arah yang berkelanjutan. Berikut adalah contoh kasus penggunaan untuk arsitektur yang dijelaskan dalam dokumen ini:
- Manufaktur industri dan pemeliharaan lapangan: Memungkinkan perbaikan handsfree mesin yang kompleks dengan menyediakan asisten AI kepada teknisi yang memproses audio dan video live dari kacamata pintar. Teknisi berkomunikasi dengan asisten AI untuk mengambil skema mesin. Asisten AI menggunakan agen database internal yang mengakses dokumentasi produk untuk memastikan petunjuk perbaikan dan perakitan yang mendasar. Alat visi latar belakang serentak memantau streaming dua arah untuk secara proaktif memperingatkan teknisi tentang bahaya mekanis atau langkah perakitan yang salah.
- Dukungan teknis jarak jauh: Meningkatkan hasil pemecahan masalah pelanggan dengan mengizinkan pengguna membagikan feed kamera ponsel live dengan sistem AI agentic multimodal. Arsitektur streaming dua arah mendukung percakapan dinamis tempat sistem mengamati hardware secara real time. Jika proses visi latar belakang mengidentifikasi koneksi yang salah, seperti kabel di port yang salah, sistem akan menggunakan streaming latensi rendah untuk segera mengganggu pengguna dengan panduan korektif.
Pertimbangan desain
Bagian berikut memberikan rekomendasi umum untuk mendesain agen AI dan menerapkan arsitektur ini untuk produksi.
Desain agen AI
Untuk meningkatkan biaya dan performa agen Anda, pertimbangkan rekomendasi berikut:
- Skrip loop kontrol: Tulis perintah sistem untuk agen live dua arah sebagai loop perilaku mesin status yang ketat, bukan hanya panduan kepribadian. Perintah sistem harus secara eksplisit memerintahkan agen untuk tetap diam hingga dipicu. Perintah ini harus menerapkan respons singkat yang berorientasi pada tindakan sehingga interaksi suara menjadi ringkas dan alami.
- Pemisahan masalah: Gunakan alat streaming latar belakang khusus untuk memantau feed video secara independen dari agen utama. Agen root dalam arsitektur bersifat dua arah dan dapat langsung mengganggu ucapannya sendiri untuk menyiarkan peringatan keselamatan penting ini kepada pengguna. Selain itu, jika Anda meminta satu agen untuk terus memantau feed video, hal ini dapat menyebabkan kelebihan beban kognitif dan halusinasi.
- Perintah yang hemat biaya: Panjang perintah (input) dan respons yang dihasilkan (output) secara langsung memengaruhi performa dan biaya. Tulis perintah yang singkat, langsung, dan memberikan konteks yang memadai. Desain perintah Anda untuk mendapatkan respons yang ringkas dari model. Misalnya, sertakan frasa seperti "summarize in 2 sentences" atau "list 3 key points". Untuk mengetahui informasi selengkapnya, lihat praktik terbaik untuk desain perintah.
Desain produksi
Untuk menerapkan arsitektur ini untuk produksi, pertimbangkan rekomendasi berikut:
- Keamanan ingress: Untuk mengontrol akses ke aplikasi,
nonaktifkan URL
run.appdefault layanan Cloud Run frontend dan siapkan Load Balancer Aplikasi eksternal regional. Selain menyeimbangkan beban traffic masuk ke aplikasi, load balancer juga menangani pengelolaan sertifikat SSL. Untuk perlindungan tambahan, Anda dapat menggunakan kebijakan keamanan Google Cloud Armor untuk menyediakan pemfilteran permintaan, perlindungan DDoS, dan pembatasan frekuensi untuk layanan tersebut. - Kontrol akses: Saat mengonfigurasi izin untuk resource dalam topologi Anda, ikuti prinsip hak istimewa terendah.
- Buffering asinkron: Untuk memisahkan paket audio dan video masuk dari mesin inferensi model, gunakan buffer First-In-First-Out (FIFO) asinkron yang aman untuk thread. Buffer ini bertindak sebagai multiplexer yang memastikan sistem tetap responsif terhadap gangguan pengguna tanpa membekukan antarmuka pengguna selama komputasi berat.
- Biaya penyerapan data: Untuk mengurangi biaya token dan mencegah kehabisan jendela konteks, gunakan pengambilan sampel frame frekuensi rendah, seperti 2 frame per detik, dan kompres semua data ke file JPEG Base64.
- Caching dalam memori: Untuk mencapai kecepatan baca sub-milidetik, gunakan database Memorystore for Redis Cluster dalam memori untuk brankas skema agen arsitek. Implementasi ini meminimalkan latensi, mencegah jeda selama interaksi suara real-time, dan menyediakan satu sumber tepercaya yang skalabel.
- Keamanan WebSocket: Lindungi data multimodal sensitif, seperti cetakan suara dan video, dengan menerapkan enkripsi TLS untuk semua koneksi WebSocket dua arah.
- Komunikasi A2A yang aman:
- Gunakan kartu agen diperpanjang yang diautentikasi untuk mengamankan komunikasi A2A.
- Lampirkan token identitas OpenID Connect (OIDC) ke permintaan. Token identitas OIDC memungkinkan Anda menggunakan Pengelolaan Akses dan Identitas (IAM) untuk memvalidasi bahwa hanya agen yang diotorisasi yang dapat mengakses data.
- Alokasi resource: Bergantung pada persyaratan performa Anda, konfigurasikan batas memori dan batas CPU yang akan dialokasikan ke layanan Cloud Run.
Untuk mengetahui informasi selengkapnya tentang faktor desain, praktik terbaik, dan rekomendasi untuk membangun dan men-deploy sistem AI multi-agen, lihat Sistem AI multi-agen di Google Cloud.
Deployment
Untuk men-deploy contoh implementasi arsitektur ini, coba Codelab berikut:
- Codelab membangun agen streaming dua arah ADK: Membangun sistem AI satu agen yang memproses streaming video live untuk mengenali gestur pengguna tertentu.
- Codelab sistem multi-agen dua arah yang live: Membangun sistem AI multi-agen yang menggunakan streaming dua arah untuk interaksi suara dan video real-time. Sistem ini mencakup alat streaming proaktif untuk pemantauan keamanan berkelanjutan.
Langkah berikutnya
- Pelajari cara memulai dan mengelola sesi live.
- Pelajari pengantar ADK Gemini Live API Toolkit.
- Pelajari cara menghosting agen AI di Cloud Run.
- Pelajari cara memilih komponen arsitektur AI agentic.
- Pelajari resource pembelajaran untuk membangun dan men-deploy agen tingkat perusahaan dengan Gemini Enterprise Agent Ready (GEAR).
- Pelajari panduan arsitektur AI agentic lainnya.
- Untuk mengetahui ringkasan prinsip dan rekomendasi arsitektur yang khusus untuk workload AI dan ML di Google Cloud, lihat perspektif AI dan ML di Well-Architected Framework.
- Untuk mengetahui lebih banyak tentang arsitektur referensi, diagram, dan praktik terbaik lainnya, jelajahi Pusat Arsitektur Cloud.
Kontributor
Penulis:
- Christina Lin | Pengelola Engineer Hubungan Developer
- Samantha He | Technical Writer
Kontributor lainnya:
- Kumar Dhanagopal | Developer Solusi Lintas Produk
- Olivier Bourgeois | Engineer Hubungan Developer