Kasus penggunaan AI agentic: Mengaktifkan streaming multimodal dua arah secara live

Last reviewed 2026-04-06 UTC

Dokumen ini memberikan arsitektur tingkat tinggi untuk sistem AI multi-agen dua arah yang live, di Google Cloud. Sistem ini membantu pengguna menyelesaikan tugas teknis, seperti merakit komponen yang rumit, mendiagnosis kerusakan peralatan, atau menavigasi prosedur perbaikan yang kompleks. Sistem AI agentic memberikan panduan teknis yang mendasar dan pemantauan keamanan otomatis melalui aliran data multimodal dua arah yang berkelanjutan.

Audiens yang dituju untuk dokumen ini mencakup arsitek, developer, dan administrator yang membangun dan mengelola infrastruktur dan aplikasi AI di cloud. Dokumen ini mengasumsikan bahwa Anda memiliki pemahaman dasar tentang agen dan model AI. Dokumen ini tidak memberikan panduan khusus untuk mendesain dan membuat kode agen AI.

Bagian deployment dokumen ini mencantumkan contoh kode yang dapat Anda gunakan untuk mempelajari cara membangun dan men-deploy sistem AI multi-agen.

Arsitektur

Diagram berikut menunjukkan tampilan tingkat tinggi arsitektur yang menggunakan sistem AI multi-agen untuk mengaktifkan streaming data multimodal dua arah yang live:

Arsitektur tingkat tinggi dari sistem AI multi-agen yang memungkinkan streaming data multimodal dua arah.

Arsitektur dalam diagram sebelumnya memiliki dua alur kerja: panduan teknis dan pemantauan keamanan.

  • Alur kerja panduan teknis memungkinkan pengguna menerima solusi yang dinarasikan secara real-time untuk pertanyaan teknis yang kompleks. Alur kerja ini menggunakan model Gemini Live untuk memproses streaming multimodal dan berkoordinasi dengan subagen untuk mengambil informasi produk yang mendasar dari database pengetahuan.
  • Alur kerja pemantauan keamanan menyediakan deteksi bahaya otomatis untuk memastikan keamanan pengguna selama prosedur teknis. Alur kerja ini menggunakan Gemini untuk menganalisis segmen video live, mengidentifikasi potensi risiko, dan memicu peringatan langsung melalui dasbor klien.

Tab berikut menyediakan diagram arsitektur yang menunjukkan alur kerja panduan teknis dan pemantauan keamanan:

Alur kerja panduan teknis

Diagram berikut menunjukkan arsitektur mendetail untuk alur kerja panduan teknis.

Arsitektur yang menunjukkan alur kerja panduan teknis.

Diagram sebelumnya menunjukkan aliran data berikut:

  1. Pengguna memulai sesi dengan mengajukan pertanyaan teknis lisan melalui dasbor klien. Misalnya, teknisi dapat mengarahkan kamera ke panel kontrol dan bertanya, "Tolong, apa arti lampu error merah yang berkedip ini?"

  2. Dasbor klien membuat koneksi WebSocket persisten antara frontend dan server backend.

  3. Pesan WebSocket mengemas data multimedia mentah ke dalam objek Blob. Komponen Agent Development Kit (ADK) LiveRequestQueue terus melakukan streaming data input ke agen dispatcher.

  4. Agen dispatcher mendeteksi perintah audio atau visual yang memerlukan panduan teknis dan mengirimkan streaming input ke model Gemini Live.

  5. Model Gemini Live menelusuri data mentah untuk mengidentifikasi peristiwa. Peristiwa adalah kata kunci audio, seperti "assemble" atau "help", atau isyarat visual, seperti gestur tangan.

    Gemini mengevaluasi setiap peristiwa untuk menentukan apakah peristiwa tersebut relevan dengan pertanyaan pengguna. Misalnya, gestur tangan atau kata pengisi mungkin tidak relevan, sehingga Gemini tidak memproses peristiwa tersebut.

  6. Untuk setiap peristiwa yang relevan, Gemini mengaktifkan panggilan fungsi untuk mengevaluasi apakah peristiwa tersebut memerlukan konteks tambahan. Bergantung pada apakah konteks tambahan diperlukan, Gemini atau agen arsitek akan mengirimkan respons kembali ke agen dispatcher.

    1. Jika memerlukan lebih banyak konteks, Gemini akan mencari kartu agen arsitek agent card untuk memahami cara menyusun permintaannya.

    2. Gemini mengirimkan permintaan terstruktur ke agen dispatcher. Permintaan tersebut berisi detail peristiwa, seperti jenis produk, nomor model, jenis peristiwa, dan atribut.

    3. Agen dispatcher menggunakan protokol Agent2Agent (A2A) untuk mengirimkan permintaan terstruktur ke agen arsitek.

    4. Agen arsitek mengirimkan kueri melalui konektor Akses VPC Serverless . Konektor ini memungkinkan agen mengakses resource secara aman di jaringan Virtual Private Cloud (VPC) yang digunakan untuk resource penyimpanan dalam arsitektur ini.

    5. Konektor Akses VPC Serverless berinteraksi dengan data yang di-cache yang disimpan di Memorystore for Redis Cluster. Jika data tidak tersedia di lapisan yang di-cache, agen arsitek akan berinteraksi dengan instance Compute Engine yang menghosting database pengetahuan.

    6. Agen arsitek menerima informasi produk dari cache data atau database pengetahuan. Agen arsitek mengirimkan informasi produk ke Gemini untuk membuat respons. Misalnya, "Kode error 3B: Kipas tidak berfungsi. Tindakan yang disarankan: Periksa apakah ada penghalang.

    7. Agen arsitek mengirimkan informasi produk kembali ke agen dispatcher.

    Jika tidak memerlukan lebih banyak konteks, Gemini akan membuat respons langsung terhadap permintaan pengguna.

  7. Agen dispatcher menerima respons dari Gemini atau dari agen arsitektur, dan membuat respons multimodal:

    1. Menggunakan model Gemini Live dan fungsirun_live untuk membuat respons multimodal yang berisi solusi teknis.

    2. Menyimpan respons sebagai objek Blob.

    3. Mengirimkan solusi teknis melalui buffer streaming dan koneksi WebSocket persisten untuk memberikan solusi teknis ke dasbor klien.

  8. Dasbor klien mengekstrak data Blob dari solusi teknis untuk memberikan panduan yang dinarasikan secara langsung dan memperbarui UI dengan transkripsi yang relevan. Loop permintaan selesai saat streaming dua arah aktif dipertahankan.

Alur kerja pemantauan keamanan

Diagram berikut menunjukkan arsitektur mendetail untuk alur kerja pemantauan keamanan.

Arsitektur yang menunjukkan alur kerja pemantauan keselamatan.

Diagram sebelumnya menunjukkan aliran data berikut:

  1. Dasbor klien membuat koneksi WebSocket persisten antara frontend dan server backend untuk mengamati streaming video live. Pesan WebSocket mengemas data multimedia mentah ini ke dalam Blob objek, dan mengirimkannya secara terus-menerus ke buffer streaming menggunakan komponen LiveRequestQueue ADK.
  2. Buffer streaming mengarahkan streaming input ke a streaming tool yang berjalan dalam loop latar belakang berkelanjutan untuk mendeteksi bahaya dalam the frame video.
  3. Alat streaming mengirimkan frame video terbaru dari buffer streaming ke Gemini.
  4. Gemini mengamati frame video untuk mencari bahaya, seperti cahaya terang atau uap.
    • Jika tidak ada bahaya yang terdeteksi, tidak ada yang terjadi.
    • Jika bahaya terdeteksi, Gemini akan membuat respons multimodal yang berisi jenis bahaya, atribut, serta lokasi dan menyimpannya sebagai objek Blob. Gemini mengirimkan respons peringatan bahaya kembali ke alat streaming.
  5. Alat streaming meneruskan respons peringatan bahaya ke streaming buffer.
  6. Buffer streaming menggunakan koneksi WebSocket persisten untuk memberikan solusi teknis ke dasbor klien.
  7. Dasbor klien mengekstrak data Blob dari solusi teknis untuk memberikan panduan yang dinarasikan secara langsung dan memperbarui UI dengan transkripsi yang relevan. Tindakan ini menyelesaikan loop permintaan sekaligus mempertahankan streaming dua arah yang aktif.

Produk yang digunakan

Arsitektur referensi ini menggunakan produk dan alat berikut: Google Cloud

Untuk mengetahui informasi tentang memilih komponen alternatif untuk sistem AI agentic Anda, termasuk framework, runtime agen, alat, memori, dan pola desain, lihat Memilih komponen arsitektur AI agentic.

Kasus penggunaan

Arsitektur referensi ini dirancang untuk kasus penggunaan yang memerlukan sintesis real-time dari streaming data multimodal dua arah yang berkelanjutan. Berikut adalah contoh kasus penggunaan untuk arsitektur yang dijelaskan dalam dokumen ini:

  • Manufaktur industri dan pemeliharaan lapangan: Memungkinkan perbaikan handsfree mesin yang kompleks dengan menyediakan asisten AI kepada teknisi yang memproses audio dan video live dari kacamata pintar. Teknisi berkomunikasi dengan asisten AI untuk mengambil skema mesin. Asisten AI menggunakan agen database internal yang mengakses dokumentasi produk untuk memastikan petunjuk perbaikan dan perakitan yang mendasar. Alat visi latar belakang serentak memantau streaming dua arah untuk secara proaktif memperingatkan teknisi tentang bahaya mekanis atau langkah perakitan yang salah.
  • Dukungan teknis jarak jauh: Meningkatkan hasil pemecahan masalah pelanggan dengan mengizinkan pengguna membagikan feed kamera ponsel live dengan sistem AI agentic multimodal. Arsitektur streaming dua arah mendukung percakapan dinamis tempat sistem mengamati hardware secara real time. Jika proses visi latar belakang mengidentifikasi koneksi yang salah, seperti kabel di port yang salah, sistem akan menggunakan streaming latensi rendah untuk segera mengganggu pengguna dengan panduan korektif.

Pertimbangan desain

Bagian berikut memberikan rekomendasi umum untuk mendesain agen AI dan menerapkan arsitektur ini untuk produksi.

Desain agen AI

Untuk meningkatkan biaya dan performa agen Anda, pertimbangkan rekomendasi berikut:

  • Skrip loop kontrol: Tulis perintah sistem untuk agen live dua arah sebagai loop perilaku mesin status yang ketat, bukan hanya panduan kepribadian. Perintah sistem harus secara eksplisit memerintahkan agen untuk tetap diam hingga dipicu. Perintah ini harus menerapkan respons singkat yang berorientasi pada tindakan sehingga interaksi suara menjadi ringkas dan alami.
  • Pemisahan masalah: Gunakan alat streaming latar belakang khusus untuk memantau feed video secara independen dari agen utama. Agen root dalam arsitektur bersifat dua arah dan dapat langsung mengganggu ucapannya sendiri untuk menyiarkan peringatan keselamatan penting ini kepada pengguna. Selain itu, jika Anda meminta satu agen untuk terus memantau feed video, hal ini dapat menyebabkan kelebihan beban kognitif dan halusinasi.
  • Perintah yang hemat biaya: Panjang perintah (input) dan respons yang dihasilkan (output) secara langsung memengaruhi performa dan biaya. Tulis perintah yang singkat, langsung, dan memberikan konteks yang memadai. Desain perintah Anda untuk mendapatkan respons yang ringkas dari model. Misalnya, sertakan frasa seperti "summarize in 2 sentences" atau "list 3 key points". Untuk mengetahui informasi selengkapnya, lihat praktik terbaik untuk desain perintah.

Desain produksi

Untuk menerapkan arsitektur ini untuk produksi, pertimbangkan rekomendasi berikut:

  • Keamanan ingress: Untuk mengontrol akses ke aplikasi, nonaktifkan URL run.app default layanan Cloud Run frontend dan siapkan Load Balancer Aplikasi eksternal regional. Selain menyeimbangkan beban traffic masuk ke aplikasi, load balancer juga menangani pengelolaan sertifikat SSL. Untuk perlindungan tambahan, Anda dapat menggunakan kebijakan keamanan Google Cloud Armor untuk menyediakan pemfilteran permintaan, perlindungan DDoS, dan pembatasan frekuensi untuk layanan tersebut.
  • Kontrol akses: Saat mengonfigurasi izin untuk resource dalam topologi Anda, ikuti prinsip hak istimewa terendah.
  • Buffering asinkron: Untuk memisahkan paket audio dan video masuk dari mesin inferensi model, gunakan buffer First-In-First-Out (FIFO) asinkron yang aman untuk thread. Buffer ini bertindak sebagai multiplexer yang memastikan sistem tetap responsif terhadap gangguan pengguna tanpa membekukan antarmuka pengguna selama komputasi berat.
  • Biaya penyerapan data: Untuk mengurangi biaya token dan mencegah kehabisan jendela konteks, gunakan pengambilan sampel frame frekuensi rendah, seperti 2 frame per detik, dan kompres semua data ke file JPEG Base64.
  • Caching dalam memori: Untuk mencapai kecepatan baca sub-milidetik, gunakan database Memorystore for Redis Cluster dalam memori untuk brankas skema agen arsitek. Implementasi ini meminimalkan latensi, mencegah jeda selama interaksi suara real-time, dan menyediakan satu sumber tepercaya yang skalabel.
  • Keamanan WebSocket: Lindungi data multimodal sensitif, seperti cetakan suara dan video, dengan menerapkan enkripsi TLS untuk semua koneksi WebSocket dua arah.
  • Komunikasi A2A yang aman:
  • Alokasi resource: Bergantung pada persyaratan performa Anda, konfigurasikan batas memori dan batas CPU yang akan dialokasikan ke layanan Cloud Run.

Untuk mengetahui informasi selengkapnya tentang faktor desain, praktik terbaik, dan rekomendasi untuk membangun dan men-deploy sistem AI multi-agen, lihat Sistem AI multi-agen di Google Cloud.

Deployment

Untuk men-deploy contoh implementasi arsitektur ini, coba Codelab berikut:

Langkah berikutnya

Kontributor

Penulis:

Kontributor lainnya: