無論是建構代理程式、執行推論模型,還是整合各種 AI 服務,Cloud Run 都能提供擴充性、彈性和易用性,協助您將 AI 創新技術付諸實現。
本頁面將著重說明在 Cloud Run 上代管、建構及部署 AI 工作負載的一些高階用途。
為何要使用 Cloud Run 處理 AI 工作負載?
Cloud Run 提供多項優勢,可確保 AI 應用程式具備可擴充性、彈性和可管理性。以下列舉幾項重點功能:
- 彈性的容器支援:將應用程式及其依附元件封裝在容器中,或使用任何支援的語言、程式庫或架構。進一步瞭解 Cloud Run 的容器執行階段合約。
- HTTP 端點:部署 Cloud Run 服務或執行個體後,即可取得立即可用的安全 Cloud Run 網址端點。Cloud Run 支援 HTTP 分塊傳輸編碼、HTTP/2 和 WebSocket,因此可提供串流功能。
- 自動或手動調度資源:對於 Cloud Run 服務,Cloud Run 會根據需求自動調度服務資源。這樣一來,您只需依實際用量付費,非常適合處理難以預測的 AI 工作負載。您也可以根據流量和 CPU 使用率需求,將服務設為手動調度。Cloud Run 執行個體不適用於自動調度資源,因為這些執行個體會以單例模式執行,且必須手動啟動及停止。
GPU 支援:設定含 GPU 的 Cloud Run 資源,加快 AI 模型運作速度。啟用 GPU 的 Cloud Run 服務在未使用時,可將資源調度率降至零,進而節省成本。
整合式生態系統:順暢連線至其他服務 Google Cloud ,例如 Vertex AI、BigQuery、Cloud SQL、Memorystore、Pub/Sub、AlloyDB for PostgreSQL、Cloud CDN、Secret Manager 和自訂網域,建構完整的端對端 AI 管道。Google Cloud Observability 也提供內建的監控和記錄工具,可協助您瞭解應用程式效能,並有效排解問題。
- 企業適用:Cloud Run 提供直接 VPC 連線、精細的安全性和網路控制項。
主要 AI 用途
以下是幾種使用 Cloud Run 支援 AI 應用程式的方式:
託管 AI 代理和機器人
Cloud Run 是託管 AI 代理程式、聊天機器人和虛擬助理後端邏輯的理想平台。這些代理程式可以協調對 Vertex AI 上 Gemini 等 AI 模型的呼叫、管理狀態,以及整合各種工具和 API。
- 代理程式微服務:將個別代理程式功能部署為獨立的 Cloud Run 服務或執行個體。詳情請參閱「主機 AI 代理」。
- Agent2Agent (A2A) 通訊:使用 A2A 通訊協定建構協作式代理系統。詳情請參閱「代管 A2A 代理程式」。
- Model Context Protocol (MCP) 伺服器:導入 MCP 伺服器,從工具和資料來源為 LLM 提供標準化脈絡。詳情請參閱「代管 MCP 伺服器」。
保護 AI 代理
Cloud Run 與 Agent Platform 整合,提供 AI 代理、MCP 伺服器和工具的內建功能。
- 代理身分:將系統管理的代理身分憑證指派給 Cloud Run 工作負載,以便向Google Cloud API、其他代理和 MCP 伺服器進行驗證,不必使用靜態金鑰。請參閱「驗證服務專員」。
- Agent Registry:在貴機構的Agent Registry中自動登錄代理程式和工具,安全地連結至其他開發人員和代理程式。請參閱「為 Cloud Run 設定 Agent Platform 功能」。
- MCP 伺服器和工具:使用 Identity-Aware Proxy 驗證和精細的存取權控管,保護部署在 Cloud Run 上的 MCP 伺服器。請參閱「驗證 MCP 伺服器」。
提供 AI/機器學習模型以進行推論
將訓練好的機器學習模型部署為可擴充的 HTTP 端點。
- 即時推論:根據使用 TensorFlow、PyTorch、scikit-learn 等架構建構的模型,或 Gemma 等開放式模型提供預測。 如需範例,請參閱「在 Cloud Run 上執行 Gemma 3」。
- GPU 加速:使用 NVIDIA GPU 加速推論,處理更複雜的模型。詳情請參閱「為服務設定 GPU」。
- 整合 Vertex AI:使用 Cloud Run 做為可擴充的前端,提供在 Vertex AI 上訓練或部署的模型。
- 將大型模型檔案與容器分離:Cloud Storage FUSE 轉接器可讓您掛接 Cloud Storage bucket,並在 Cloud Run 容器中以本機目錄的形式存取。
建構檢索增強生成 (RAG) 系統
將 Cloud Run 服務或執行個體連結至資料來源,即可建構 RAG 應用程式。
- 向量資料庫:連線至 Cloud SQL (含
pgvector)、AlloyDB for PostgreSQL、Memorystore for Redis 或其他專用向量儲存空間上代管的向量資料庫,為 LLM 擷取相關內容。請參閱基礎架構範例,瞭解如何使用 Cloud Run 代管支援 RAG 的生成式 AI 應用程式,以及如何使用 Vertex AI 和向量搜尋處理資料。 - 資料存取:從 Cloud Storage、BigQuery、Firestore 或其他 API 擷取資料,以豐富提示內容。
代管採用 AI 技術的 API 和後端
建立內嵌 AI 功能的 API 和微服務。
- 智慧型 API:開發使用 LLM 的 API,進行自然語言理解、情緒分析、翻譯、摘要等作業。
- 自動化工作流程:根據事件或要求建構服務,觸發 AI 導向的動作。
設計原型並實驗構想
快速疊代 AI 構想。
- 快速部署:從 Vertex AI Studio、Google AI Studio 或 Jupyter 筆記本等環境,將原型快速移至 Cloud Run,並以最少的設定進行可擴充的部署作業。
- 流量分配:使用 Cloud Run 的流量分配功能,對不同的模型、提示或設定進行 A/B 測試,並透過 Google Cloud Observability 監控延遲時間、錯誤率和費用等指標,評估 A/B 測試的成效。
後續步驟
視您對 AI 概念的熟悉程度和 AI 用途,探索 Cloud Run AI 資源。