存取指標

本文說明如何存取 Gemini Enterprise 應用程式產生的指標。這些指標可提供應用程式效能和健康狀態的深入分析。

您可以透過 Metrics Explorer 查看指標遙測資料,也可以使用代理程式的「可觀測性」分頁,直接在個別代理程式中查看。

基本概念

本節將介紹 Gemini Enterprise 可觀測性的重要概念。

概念 說明
指標 指標是系統在一段時間內收集的數值測量結果。這些指標代表系統的效能、資源用量或行為。工程師會使用指標監控系統健康狀態、找出趨勢及觸發快訊。
以代理程式為範圍的指標 評估個別代理程式活動的指標,例如工作階段、對話輪次和工具叫用次數。這些指標會列在 Gemini Enterprise Agent 資源類型下方,且只有在為該代理啟用「Enable instrumentation of OpenTelemetry traces and logs」(啟用 OpenTelemetry 追蹤記錄和記錄的檢測功能) 觀測設定時,才會收集這些指標。
以應用程式為範圍的指標 這類指標會評估應用程式的所有流量,而非單一代理程式的流量,例如要求數量和端對端延遲時間。這些指標會列在「Gemini Enterprise Engine」資源類型下方,其中「Engine」是 Gemini Enterprise 應用程式的 API 名稱,且無論可觀測性設定為何,系統都會收集這些指標。

事前準備

請確認你已具備以下條件:

  • Gemini Enterprise 管理員角色或 Google Cloud 管理中心 Gemini Enterprise 使用者角色。

  • 現有的 Gemini Enterprise 網頁應用程式。如要瞭解如何建立新應用程式,請參閱建立應用程式。

  • 如要存取 Metrics Explorer,您必須具備「Monitoring 檢視者」角色 (roles/monitoring.viewer)。

  • 啟用「啟用 OpenTelemetry 追蹤記錄和記錄的檢測功能」可觀測性設定。視代理程式類型而定,您可以在應用程式層級設定 (適用於 Core Assistant 代理程式),或在代理程式的「設定」分頁中啟用這項功能 (適用於 Workflow Builder 員工製作的代理程式和 Deep Research 代理程式)。詳情請參閱「管理可觀測性設定」。這項設定是代理程式範圍指標的必要條件。系統會收集應用程式範圍的指標 (列在 Gemini Enterprise Engine 資源類型下方),但不會收集這些指標。

資料保留

Gemini Enterprise 應用程式產生的指標會儲存在 Google Cloud 專案的 Cloud Monitoring 中,保留期限則由 Cloud Monitoring 控管。Gemini Enterprise 指標會發布在 discoveryengine.googleapis.com/ 前置字元下方,屬於「所有其他Google Cloud 指標」層級,預設保留期限為 6 週。系統會自動刪除保留期限前的資料。如要查看最準確的最新保留值,請參閱「Cloud Monitoring 配額和限制」說明文件中的「資料保留」一節。

在 Metrics Explorer 中存取指標

如要存取指標,請按照下列步驟操作:

  1. 前往 Google Cloud 控制台的「Metrics Explorer」頁面。

    前往「Metrics Explorer」。

  2. 選取建立 Gemini Enterprise 應用程式的 Google Cloud 專案。

  3. 按一下「選取指標」開啟搜尋列。

  4. 在搜尋列中,尋找下列指標:

    指標名稱 說明
    Gemini Enterprise 代理 - Gemini Enterprise 代理工作階段計數 Gemini Enterprise Agent 處理的工作階段數。
    Gemini Enterprise 代理 - Gemini Enterprise 代理工具數量 Gemini Enterprise 代理叫用工具的次數。
    Gemini Enterprise 代理 - Gemini Enterprise 代理回合數 Gemini Enterprise Agent 工作階段中的對話次數。
    Gemini Enterprise 代理 - Gemini Enterprise 代理總延遲時間 Gemini Enterprise Agent 回覆的總延遲時間。
    Gemini Enterprise Agent - Gemini Enterprise Agent Tool Total Latency Gemini Enterprise 代理程式中工具執行作業所產生的總延遲時間。
    Gemini Enterprise DataConnector - Gemini Enterprise DataConnector 要求計數 向 Gemini Enterprise 資料連接器 (在 Google Cloud 控制台中也稱為資料儲存庫) 發出的要求總數。
    Gemini Enterprise DataConnector - Gemini Enterprise DataConnector 要求延遲時間 (Beta 版) 對 Gemini Enterprise 資料連結器 (在 Google Cloud 控制台中也稱為資料儲存庫) 提出的要求延遲時間,以毫秒為單位。
    Gemini Enterprise Engine - Gemini Enterprise Engine 要求計數 Gemini Enterprise 應用程式收到的請求總數,包括應用程式的所有流量,而非單一代理程式。依 API 方法、標準 gRPC 回應代碼、回應代碼類別、查詢類型和模型細分。
    Gemini Enterprise Engine - Gemini Enterprise Engine 要求總數 延遲時間 Gemini Enterprise 應用程式的端對端要求延遲時間分布。系統會記錄每項要求,包括傳回錯誤的要求。
    Gemini Enterprise Engine - Gemini Enterprise Engine 首次回覆延遲時間 從收到要求到串流傳回第一個回覆詞元之間的延遲時間分布情形。只有在要求產生至少一個答案權杖時,才會記錄這項資訊。
    Gemini Enterprise Engine - Gemini Enterprise Engine 首次權杖延遲時間 從收到要求到串流傳回第一個權杖 (無論該權杖是模型思考過程的一部分,還是最終答案) 之間的延遲時間分布情形。只有在要求產生至少一個串流權杖時,才會記錄這項指標。
  5. 選取要探索的指標,然後按一下「套用」。

  6. 視需要設定其他標籤篩選器、匯總元素,以及調整時間範圍。

     Google Cloud 控制台的 Metrics Explorer 螢幕截圖,顯示 Gemini Enterprise Agent 指標。

存取代理程式的指標

您也可以在 Google Cloud 控制台的代理程式「可觀測性」分頁中,直接查看個別代理程式的作業、工具專屬和工作階段指標資訊主頁。

如要存取代理程式的指標:

  1. 在 Google Cloud 控制台中,前往您的應用程式,然後按一下「代理程式」。
  2. 選取要檢查的代理程式,然後按一下「可觀測性」分頁標籤。

「可觀測性」分頁提供重要的作業遙測資料,並分為四個檢視畫面:「總覽」、「工具」、「延遲」和「錯誤率」。

總覽指標

這個檢視畫面會顯示資訊主頁,彙整標準工作階段和服務專員健康狀態資料,包括:

  • 工作階段:使用者工作階段總數。
  • 平均單次工作階段時間:單次工作階段的平均時間長度。
  • 代理程式叫用次數:代理程式的總呼叫次數。
  • 代理延遲時間:一段時間內的延遲時間和特定指標。
  • 代理程式流量:傳入要求量。
  • 代理程式錯誤率:代理程式呼叫失敗的百分比。

螢幕截圖: Google Cloud 控制台的「可觀測性」分頁「總覽」檢視畫面,顯示工作階段、每個工作階段的平均輪次、代理程式叫用次數、延遲時間、流量和錯誤率

工具指標

這個檢視畫面專門顯示與代理程式連結的工具使用情況和延遲時間,包括:

  • 通話總數:工具執行要求數。
  • 各工具的 P95 持續時間:依工具分類的第 95 百分位數執行延遲時間。
  • 各工具的呼叫次數:不同工具的呼叫次數總和。
  • 各工具的錯誤率:各工具的執行失敗率。
  • 「未呼叫工具」的比率:互動未觸發任何工具執行的比率。

延遲指標

這個檢視畫面會顯示代理程式的回應延遲時間。每個指標都會顯示所選時間範圍的 p50 和 p95 摘要資訊卡,以及顯示一段時間趨勢的時間序列圖表。您也可以依功能篩選延遲時間指標。 這個檢視畫面會顯示下列指標:

  • 第一個權杖生成時間 (TTFT):從收到要求到串流傳回第一個權杖之間的時間,無論該權杖是模型思考過程的一部分,還是回覆的一部分。
  • 開始回覆所需時間 (TTFA):從收到要求到串流傳回第一個回覆詞元 (即模型思考內容以外的第一個詞元) 經過了多少時間。如果代理程式在開始回答後呼叫工具,系統會重新開始測量,因此 TTFA 反映的是使用者開始閱讀答案的時間,而不是任何中途的旁白。
  • 最後一個權杖生成時間 (TTLT):從收到要求到串流傳送最後一個權杖的延遲時間,也就是回應完成的時間。

依功能篩選延遲指標

「功能」是指輪流對話代表的互動類型,例如網頁搜尋或圖片生成。依功能篩選延遲指標,即可查看哪些互動類型最慢,並避免單一緩慢功能影響整體延遲。

如要依功能篩選延遲指標,請按照下列步驟操作:

  1. 在代理程式的「可觀測性」分頁中,按一下「延遲」檢視畫面。
  2. 按一下「依功能篩選」。
  3. 選取要檢查的特徵。

摘要資訊卡和時間序列圖表隨後只會顯示該功能的輪流次數。

如要一次比較所有功能,請使用「功能遙測」表格,其中列出每個功能的下列資訊:

  • 流量比例:歸因於這項功能的通話百分比。
  • TTFT、TTFA 和 TTLT:這項功能的 p50 和 p95 延遲時間。

你可以使用下列功能進行篩選:

  • 參數式:只要求模型輸出文字,而且不使用工具的互動,例如翻譯工作。
  • 生成媒體:圖像和影片生成工作。
  • 僅限網頁搜尋:透過網頁搜尋工具向模型傳送要求的互動。
  • 分析上傳的檔案:附加了使用者上傳的檔案而向模型傳送要求的互動。
  • 連接器:將要求傳送至內部或第三方連接器的查詢。
  • 畫布:使用畫布的生成工作。
  • 技能:觸發技能的互動。
  • 其他:跨多項功能或尚未分類的回合均歸為這個通用類別。

 Google Cloud 控制台「可觀測性」分頁的「延遲時間」檢視畫面螢幕截圖,顯示功能篩選器、p50 和 p95 摘要資訊卡、第一個權杖時間、第一個答案時間和最後一個權杖時間的時間序列圖表,以及「功能遙測」表格,列出各項功能及其流量比例,以及 p50 和 p95 延遲時間

錯誤率指標

這個檢視畫面會顯示代理程式要求的解決方式,並依回應類別分組:OK (2xx)、用戶端錯誤 (4xx)、伺服器錯誤 (5xx) 和已取消。It includes:

  • 各回應類別的要求量:一段時間內傳入的要求數量,依回應類別堆疊。
  • 各回應類別的錯誤率:一段時間內失敗的要求百分比,依回應類別劃分。
  • 用戶端錯誤代碼 (4xx) 和伺服器錯誤代碼 (5xx):一段時間內個別標準 gRPC 回應代碼,例如 INVALID_ARGUMENT 或 INTERNAL,方便您判斷哪些特定錯誤導致尖峰。
  • 總計:所選時間範圍內,每種結果的要求數量和要求總數百分比,以及個別用戶端和伺服器錯誤代碼的排名表。

螢幕截圖: Google Cloud 控制台的「可觀測性」分頁中顯示錯誤率,並依回應類別顯示要求量和錯誤率、用戶端和伺服器錯誤代碼的時間序列圖表,以及總計表格

後續步驟