本節說明生成式 AI 擴充單元 (GSU) 和消耗率的概念。佈建輸送量的計算和定價方式,是採用生成式 AI 擴充單元 (GSU) 和消耗率。
GSU 和消耗率
生成式 AI 擴充單元 (GSU) 是用來衡量提示和回覆處理量的單位。這個金額指定要為模型佈建多少輸送量。
消耗率是一種比率,可將輸入和輸出單位 (例如權杖、字元或圖片) 分別轉換為每秒輸入權杖數、每秒輸入字元數或每秒輸入圖片數。這個比率代表處理量,用於產生各模型的標準單位。
不同模型使用的輸送量不同。如要瞭解各機型的最低 GSU 購買金額和增量,請參閱本文的「支援的機型和消耗率」一節。
這個方程式說明瞭處理量的計算方式:
inputs_per_query = inputs_across_modalities_converted_using_burndown_rates
outputs_per_query = outputs_across_modalities_converted_using_burndown_rates
throughput_per_second = (inputs_per_query + outputs_per_query) * queries_per_second
計算出的每秒處理量會決定您需要多少 GSU,才能滿足用途需求。
重要注意事項
為協助您規劃佈建輸送量需求,請詳閱下列重要事項:
要求會優先處理。
系統會優先處理佈建輸送量客戶的要求,再處理隨選要求。
處理量不會累積。
未使用的處理量不會累計或延至下個月。
佈建輸送量是以每秒權杖數、每秒字元數或每秒圖片數為單位。
已佈建的處理量並非僅根據每分鐘查詢次數 (QPM) 測量,這項指標的計算依據為應用情況的查詢大小、回應大小和 QPM。
佈建輸送量專屬於特定專案、地區、模型和版本。
佈建輸送量會指派給特定專案/地區/模型/版本組合。從不同區域呼叫的相同模型不會計入佈建輸送量配額,也不會優先於隨選要求。
脈絡快取
佈建輸送量支援隱含快取和明確快取。如要瞭解支援的模型和限制,請參閱「內容快取」。
根據預設,所有 Google Cloud 專案都會啟用隱含快取。隱含快取可減少快取命中時的費用和延遲時間。快取命中時,系統會以折扣價收取快取權杖費用,相較於標準輸入權杖更划算。明確快取可提供更多控制選項,並確保在參照明確快取時享有折扣。如要瞭解如何建立脈絡快取以進行明確快取,請參閱「建立脈絡快取」。如要查看特定模型的折扣,請參閱「情境快取總覽」。對於佈建輸送量,系統會透過降低消耗率來套用折扣。
舉例來說,Gemini 2.5 Pro 的輸入文字權杖和快取權杖的消耗率如下:
1 個輸入文字權杖 = 1 個權杖
1 個輸入快取文字權杖 = 0.1 個權杖
如果傳送 1,000 個輸入權杖給這個模型,每秒的佈建輸送量就會減少 1,000 個輸入權杖。不過,如果您將 1,000 個快取詞元傳送至 Gemini 2.5 Pro,每秒的佈建輸送量就會減少 100 個詞元。
請注意,如果權杖未快取且未套用快取折扣,這可能會導致類似查詢的輸送量提高。
如要查看佈建輸送量支援的模型的消耗率,請參閱「支援的模型和消耗率」。
瞭解 Gemini Live API 的淘汰時間
佈建輸送量支援 Gemini 2.5 Flash 和 Gemini Live API。如要瞭解如何在使用 Gemini Live API 時計算消耗量,請參閱「計算 Gemini Live API 的輸送量」。
如要進一步瞭解如何搭配 Gemini Live API 使用 Gemini 2.5 Flash 的預先佈建輸送量,請參閱「Gemini Live API 的預先佈建輸送量」。
預估佈建輸送量需求的範例
如要估算佈建輸送量需求,請使用 Google Cloud 控制台中的估算工具。以下範例說明如何預估模型的佈建輸送量。預估計算時不會考量區域。
下表提供 Gemini 3.6 Flash 的消耗率,可用於追蹤範例。
| 型號 | 每 GSU 的總處理量 | 單位 | 最低 GSU 購買增量 | 燃盡率 |
|---|---|---|---|---|
| Gemini 3.6 Flash | 675 | 權杖 | 1 |
1 個輸入文字權杖 = 1 個權杖 1 個輸入圖片權杖 = 1 個權杖 1 個輸入影片權杖 = 1 個權杖 1 個輸入音訊權杖 = 1 個權杖 1 個輸入文字快取權杖 = 0.1 個權杖 1 個輸入圖片快取權杖 = 0.1 個權杖 1 個輸入影片快取權杖 = 0.1 個權杖 1 個輸入音訊快取權杖 = 0.1 個權杖 1 個輸出文字回應權杖 = 5 個權杖 |
收集需求。在本例中,您的需求是驗證您是否能支援每秒 10 次查詢 (QPS),且查詢的輸入內容為 1,000 個文字權杖和 500 個音訊權杖,並使用
gemini-3.6-flash接收 300 個文字回應權杖的輸出內容。如要計算特定用途的處理量,請使用所選模型的消耗率。
計算處理量。將輸入內容乘以消耗率,即可得出輸入權杖總數:
$\text{1,000} \times (\text{每個輸入文字權杖 1 個權杖}) + \text{500} \times (\text{每個輸入音訊權杖 1 個權杖}) = \text{1,500}$ 消耗量 各查詢的調整後輸入權杖數。
將輸出內容乘以消耗率,即可得出總輸出權杖數:
$\text{300} \times (\text{每個輸出文字回覆詞元 5 個詞元}) = \text{1,500}$ 個查詢的輸出詞元數 (已調整)。
加總所有費用:
$\text{1,500 個用盡的調整後輸入權杖} + \text{1,500 個用盡的調整後輸出權杖} = \text{3,000}$ 個權杖 (每項查詢)。
將權杖總數乘以 QPS,即可得出每秒的總處理量:
$\text{3,000 total tokens per query} \times \text{10 QPS} = \text{30,000}$ total tokens per second.
計算所需 GSU。GSU 是每秒的總權杖數,除以耗盡表中的每個 GSU 每秒處理量:
$\text{30,000 個代幣/秒} \div \text{675 個代幣/秒/GSU} = \text{44.44}$ 個 GSU。
gemini-3.6-flash的最低 GSU 購買增量為 1,因此您需要 45 個 GSU 才能確保工作負載。