Gemini Enterprise Agent Platform の生成 AI の割り当てとシステム上限

このページでは、リージョンとモデルごとの割り当てのリストを示します。また、 Google Cloud コンソールで割り当てを表示して編集する方法についても説明します。

チューニング済みモデルの割り当て

チューニング済みモデルの推論は、ベースモデルと同じ割り当てを共有します。チューニング済みモデルの推論に個別の割り当てはありません。

埋め込みの上限

gemini-embedding-001 のリクエストはリージョン割り当ての対象となり、gemini-embedding-2 のリクエストはグローバル割り当ての対象となります。
ベースモデル 割り当て 指標
base_model: gemini-embedding 100,000,000 aiplatform.googleapis.com/embed_content_input_tokens_per_minute_per_base_model
base_model: gemini-embedding-2 200,000,000 aiplatform.googleapis.com/global_embed_content_input_tokens_per_minute_per_base_model
base_model: gemini-embedding-2 60,000 aiplatform.googleapis.com/global_embed_content_requests_per_minute_per_base_model

predict API を使用した gemini-embedding-001 のリクエストにも、次の割り当てが適用されます。

ベースモデル 割り当て 指標
base_model: gemini-embedding 100,000 aiplatform.googleapis.com/online_prediction_requests_per_base_model
base_model: なし 30,000 aiplatform.googleapis.com/online_prediction_requests

Agent Runtime の割り当て

各リージョンの特定のプロジェクトの Agent Runtime には、次の割り当てが適用されます。
説明 割り当て 指標
1 分あたりの Agent Runtime リソースの作成、削除、更新回数 10 aiplatform.googleapis.com/reasoning_engine_service_write_requests
1 分あたりの Agent Runtime セッションの作成、削除、更新回数 100 aiplatform.googleapis.com/session_write_requests
1 分あたりの Agent Runtime セッションの取得、一覧表示、取得回数 10000 aiplatform.googleapis.com/session_read_requests
1 分あたりの Agent Runtime のクエリ回数(Query または StreamQuery 90 aiplatform.googleapis.com/reasoning_engine_service_query_requests
1 分あたりの Agent Runtime セッションへのイベントの追加回数 300 aiplatform.googleapis.com/session_event_append_requests
Agent Runtime リソースの最大数 100 aiplatform.googleapis.com/reasoning_engine_service_entities
1 分あたりの Agent Runtime メモリリソースの作成、削除、更新回数 100 aiplatform.googleapis.com/memory_bank_write_requests
1 分あたりの Agent Runtime メモリバンクからの取得、一覧表示、取得回数 300 aiplatform.googleapis.com/memory_bank_read_requests
1 分あたりのサンドボックス環境(Code Execution)の実行リクエスト数 1000 aiplatform.googleapis.com/sandbox_environment_execute_requests
リージョンあたりのサンドボックス環境(Code Execution)のエンティティ数 1000 aiplatform.googleapis.com/sandbox_environment_entities
1 分あたりのサンドボックス環境(Code Execution)の書き込みリクエスト数 500 aiplatform.googleapis.com/sandbox_environment_write_requests
1 分あたりの A2A エージェントの POST リクエスト数(sendMessagecancelTask など) 60 aiplatform.googleapis.com/a2a_agent_post_requests
1 分あたりの A2A エージェントの GET リクエスト数(getTaskgetCard など) 600 aiplatform.googleapis.com/a2a_agent_get_requests
BidiStreamQuery API を使用した 1 分あたりの同時ライブ双方向接続数 10 aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests

マルチモーダル入力の割り当て

各リージョンの特定のプロジェクトの generateContent リクエストと streamGenerateContent リクエストのマルチモーダル入力には、次の割り当てが適用されます。各割り当ては、ベースモデルと解像度ごとに適用されます。グローバル エンドポイントによって処理されるリクエストにも同じ上限が適用されます。この場合、対応する ..._global 指標が使用されます。
説明 割り当て 指標
1 ベースモデル、1 解像度、1 分あたりの画像入力によるコンテンツ生成リクエスト数 34,000,000 aiplatform.googleapis.com/generate_content_image_input_per_base_model_id_and_resolution
1 ベースモデルと解像度あたりの 1 分あたりの動画入力によるコンテンツ生成リクエスト数 192,000,000 aiplatform.googleapis.com/generate_content_video_input_per_base_model_id_and_resolution
1 ベースモデル、1 分、1 解像度あたりの音声入力によるコンテンツ生成リクエスト数 11,000,000 aiplatform.googleapis.com/generate_content_audio_input_per_base_model_id_and_resolution
1 ベースモデル、1 解像度、1 分あたりのドキュメント入力を含むコンテンツ生成リクエスト数 1,200,000 aiplatform.googleapis.com/generate_content_document_input_per_base_model_id_and_resolution

これらの割り当ての上限の引き上げをリクエストするには、Google Cloud アカウント チームにお問い合わせください。 Google Cloud コンソールから上限を引き上げることはできません。

バッチ推論

バッチ推論ジョブの割り当てと上限は、すべてのリージョンで同じです。

Gemini モデルの同時バッチ推論ジョブの上限

Gemini モデルのバッチ推論に事前定義された割り当て上限はありません。バッチサービスは、モデルのリアルタイムの可用性と、そのモデルに対するすべてのお客様の需要に基づいて動的に割り当てられる、大規模な共有リソースプールへのアクセスを提供します。アクティブなユーザーが増え、モデルの容量が飽和状態になると、バッチ リクエストが容量不足のためにキューに登録されることがあります。

Gemini 以外のモデルのバッチ推論ジョブの同時実行数の割り当て

次の表に、同時実行バッチ推論ジョブ数の割り当てを示します。これは Gemini モデルには適用されません。
割り当て
aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs 4
送信されたタスク数が指定された割り当てを超えると、タスクはキューに配置され、割り当て容量が使用可能になると処理されます。

Google Cloud コンソールで割り当てを表示して編集する

Google Cloud コンソールで割り当てを表示して編集するには、次の操作を行います。
  1. [割り当てとシステム上限] ページに移動します。
  2. [割り当てとシステム上限] に移動

  3. 割り当てを調整するには、[フィルタ] でプロパティ aiplatform.googleapis.com/textembedding_gecko_concurrent_batch_prediction_jobs をコピーして貼り付けます。Enter キーを押します。
  4. 行の末尾にあるその他アイコンをクリックし、[割り当てを編集] を選択します。
  5. ペインに新しい割り当て値を入力し、[リクエストを送信] をクリックします。

セマンティック ガバナンス ポリシーの割り当て

各リージョンの特定のプロジェクトのセマンティック ガバナンス ポリシーには、次の割り当てが適用されます。
説明 割り当て 指標
1 分あたりのセマンティック ガバナンス ポリシー リソースの取得または一覧表示 600 aiplatform.googleapis.com/semantic_governance/policy_read_requests
1 分あたりのセマンティック ガバナンス ポリシー リソースの作成、更新、削除回数 60 aiplatform.googleapis.com/semantic_governance/policy_write_requests
1 分あたりのセマンティック ガバナンス ポリシー エンジン リソースを取得する 600 aiplatform.googleapis.com/semantic_governance/engine_read_requests
1 分あたりのセマンティック ガバナンス ポリシー エンジン リソースの更新またはプロビジョニング解除 60 aiplatform.googleapis.com/semantic_governance/engine_write_requests
プロジェクトとロケーションあたりのセマンティック ガバナンス ポリシー リソースの数。 1,000 aiplatform.googleapis.com/semantic_governance/policy_count

Google Cloud コンソールで割り当てを表示して編集する

Google Cloud コンソールで割り当てを表示して編集するには、次の操作を行います。
  1. [割り当てとシステム上限] ページに移動します。
  2. [割り当てとシステム上限] に移動

  3. 割り当てを調整するには、[フィルタ] でプロパティ aiplatform.googleapis.com/semantic_governance/policy_write_requests をコピーして貼り付けます。Enter キーを押します。
  4. 行の末尾にあるその他アイコンをクリックし、[割り当てを編集] を選択します。
  5. ペインに新しい割り当て値を入力し、[リクエストを送信] をクリックします。

Gemini Enterprise Agent Platform の RAG Engine

RAG Engine を使用して検索拡張生成(RAG)を実行するサービスごとに、次の割り当てが適用されます。割り当ては 1 分あたりのリクエスト数(RPM)で測定されます。
サービス 割り当て 指標
RAG Engine データ マネジメント API 60 RPM VertexRagDataService requests per minute per region
RetrievalContexts API 600 RPM VertexRagService retrieve requests per minute per region
base_model: textembedding-gecko 1,500 RPM Online prediction requests per base model per minute per region per base_model

指定できる追加のフィルタは base_model: textembedding-gecko です。
次の上限が適用されます。
サービス 上限 指標
同時に可能な ImportRagFiles リクエスト 3 RPM VertexRagService concurrent import requests per region
ImportRagFiles リクエストあたりの最大ファイル数 10,000 VertexRagService import rag files requests per region

Gen AI Evaluation Service

Gen AI Evaluation Service は、モデルベースの指標のデフォルトの判定モデルとして Gemini 2.5 Flash を使用します。モデルベースの指標の 1 回の評価リクエストで、Gen AI Evaluation Service に対して基盤となるリクエストが複数発生する場合があります。各モデルの使用量は組織レベルで計算されます。つまり、モデル推論とモデルベースの評価のためにジャッジモデルに送信されるリクエストはすべて、モデルの使用量にカウントされます。次の表に、Gen AI Evaluation Service と基盤となる判定モデルの割り当てを示します。
リクエストの割り当て デフォルトの割り当て
1 分あたりの Gen AI Evaluation Service リクエスト 1 プロジェクト、1 リージョンあたり 1,000 件のリクエスト
Gemini のスループット モデルと使用量オプションによって異なる
同時評価実行 1 リージョン、1 プロジェクトあたり 20 件の同時評価実行

Gen AI Evaluation Service の使用中に割り当てに関するエラーが発生した場合は、割り当ての増加をリクエストする必要があります。詳細については、割り当ての表示と管理をご覧ください。

上限
Gen AI Evaluation Service リクエストのタイムアウト 60 秒

新しいプロジェクトで Gen AI Evaluation Service を初めて使用する場合は、初期設定による遅延が発生することがあります(通常は 2 分以内)。最初のリクエストが失敗した場合は、数分待ってから再試行してください。その後の評価リクエストは通常、60 秒以内に完了します。

モデルベースの指標の入力トークンと出力トークンの上限は、判定モデルとして使用されるモデルによって異なります。モデルのリストについては、Google モデルをご覧ください。

Gemini Enterprise Agent Platform Pipelines の割り当て

チューニング ジョブは Gemini Enterprise Agent Platform Pipelines を使用します。詳細については、Agent Platform Pipelines の割り当てと上限をご覧ください。

次のステップ

概要

Standard PayGo は、Agent Platform の利用オプションです。初期の財務上のコミットメントを必要とせず、使用したリソースに対してのみ料金を支払うことができます。

リソース

Agent Platform に関連する割り当てとシステム上限(プロダクト固有の割り当てとシステム上限を除く)。

概要

Google Cloud が Google Cloud プロジェクトで使用できるリソースの量を制限する方法と、割り当てがハードウェア、ソフトウェア、ネットワーク コンポーネントなど、さまざまなリソースタイプに適用される方法について説明します。