Agent Platform のエージェントの割り当てとシステム上限

このドキュメントでは、 Gemini Enterprise Agent Platform に適用される割り当てとシステム上限の一覧を示します。

  • 割り当てにはデフォルト値がありますが、通常は 調整をリクエストできます。
  • システムの上限は固定値で、変更できません。

Google Cloud では、割り当てを使用して公平性を確保し、リソースの使用量と可用性の急増を抑えます。割り当ては、 Google Cloud プロジェクトで使用できるGoogle Cloud リソースの量を制限します。割り当ては、ハードウェア、ソフトウェア、ネットワーク コンポーネントなど、さまざまなリソースタイプに適用されます。たとえば、割り当てによって、サービスへの API 呼び出しの数、プロジェクトで同時に使用されるロードバランサの数、作成可能なプロジェクトの数を制限できます。割り当てを適用することで、サービスの過負荷を防ぎ、Google Cloud ユーザーのコミュニティを保護します。割り当ては、自組織で使用している Google Cloud リソースの管理にも役立ちます。

Cloud Quotas システムは次のことを行います。

ほとんどの場合、割り当ての許容量を超えるリソースを消費しようとすると、システムによってリソースへのアクセスがブロックされ、実行しようとしているタスクは失敗します。

割り当ては通常、 Google Cloud プロジェクト レベルで適用されます。あるプロジェクトでリソースを使用しても、別のプロジェクトで使用可能な割り当てに影響することはありません。 Google Cloud プロジェクト内では、すべてのアプリケーションと IP アドレスで割り当てが共有されます。

詳細については、 Cloud Quotas の概要をご覧ください。

割り当て

各リージョンの特定のプロジェクトの Agent Platform にデプロイされたエージェントには、次の割り当てが適用されます。

説明 割り当て 指標
1 分あたりの Agent Platform リソースの作成、削除、更新回数 10 aiplatform.googleapis.com/reasoning_engine_service_write_requests
1 分あたりの Agent Platform の非リージョン(グローバルまたはマルチリージョン)リソースの作成、削除、更新回数 10 aiplatform.googleapis.com/non_regional_reasoning_engine_service_write_requests
1 分あたりの Agent Platform セッションの作成、削除、更新回数 100 aiplatform.googleapis.com/session_write_requests
1 分あたりの Agent Platform の Query または StreamQuery 90 aiplatform.googleapis.com/reasoning_engine_service_query_requests
1 分あたりの Agent Platform セッションへのイベントの追加回数 300 aiplatform.googleapis.com/session_event_append_requests
1 分あたりの Agent Platform の非リージョン(グローバルまたはマルチリージョン)セッションの作成、削除、更新回数 100 aiplatform.googleapis.com/non_regional_session_write_requests
1 分あたりの Agent Platform の非リージョン(グローバルまたはマルチリージョン)セッションへのイベントの追加回数 300 aiplatform.googleapis.com/non_regional_session_event_append_requests
Agent Platform リソースの最大数 100 aiplatform.googleapis.com/reasoning_engine_service_entities
Agent Platform の非リージョン(グローバルまたはマルチリージョン)リソースの最大数 100 aiplatform.googleapis.com/non_regional_reasoning_engine_service_entities
1 分あたりの Agent Platform メモリリソースの作成、削除、更新回数 100 aiplatform.googleapis.com/memory_bank_write_requests
1 分あたりの Agent Platform メモリバンクからの取得、一覧表示、取得回数 300 aiplatform.googleapis.com/memory_bank_read_requests
1 分あたりの Agent Platform の非リージョン(グローバルまたはマルチリージョン)メモリリソースの作成、削除、更新回数 100 aiplatform.googleapis.com/non_regional_memory_bank_write_requests
1 分あたりの非リージョン(グローバルまたはマルチリージョン)Agent Platform メモリバンクからの取得、一覧表示、取得回数 300 aiplatform.googleapis.com/non_regional_memory_bank_read_requests
1 分あたりのサンドボックス環境(Code Execution)の実行リクエスト数 1000 aiplatform.googleapis.com/sandbox_environment_execute_requests
リージョンあたりのサンドボックス環境(Code Execution)のエンティティ数 1000 aiplatform.googleapis.com/sandbox_environment_entities
1 分あたりのサンドボックス環境(Code Execution)の書き込みリクエスト数 500 aiplatform.googleapis.com/sandbox_environment_write_requests
1 分あたりの A2A エージェントの POST リクエスト数(sendMessagecancelTask など) 60 aiplatform.googleapis.com/a2a_agent_post_requests
1 分あたりの A2A エージェントの GET リクエスト数(getTaskgetCard など) 600 aiplatform.googleapis.com/a2a_agent_get_requests
BidiStreamQuery API を使用した 1 分あたりの同時ライブ双方向接続数 10 aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests
プロジェクト、リージョンごとの最大リビジョン数 6,000 aiplatform.googleapis.com/agent_engine_revisions_per_project_per_region
エージェントごとの最大リビジョン数* 950 aiplatform.googleapis.com/agent_engine_revisions_per_agent

本番環境の負荷に対する割り当て管理

トラフィックがスケーリングされると、429 Resource Exhausted エラーを回避するために、特定の Agent Platform API 割り当ての引き上げをリクエストする必要が生じる可能性があります。ランタイムを事前に構成し割り当てを引き上げることで、本番環境の負荷の下でも Agent Runtime インスタンスの応答性、スケーラビリティ、信頼性を維持できます。

Agent Runtime のパフォーマンスを最適化してスケーリングする方法については、 Agent Runtime パフォーマンスを最適化してスケーリングするをご覧ください。

ピーク時の割り当て要件を見積もるには、次の手順を行います。

  1. 変数を定義します。

    • U: 同時ユーザーのピーク数(250 など)。

    • X: 1 ユーザー、1 分あたりの平均リクエスト数(2 など)。

    • Y: リクエストごとに生成されるセッション イベントの平均数(複数のツール呼び出しを含む複雑なチェーンの場合は 12 など)。

  2. ピーク時の負荷を計算します。

    • 1 分あたりのピーククエリ数(QPM)を計算します: U * X

    • 1 分あたりのピーク セッション イベント数を計算します: ピーク QPM * Y

  3. バッファ付きの割り当てをリクエストします。割り当ての引き上げをリクエストする場合は、計算されたピークにバッファ(50% など)を追加して、予期しない急増に対応します。

次の表に、 Agent Platform の主要なパフォーマンス関連の割り当ての計算を示します。例として、peak concurrent users=250 average requests per user per minute=2、および average session events generated per request=12 の変数を使用します。

割り当て名 割り当ての説明 基本計算(ピーク) 推奨値(50% バッファ付き)
1 分あたりの Agent Engine のクエリ数(aiplatform.googleapis.com/reasoning_engine_service_query_requests エージェントが 1 分間に受信できる query または stream_query 呼び出しの合計数。 250 users * 2 req/min = 500 QPM 500 * 1.5 = 750
1 分あたりのセッション イベントの追加回数(aiplatform.googleapis.com/session_event_append_requests

進行中のすべてのセッション内のターン数またはイベント数。 1 つのクエリで、チェーン内の複数のセッション イベントを生成できます。 例:

  1. LLM を呼び出す。
  2. LLM レスポンス: ツールを使用する。
  3. ツールを実行する。
  4. ツール レスポンスを使用して LLM を呼び出す。
  5. LLM が最終的なレスポンスを返す。
500 QPM * 12 events/req = 6,000 6,000 * 1.5 = 9,000
1 分あたりのセッション書き込み数(aiplatform.googleapis.com/session_write_requests セッション リソースの作成または更新のレート。通常、これはクエリレート以下です。 通常 <= ピーク QPM(500 通常 <= クエリ割り当て(750

割り当ての調整をリクエストする

通常、割り当てを調整するには Google Cloud コンソールを使用します。詳細については、 割り当ての調整をリクエストするをご覧ください。

Agent Platform エクスプレス モードの割り当て

Agent Platform 無料枠の エクスプレス モード ユーザーには、Agent Platform サービスに対して次の割り当てが適用されます。無料枠とエクスプレス モードの詳細については、Agent Platform のエクスプレス モードの概要をご覧ください。

各リージョンの特定の Express モード プロジェクトの Agent Platform にデプロイされたエージェントには、次の割り当てが適用されます。

説明 割り当て 指標
Agent Platform リソースの最大数 10 aiplatform.googleapis.com/reasoning_engine_service_entities
1 分あたりの Agent Platform リソースの作成、削除、更新回数 10 aiplatform.googleapis.com/reasoning_engine_service_write_requests
1 分あたりの Agent Platform の Query または StreamQuery 10 aiplatform.googleapis.com/reasoning_engine_service_query_requests
BidiStreamQuery API を使用した 1 分あたりの同時ライブ双方向接続数 1 aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests
1 分あたりの Agent Platform セッションの作成、削除、更新回数 10 aiplatform.googleapis.com/session_write_requests
1 分あたりの Agent Platform セッションへのイベントの追加回数 30 aiplatform.googleapis.com/session_event_append_requests
1 分あたりの Agent Platform メモリリソースの作成、削除、更新回数 10 aiplatform.googleapis.com/memory_bank_write_requests
1 分あたりのメモリバンクからの取得、一覧表示、取得回数 10 aiplatform.googleapis.com/memory_bank_read_requests