このドキュメントでは、 Gemini Enterprise Agent Platform に適用される割り当てとシステム上限の一覧を示します。
- 割り当てにはデフォルト値がありますが、通常は 調整をリクエストできます。
- システムの上限は固定値で、変更できません。
Google Cloud では、割り当てを使用して公平性を確保し、リソースの使用量と可用性の急増を抑えます。割り当ては、 Google Cloud プロジェクトで使用できるGoogle Cloud リソースの量を制限します。割り当ては、ハードウェア、ソフトウェア、ネットワーク コンポーネントなど、さまざまなリソースタイプに適用されます。たとえば、割り当てによって、サービスへの API 呼び出しの数、プロジェクトで同時に使用されるロードバランサの数、作成可能なプロジェクトの数を制限できます。割り当てを適用することで、サービスの過負荷を防ぎ、Google Cloud ユーザーのコミュニティを保護します。割り当ては、自組織で使用している Google Cloud リソースの管理にも役立ちます。
Cloud Quotas システムは次のことを行います。
- Google Cloud のプロダクトとサービスの消費量をモニタリングする
- これらのリソースの消費量を制限する
- 割り当て値の変更をリクエストし、割り当ての調整を自動化する手段を提供する
ほとんどの場合、割り当ての許容量を超えるリソースを消費しようとすると、システムによってリソースへのアクセスがブロックされ、実行しようとしているタスクは失敗します。
割り当ては通常、 Google Cloud プロジェクト レベルで適用されます。あるプロジェクトでリソースを使用しても、別のプロジェクトで使用可能な割り当てに影響することはありません。 Google Cloud プロジェクト内では、すべてのアプリケーションと IP アドレスで割り当てが共有されます。
詳細については、 Cloud Quotas の概要をご覧ください。
割り当て
各リージョンの特定のプロジェクトの Agent Platform にデプロイされたエージェントには、次の割り当てが適用されます。
| 説明 | 割り当て | 指標 |
|---|---|---|
| 1 分あたりの Agent Platform リソースの作成、削除、更新回数 | 10 | aiplatform.googleapis.com/reasoning_engine_service_write_requests |
| 1 分あたりの Agent Platform の非リージョン(グローバルまたはマルチリージョン)リソースの作成、削除、更新回数 | 10 | aiplatform.googleapis.com/non_regional_reasoning_engine_service_write_requests |
| 1 分あたりの Agent Platform セッションの作成、削除、更新回数 | 100 | aiplatform.googleapis.com/session_write_requests |
1 分あたりの Agent Platform の Query または StreamQuery |
90 | aiplatform.googleapis.com/reasoning_engine_service_query_requests |
| 1 分あたりの Agent Platform セッションへのイベントの追加回数 | 300 | aiplatform.googleapis.com/session_event_append_requests |
| 1 分あたりの Agent Platform の非リージョン(グローバルまたはマルチリージョン)セッションの作成、削除、更新回数 | 100 | aiplatform.googleapis.com/non_regional_session_write_requests |
| 1 分あたりの Agent Platform の非リージョン(グローバルまたはマルチリージョン)セッションへのイベントの追加回数 | 300 | aiplatform.googleapis.com/non_regional_session_event_append_requests |
| Agent Platform リソースの最大数 | 100 | aiplatform.googleapis.com/reasoning_engine_service_entities |
| Agent Platform の非リージョン(グローバルまたはマルチリージョン)リソースの最大数 | 100 | aiplatform.googleapis.com/non_regional_reasoning_engine_service_entities |
| 1 分あたりの Agent Platform メモリリソースの作成、削除、更新回数 | 100 | aiplatform.googleapis.com/memory_bank_write_requests |
| 1 分あたりの Agent Platform メモリバンクからの取得、一覧表示、取得回数 | 300 | aiplatform.googleapis.com/memory_bank_read_requests |
| 1 分あたりの Agent Platform の非リージョン(グローバルまたはマルチリージョン)メモリリソースの作成、削除、更新回数 | 100 | aiplatform.googleapis.com/non_regional_memory_bank_write_requests |
| 1 分あたりの非リージョン(グローバルまたはマルチリージョン)Agent Platform メモリバンクからの取得、一覧表示、取得回数 | 300 | aiplatform.googleapis.com/non_regional_memory_bank_read_requests |
| 1 分あたりのサンドボックス環境(Code Execution)の実行リクエスト数 | 1000 | aiplatform.googleapis.com/sandbox_environment_execute_requests |
| リージョンあたりのサンドボックス環境(Code Execution)のエンティティ数 | 1000 | aiplatform.googleapis.com/sandbox_environment_entities |
| 1 分あたりのサンドボックス環境(Code Execution)の書き込みリクエスト数 | 500 | aiplatform.googleapis.com/sandbox_environment_write_requests |
1 分あたりの A2A エージェントの POST リクエスト数(sendMessage や cancelTask など) |
60 | aiplatform.googleapis.com/a2a_agent_post_requests |
1 分あたりの A2A エージェントの GET リクエスト数(getTask や getCard など) |
600 | aiplatform.googleapis.com/a2a_agent_get_requests |
BidiStreamQuery API を使用した 1 分あたりの同時ライブ双方向接続数 |
10 | aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests |
| プロジェクト、リージョンごとの最大リビジョン数 | 6,000 | aiplatform.googleapis.com/agent_engine_revisions_per_project_per_region |
| エージェントごとの最大リビジョン数* | 950 | aiplatform.googleapis.com/agent_engine_revisions_per_agent |
本番環境の負荷に対する割り当て管理
トラフィックがスケーリングされると、429 Resource Exhausted エラーを回避するために、特定の Agent Platform API 割り当ての引き上げをリクエストする必要が生じる可能性があります。ランタイムを事前に構成し、割り当てを引き上げることで、本番環境の負荷の下でも Agent Runtime インスタンスの応答性、スケーラビリティ、信頼性を維持できます。
Agent Runtime のパフォーマンスを最適化してスケーリングする方法については、 Agent Runtime パフォーマンスを最適化してスケーリングするをご覧ください。
ピーク時の割り当て要件を見積もるには、次の手順を行います。
変数を定義します。
U: 同時ユーザーのピーク数(250 など)。X: 1 ユーザー、1 分あたりの平均リクエスト数(2 など)。Y: リクエストごとに生成されるセッション イベントの平均数(複数のツール呼び出しを含む複雑なチェーンの場合は 12 など)。
ピーク時の負荷を計算します。
1 分あたりのピーククエリ数(QPM)を計算します: U * X
1 分あたりのピーク セッション イベント数を計算します: ピーク QPM * Y
バッファ付きの割り当てをリクエストします。割り当ての引き上げをリクエストする場合は、計算されたピークにバッファ(50% など)を追加して、予期しない急増に対応します。
次の表に、
Agent Platform の主要なパフォーマンス関連の割り当ての計算を示します。例として、peak concurrent users=250
average requests per user per minute=2、および average session events generated
per request=12 の変数を使用します。
| 割り当て名 | 割り当ての説明 | 基本計算(ピーク) | 推奨値(50% バッファ付き) |
|---|---|---|---|
1 分あたりの Agent Engine のクエリ数(aiplatform.googleapis.com/reasoning_engine_service_query_requests) |
エージェントが 1 分間に受信できる query または stream_query 呼び出しの合計数。 |
250 users * 2 req/min = 500 QPM |
500 * 1.5 = 750 |
1 分あたりのセッション イベントの追加回数(aiplatform.googleapis.com/session_event_append_requests) |
進行中のすべてのセッション内のターン数またはイベント数。 1 つのクエリで、チェーン内の複数のセッション イベントを生成できます。 例:
|
500 QPM * 12 events/req = 6,000 |
6,000 * 1.5 = 9,000 |
1 分あたりのセッション書き込み数(aiplatform.googleapis.com/session_write_requests) |
セッション リソースの作成または更新のレート。通常、これはクエリレート以下です。 | 通常 <= ピーク QPM(500) |
通常 <= クエリ割り当て(750) |
割り当ての調整をリクエストする
通常、割り当てを調整するには Google Cloud コンソールを使用します。詳細については、 割り当ての調整をリクエストするをご覧ください。
Agent Platform エクスプレス モードの割り当て
Agent Platform 無料枠の エクスプレス モード ユーザーには、Agent Platform サービスに対して次の割り当てが適用されます。無料枠とエクスプレス モードの詳細については、Agent Platform のエクスプレス モードの概要をご覧ください。
各リージョンの特定の Express モード プロジェクトの Agent Platform にデプロイされたエージェントには、次の割り当てが適用されます。
| 説明 | 割り当て | 指標 |
|---|---|---|
| Agent Platform リソースの最大数 | 10 | aiplatform.googleapis.com/reasoning_engine_service_entities |
| 1 分あたりの Agent Platform リソースの作成、削除、更新回数 | 10 | aiplatform.googleapis.com/reasoning_engine_service_write_requests |
1 分あたりの Agent Platform の Query または StreamQuery |
10 | aiplatform.googleapis.com/reasoning_engine_service_query_requests |
BidiStreamQuery API を使用した 1 分あたりの同時ライブ双方向接続数 |
1 | aiplatform.googleapis.com/reasoning_engine_service_concurrent_query_requests |
| 1 分あたりの Agent Platform セッションの作成、削除、更新回数 | 10 | aiplatform.googleapis.com/session_write_requests |
| 1 分あたりの Agent Platform セッションへのイベントの追加回数 | 30 | aiplatform.googleapis.com/session_event_append_requests |
| 1 分あたりの Agent Platform メモリリソースの作成、削除、更新回数 | 10 | aiplatform.googleapis.com/memory_bank_write_requests |
| 1 分あたりのメモリバンクからの取得、一覧表示、取得回数 | 10 | aiplatform.googleapis.com/memory_bank_read_requests |