モデル ルーティングの概要

API Gateway のモデル ルーティングは、OpenAI 互換のプロンプト リクエストを受け入れ、転送中にトランスコードして、特定の Vertex AI モデルにルーティングするマネージド トラフィック管理レイヤです。モデル ルーティングは、LiteLLM などのクライアントサイド プロキシのマネージド代替として機能し、AI エージェントのライフサイクルを管理するための一元化されたインフラストラクチャを提供します。

モデル ルーティングは、ルーティング ロジックをネットワーク エッジに移動し、同じホストの最適化のために Vertex AI Model Garden と統合します。このアーキテクチャでは、管理対象外のプロキシ サーバーのホスティング、スケーリング、メンテナンスが不要になるため、運用上のオーバーヘッドとインフラストラクチャの費用が削減されます。

スコープとユーザー ジャーニー

モデルのルーティングは、次のコア ユーザー ジャーニーをサポートしています。

  • モデルの選択: AI デベロッパーは、Vertex AI Model Garden の Model as a Service(MaaS)のオープンモデルを使用します。これらは、Gemini、Anthropic Claude、OpenAI GPT ファミリー モデルです。
  • 仕様の作成: AI デベロッパーは、OpenAPI 3.x 仕様内でモデルルーター構成を作成または更新して、デプロイされたモデルを参照します。
  • Gateway のデプロイ: AI デベロッパーは、作成した OpenAPI 仕様を使用して API 構成と API Gateway インスタンスをデプロイします。
  • プロンプトのルーティング: クライアント アプリケーションは、OpenAI 互換のプロンプト リクエストをゲートウェイに送信します。ゲートウェイは、JSON ペイロードで指定されたモデル名に基づいてリクエストをルーティングし、ペイロードを変換します。

API Gateway の今後のバージョンでは、追加のユーザー ジャーニーがサポートされる予定です。

モデル ルーティングのメリット

API Gateway でモデル ルーティングを実装すると、次の利点があります。

  • 一元管理: AI トラフィック管理を 1 つのマネージド ゲートウェイに統合し、断片化されたクライアントサイドのルーティング構成を置き換えます。
  • 運用オーバーヘッドの削減: スタンドアロン プロキシ サーバーのデプロイに関連するインフラストラクチャ コストとメンテナンスの負担を軽減します。
  • エッジ最適化されたパフォーマンス: Vertex AI Model Garden エンドポイントとの直接統合を活用して、ネットワーク エッジでプロンプトを検査し、トラフィックをルーティングします。
  • 標準化されたクライアント インターフェース: クライアント アプリケーションが統一された OpenAI 互換の REST インターフェースとやり取りできるようにしながら、さまざまな基盤モデルにリクエストを動的にディスパッチします。

ペルソナとユースケース

モデルのルーティングは、次のペルソナの要件に対応します。

  • プラットフォーム エンジニア: エンタープライズ AI デプロイ全体でクライアントサイドのルーティング ロジックを置き換えるマネージド インフラストラクチャ ソリューションをプロビジョニングします。
  • AI デベロッパー: リクエスト ペイロード パラメータに基づいて、さまざまな基盤モデル(Gemini Pro、Gemini Flash、Anthropic Claude など)間でリクエストを動的にルーティングする標準化された API エンドポイントを公開します。
  • ガバナンス管理者: 一元化されたアクセス ポリシー(認証や割り当てなど)を適用し、組織全体の AI トラフィックの総量をモニタリングします。

サポートされるユースケース

公開プレビュー期間中、モデルのルーティングは、OpenAI 互換のクライアント リクエストの JSON ペイロード内で指定されたモデルタグまたは名前("model": "gemini-3.5-flash-lite" など)のみに基づくルーティングをサポートします。

アーキテクチャとリクエスト フロー

モデル ルーティングは、API Gateway データプレーン内のマネージド ルーティング レイヤとして機能します。クライアント アプリケーションが OpenAI 互換のプロンプト リクエストをゲートウェイに送信すると、次のシーケンスが発生します。

  1. リクエストのインターセプト: ゲートウェイが着信 POST リクエスト(POST /chat/completions など)をインターセプトします。
  2. ペイロード検査: モデルルーターは、受信した JSON ペイロード内の model 属性({"model": "claude-opus-4-7", "messages": [...]} など)を検査します。
  3. ルール評価: ルーターは、model 文字列を OpenAPI 仕様で定義されたルーティング ルールと照合します。どのルールにも一致しない場合、ルーターは構成されたデフォルト モデルを選択します。
  4. 転送中のトランスコーディング: ゲートウェイは、OpenAI 互換のリクエストを宛先 Vertex AI 予測スキーマにトランスコードします。
  5. バックエンド ディスパッチ: ゲートウェイは、トランスコードされたリクエストを指定された Vertex AI Model Garden エンドポイントにディスパッチし、モデル レスポンスをクライアントに返します。

パフォーマンスと制限事項

モデルのルーティングを実装する前に、次の技術的な制約を確認してください。

  • ホスト制約: モデル ルーティングは、Vertex AI Model Garden でホストされている事前デプロイ済みの MaaS モデルへのルーティングのみをサポートします。ここで、単一のルーターによって参照されるすべてのモデルは同じホスト名(グローバル エンドポイント aiplatform.googleapis.com や、us-central1-aiplatform.googleapis.com などの単一のリージョン エンドポイントなど)を共有します。
  • 仕様の要件: モデルのルーティングには、OpenAPI 3.x 仕様と対応する API Gateway OpenAPI 3.x 拡張機能が必要です。OpenAPI 2.0(Swagger)仕様はサポートされていません。
  • ゲートウェイの更新: モデル ルーティングなしでデプロイされた既存のゲートウェイを更新してモデル ルーティングを有効にすることはできません。また、モデル ルーティングを使用してデプロイされたゲートウェイを更新してモデル ルーティングを無効にしたり削除したりすることもできません。ルーティング モードを切り替えるには、新しい API 構成とゲートウェイ インスタンスを作成してデプロイする必要があります。
  • 混合構成: OpenAPI 仕様に、モデル ルーティング オペレーションと非モデル ルーティング オペレーションを混在させることはできません。仕様内のすべてのオペレーションは、モデル ルーティングまたは標準ゲートウェイ ルーティングのいずれかを使用する必要があります。
  • VPC Service Controls: モデル ルーティング ゲートウェイは VPC Service Controls をサポートしていません。モデル ルーティングを有効にする API Gateway インスタンスでは、VPC Service Controls の境界を使用できません。
  • ストリーミングとサポートされていないプロトコル: モデルのルーティングはレスポンス ストリーミング(サーバー送信イベント)をサポートしていますが、リクエスト側のストリーミング、gRPC、WebSocket、Gemini Live はサポートしていません。
  • サポートされているモダリティ: 公開プレビュー期間中、モデルのルーティングでは、OpenAI 互換の JSON ペイロードとしてフォーマットされたテキストベースのプロンプト リクエストが想定され、ペイロード内の model タグまたは名前のみに基づいてルーティングされます。
  • 必須のペイロード フィールド: 受信 JSON リクエスト ペイロードには model 属性を含める必要があります。パブリック プレビュー期間中、クライアント リクエストのペイロードに model フィールドがない場合、ゲートウェイはエラーでリクエストを拒否するのではなく、誤ってリクエストを処理します。クライアント リクエストで JSON ペイロードの model フィールドが指定されていることを常に確認してください。
  • ランタイムの制限: 標準ゲートウェイ ホスティング インフラストラクチャのサービス上限と動作が、モデルのルーティング エンドポイントに適用されます。
    • 最大タイムアウト: ゲートウェイは、長時間実行されるストリーミング リクエストに適用される最大リクエスト タイムアウトを 3,600 秒(1 時間)に設定します。
    • コールド スタートのレイテンシ: ゲートウェイ インスタンスが非アクティブ期間中にゼロにスケーリングされると、最初のリクエストでコールド スタートのレイテンシが発生し、レイテンシに敏感な AI 推論パスに影響する可能性があります。
    • 予約済みの URL パス: /eventlog などの予約済みの URL パス、/_ah/ で始まるパス、z で終わる特定のパスは使用できません(競合を避けるため、z で終わるパス名は使用しないでください)。
    • URL 文字のデコード: ゲートウェイは、リクエストを処理する前に、リクエスト URL 内の特定のエンコードされた文字を自動的にデコードします(たとえば、%41A にデコードされます)。

次のステップ