Gemini Enterprise Agent Platform 支持一组精选的由 Google 合作伙伴开发的模型。 合作伙伴模型可与 Gemini Enterprise Agent Platform搭配,作为模型即 服务 (MaaS) 使用,并作为托管式 API 提供。使用合作伙伴模型时,您可以继续向 Gemini Enterprise Agent Platform 端点发送请求。合作伙伴模型是无服务器服务,因此您无需预配或管理基础设施。
您可以使用 Model Garden 发现合作伙伴模型,还可以使用 Model Garden 部署模型。如需了解详情,请参阅在 Model Garden 中探索 AI 模型。 您可以在 Model Garden 中的模型卡片上找到每个可用合作伙伴模型的信息,但本指南仅记录了与 Gemini Enterprise Agent Platform 搭配,作为 MaaS 执行的第三方模型。
Anthropic 的 Claude 和 Mistral 模型是可在 Gemini Enterprise Agent Platform 上使用的第三方托管式模型的示例。
合作伙伴模型
以下合作伙伴模型在 Gemini Enterprise Agent Platform Model Garden 上以托管式 API 的形式 (MaaS) 提供:
| 模型名称 | 模态 | 说明 | 快速入门 |
|---|---|---|---|
| Grok 4.3 (预览版) | 语言 | xAI 的高性能模型。 | 模型卡片 |
| Grok 4.20(推理)(预览版) | 语言 | Grok 4.20(推理)是 xAI 的高性能模型,具有业界领先的低幻觉率。擅长处理文档理解任务和长时程智能体工具调用。 | 模型卡片 |
| Grok 4.20(非推理)(预览版) | 语言 | Grok 4.20(非推理)是 xAI 的高性能非思考模型,具有业界领先的低幻觉率。擅长处理对延迟敏感的用例,例如客户支持和分类。 | 模型卡片 |
| Grok 4.1 Fast(推理)(预览版) | 语言 | Grok 4.1 Fast(推理)是 xAI 最具成本效益的模型,具有强大的工具调用功能和高效的知识库整合能力。擅长处理涉及网络数据和内部知识库工具的搜索任务。 | 模型卡片 |
| Grok 4.1 Fast(非推理)(预览版) | 语言 | Grok 4.1 Fast(非推理)是 xAI 最具成本效益的非思考模型,针对低延迟性能进行了优化。擅长处理大批量任务,例如汇总和分类。 | 模型卡片 |
| Google Cloud 上的 Claude Sonnet 5 | 语言、视觉 | Google Cloud 上的 Claude Sonnet 5 是 Anthropic 迄今为止功能最强大的 Sonnet 模型 专为大规模编码、智能体和专业工作打造。 | 模型卡片 |
| Google Cloud 上的 Claude Fable 5 | 语言、视觉 | Google Cloud 上的 Claude Fable 5 是 Anthropic 的一款模型,专为自主 知识工作和编码而设计,适用于复杂的、为期多天的项目。 | 模型卡片 |
| Google Cloud 上的 Claude Opus 4.8 | 语言、视觉 | Claude Opus 4.8 是一款高智能 Opus 模型,专为编码和智能体而打造,能够为企业级工作流提供更深层次的推理。 | 模型卡片 |
| Google Cloud 上的 Claude Opus 4.7 | 语言、视觉 | Google Cloud 上的 Claude Opus 4.7 是 Anthropic 的一款高智能模型,在编码、智能体、计算机使用和企业 工作流方面均表现卓越。 | 模型卡片 |
| Google Cloud 上的 Claude Sonnet 4.6 | 语言、视觉 | Google Cloud 上的 Claude Sonnet 4.6 具备大规模前沿智能能力,专为编码、智能体和企业工作流而打造。 | 模型卡片 |
| Google Cloud 上的 Claude Opus 4.6 | 语言、视觉 | Google Cloud 上的 Claude Opus 4.6 是 Anthropic 的一款高智能模型,在编码、智能体、计算机使用和企业工作流方面均表现卓越。 | 模型卡片 |
| Google Cloud 上的 Claude Opus 4.5 | 语言、视觉 | Google Cloud 上的 Claude Opus 4.5 是 Anthropic 的一款高智能模型,在编码、智能体、计算机使用和企业工作流方面均表现卓越。 | 模型卡片 |
| Google Cloud 上的 Claude Sonnet 4.5 | 语言、视觉 | Anthropic 的中型模型,可为实际应用中的智能体提供在编码、计算机使用、网络安全和处理电子表格等办公文件方面的功能。 | 模型卡片 |
| Google Cloud 上的 Claude Opus 4.1 | 语言、视觉 | 编码领域的行业领导者。它在需要集中精力并执行数千个步骤的长时间运行任务中可提供持续的性能,从而显著扩展了 AI 智能体的解决能力。非常适合为前沿代理产品和功能提供支持。 | 模型卡片 |
| Google Cloud 上的 Claude Haiku 4.5 | 语言、视觉 | Google Cloud 上的 Claude Haiku 4.5 在各种应用场景中都能提供接近前沿的性能,是全球最出色的编码模型之一。它能够以合适的速度和成本为免费产品和大批量用户体验提供支持。 | 模型卡片 |
| Google Cloud 上的 Claude Opus 4 | 语言、视觉 | Google Cloud 上的 Claude Opus 4 在需要集中精力并执行数千个步骤的长时间运行任务中可提供持续的性能,从而显著扩展了 AI 智能体可以解决的问题范围。 | 模型卡片 |
| Google Cloud 上的 Claude Sonnet 4 | 语言、视觉 | Anthropic 的中型模型,具有出色的智能水平,适合大批量使用,例如编码、深入研究和智能体。 | 模型卡片 |
| Google Cloud 上的 Anthropic Claude 3.5 Sonnet v2 | 语言、视觉 | Google Cloud 上的 Claude 3.5 Sonnet 是一款高性能模型,适用于实际的软件工程任务和 智能体功能。Google Cloud 上的 Claude 3.5 Sonnet 依靠与其前代产品相同的价格和速度实现了这些 进步。 | 模型卡片 |
| Google Cloud 上的 Anthropic Claude 3.5 Sonnet | 语言 | Google Cloud 上的 Claude 3.5 Sonnet 凭借 Anthropic 的中端模型 Google Cloud 上的 Claude 3 Sonnet 的速度和成本,在 Anthropic 的多种评估中优于 Google Cloud 上的 Anthropic Claude 3 Opus。 | 模型卡片 |
| Jamba 1.5 Large(预览版) | 语言 | AI21 Labs 的 Jamba 1.5 Large 旨在提供优质的回答、高吞吐量,并且价格与同类别的其他模型相比具有竞争力。 | 模型卡片 |
| Jamba 1.5 Mini(预览版) | 语言 | AI21 Labs 的 Jamba 1.5 Mini 在质量、吞吐量和低成本方面取得了良好的平衡。 | 模型卡片 |
| Mistral Medium 3 | 语言 | Mistral Medium 3 是一款多用途的模型,可以处理包括编程、数学推理、理解长文档、总结和对话在内的各种任务。 | 模型卡片 |
| Mistral OCR (25.05) | 语言、视觉 | Mistral OCR (25.05) 是一款用于文档理解的光学字符识别 API。模型能够理解文档的每个元素,例如媒体、文本、表格和方程式。 | 模型卡片 |
| Mistral Small 3.1 (25.03) | 语言 | Mistral Small 3.1 (25.03) 是 Mistral Small 模型的一个版本 ,具有多模态功能和 更长的上下文长度。 | 模型卡片 |
| Codestral 2 | 语言、代码 | Codestral 2 是 Mistral 的代码生成专用模型,专门用于高精确度的中间填充 (FIM) 补全,可通过共享指令和补全 API 端点帮助开发者编写代码并与代码交互。 | 模型卡片 |
使用 Gen AI Evaluation Service 评估合作伙伴模型
Gen AI Evaluation Service 支持评估合作伙伴模型,例如 Anthropic 和 Llama 模型。Model Garden 支持合作伙伴模型评估,因此您必须先启用 模型,然后才能针对合作伙伴模型运行评估。
如需了解详情,请参阅使用 控制台执行评估。
具有容量保证的 Gemini Enterprise Agent Platform 合作伙伴模型价格
Google 为某些合作伙伴模型提供预配吞吐量,以固定费用为您的模型预留吞吐量容量。您可以决定吞吐量容量以及在哪些区域预留该容量。由于预配吞吐量请求的优先级高于标准随用随付请求,因此预配吞吐量可提高可用性。当系统过载时,只要吞吐量不超过预留吞吐量容量,您的请求仍可完成。如需详细了解 或订阅此服务,请与销售人员联系。
区域、全球和多区域端点
对于区域端点,系统会从您指定的区域处理请求。如果您有数据驻留要求,或者模型不支持全球端点,请使用区域端点。
使用全球端点时,Google 可以从您所用模型支持的任何区域处理和提供请求,这在某些情况下可能会导致延迟时间较长。全球端点有助于提高整体可用性并减少错误。
多区域端点允许以高可用性方式访问合作伙伴模型,同时将数据驻留在更广阔的地理区域(例如美国)内。
价格因您选择的端点类型而异。如需详细了解配额和功能,请查看相关的第三方模型页面。
全球端点
如需使用全球端点,请将区域设置为 global。
例如,curl 命令的请求网址使用以下格式:
https://aiplatform.googleapis.com/v1/projects/PROJECT_ID/locations/global/publishers/PUBLISHER_NAME/models/MODEL_NAME
对于 Agent Platform SDK,区域端点是默认端点。将区域设置为 GLOBAL 以使用全球端点。
全球端点支持的模型
以下模型支持使用全球端点:
- Google Cloud 上的 Claude Sonnet 5
- Google Cloud 上的 Claude Fable 5
- Google Cloud 上的 Claude Opus 4.8
- Google Cloud 上的 Claude Opus 4.7
- Google Cloud 上的 Claude Opus 4.6
- Google Cloud 上的 Claude Sonnet 4.6
- Google Cloud 上的 Claude Opus 4.5
- Google Cloud 上的 Claude Opus 4.1
- Google Cloud 上的 Claude Opus 4
- Google Cloud 上的 Claude Sonnet 4.5
- Google Cloud 上的 Claude Sonnet 4
- Google Cloud 上的 Claude 3.7 Sonnet
- Google Cloud 上的 Claude 3.5 Sonnet v2
- Google Cloud 上的 Claude Haiku 4.5
- Grok 4.1 Fast
- Grok 4.20
- Grok 4.3
限制全球 API 端点用量
为了帮助强制使用区域端点,请使用 constraints/gcp.restrictEndpointUsage 组织政策限制条件来阻止对全球 API 端点的请求。如需了解详情,请参阅
限制端点用量。
多区域端点
多区域端点允许以高可用性方式访问合作伙伴模型,同时将数据驻留在更广阔的地理区域(例如美国或欧盟)内。
为要使用的多区域选择相应的标签:
美国
如需使用美国多区域端点,请将端点网址设置为 aiplatform.us.rep.googleapis.com。
curl 命令的请求网址使用以下格式:
https://aiplatform.us.rep.googleapis.com/v1/projects/PROJECT_ID/locations/us/publishers/anthropic/models/MODEL_NAME
欧盟
如需使用欧盟多区域端点,请将端点网址设置为 aiplatform.eu.rep.googleapis.com。
curl 命令的请求网址使用以下格式:
https://aiplatform.eu.rep.googleapis.com/v1/projects/PROJECT_ID/locations/eu/publishers/anthropic/models/MODEL_NAME
如需详细了解 MODEL_NAME 格式,请参阅 Anthropic 文档。
多区域端点支持的模型:
多区域端点支持所有 Claude 模型,版本为 4.7 及更高版本(例如 claude-opus-4-7、claude-opus-4-8 和 claude-fable-5)。请使用完整的模型 ID,包括版本日期(如果适用)。
示例请求:
以下展示了如何使用 curl 调用多区域端点:
export PROJECT_ID="YOUR_PROJECT_ID"
# Example using claude-opus-4-7
# Option 1: US Region
export LOCATION="us"
export ENDPOINT="aiplatform.us.rep.googleapis.com"
# Option 2: EU Region
# export LOCATION="eu"
# export ENDPOINT="aiplatform.eu.rep.googleapis.com"
export MODEL_ID="claude-opus-4-7"
curl -X POST \
-H "Authorization: Bearer $(gcloud auth application-default print-access-token)" \
-H "Content-Type: application/json" \
"https://${ENDPOINT}/v1/projects/${PROJECT_ID}/locations/${LOCATION}/publishers/anthropic/models/${MODEL_ID}:rawPredict" \
-d '{
"max_tokens": 300,
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "Why is the sky blue?"
}
]
}
],
"anthropic_version": "vertex-2023-10-16"
}'
多区域配额:
系统会强制执行专用多区域配额。您可以在 Google Cloud 控制台中查看这些默认配额值并请求增加配额。
美国配额示例:
UsOnlinePredictionInputTokensPerMinutePerBaseModelUsOnlinePredictionOutputTokensPerMinutePerBaseModelUsOnlinePredictionRequestsPerMinPerProjectPerBaseModelUsOnlinePredictionWebSearchRequestsPerProjectPerPublisher
欧盟配额示例:
EuOnlinePredictionInputTokensPerMinutePerBaseModelEuOnlinePredictionOutputTokensPerMinutePerBaseModelEuOnlinePredictionRequestsPerMinPerProjectPerBaseModelEuOnlinePredictionWebSearchRequestsPerProjectPerPublisher
授予用户对合作伙伴模型的访问权限
为了让您能够启用合作伙伴模型并发出提示请求,a Google Cloud 管理员必需设置所需的权限并验证 组织政策是否允许使用所需的 API。
设置使用合作伙伴模型所需的权限
使用合作伙伴模型需要具有以下角色和权限:
您必须具有 Consumer Procurement Entitlement Manager Identity and Access Management (IAM) 角色。任何被授予此角色的用户都可以在 Model Garden 中启用合作伙伴模型。
您必须具有
aiplatform.endpoints.predict权限。此权限包含在 Agent Platform User IAM 角色中。如需了解详情,请参阅 Gemini Enterprise Agent Platform User 和 访问权限控制。
控制台
gcloud
-
在 Google Cloud 控制台中,激活 Cloud Shell。
授予在 Model Garden 中启用合作伙伴模型所需的 Consumer Procurement Entitlement Manager 角色
gcloud projects add-iam-policy-binding PROJECT_ID \ --member=PRINCIPAL --role=roles/consumerprocurement.entitlementManager授予包含发出提示请求所需的
aiplatform.endpoints.predict权限的 Agent Platform User 角色:gcloud projects add-iam-policy-binding PROJECT_ID \ --member=PRINCIPAL --role=roles/aiplatform.user将
PRINCIPAL替换为主账号的标识符。标识符的格式为user|group|serviceAccount:email或domain:domain,例如user:cloudysanfrancisco@gmail.com、group:admins@example.com、serviceAccount:test123@example.domain.com或domain:example.domain.com。输出是一个政策绑定列表,其中包含以下内容:
- members: - user:PRINCIPAL role: roles/roles/consumerprocurement.entitlementManager如需了解详情,请参阅授予单个角色和
gcloud projects add-iam-policy-binding。
设置组织政策以访问合作伙伴模型
如需启用合作伙伴模型,您的组织政策必须允许以下 API:Cloud Commerce Consumer Procurement API - cloudcommerceconsumerprocurement.googleapis.com
如果您的组织将组织政策设置为限制服务的使用,则组织管理员必须通过设置组织政策来验证是否允许 cloudcommerceconsumerprocurement.googleapis.com。
此外,如果您的组织政策对 Model Garden 中模型的使用进行了限制,则该政策必须允许访问合作伙伴模型。如需了解更多 信息,请参阅控制模型 访问权限。
合作伙伴模型监管合规性
当合作伙伴模型作为托管式 API 使用 Gemini Enterprise Agent Platform 时,Gemini Enterprise Agent Platform 上 生成式 AI 的认证将继续 适用。 如果您需要了解模型本身的详细信息,可以在相应的模型卡片中找到更多信息,也可以联系相应的模型发布方。
您的数据在 Gemini Enterprise Agent Platform 上合作伙伴模型的所选区域或多区域内静态存储,但数据处理的区域化可能会有所不同。如需查看合作伙伴模型数据处理 承诺的详细列表,请参阅合作伙伴模型的数据驻留。
使用 Gemini Enterprise API(包括合作伙伴模型)时,客户提示和模型响应不会与第三方共享。Google 仅会按照客户的指示处理 客户数据,详见我们的 《云端数据处理附录》。