Modelos abertos da Gemini Enterprise Agent Platform para MaaS

A Plataforma de Agentes do Gemini Enterprise oferece suporte a uma lista selecionada de modelos abertos como modelos gerenciados. Esses modelos abertos podem ser usados com Gemini Enterprise Agent Platform como modelo como serviço (MaaS, na sigla em inglês) e são oferecidos como uma API gerenciada. Ao usar um modelo aberto gerenciado, você continua enviando solicitações para endpoints da Plataforma de Agentes do Gemini Enterprise. Os modelos abertos gerenciados não têm servidor, então não é necessário provisionar nem gerenciar infraestrutura.

Os modelos abertos gerenciados podem ser descobertos usando o Model Garden. Também é possível implantar modelos usando o Model Garden. Para mais informações, consulte Conhecer modelos de IA no Model Garden.

Antes de usar modelos abertos, você precisa conceder acesso de usuário a eles.

Modelos abertos

Os seguintes modelos abertos são oferecidos como APIs gerenciadas no Model Garden da Plataforma de Agentes do Gemini Enterprise (MaaS):

Nome do modelo Modalidade Descrição Guia de início rápido
DeepSeek-OCR Linguagem, visão Um modelo abrangente de reconhecimento óptico de caracteres (OCR, na sigla em inglês) que analisa e entende documentos complexos. Ele se destaca em tarefas desafiadoras de OCR. Card de modelo
DeepSeek R1 (0528) Idioma Uma versão do modelo DeepSeek R1 da DeepSeek. Card de modelo
DeepSeek-V3.1 Idioma O modelo híbrido do DeepSeek que oferece suporte ao modo de raciocínio e ao modo sem raciocínio. Card de modelo
DeepSeek-V3.2 Idioma O modelo do DeepSeek que harmoniza alta eficiência computacional com raciocínio superior e desempenho do agente. Card de modelo
Gemma 4 26B A4B IT Idioma A família de modelos abertos do Google criada pelo Google DeepMind. Card de modelo
GLM 4.7 Linguagem, código O modelo do GLM projetado para programação normal ou vibe coding, uso de ferramentas e raciocínio complexo. Card de modelo
GLM 5 Linguagem, código O modelo do GLM para engenharia de sistemas complexos e tarefas de agentes de longo prazo. Card de modelo
gpt-oss 120B Idioma Um modelo de 120B que oferece alta performance em tarefas de raciocínio. Card de modelo
gpt-oss 20B Idioma Um modelo de 20B otimizado para eficiência e implantação em hardware de consumo e de borda. Card de modelo
Kimi K2 Thinking Idioma Um modelo de agente de raciocínio de código aberto que raciocina passo a passo e usa ferramentas para resolver problemas complexos. Card de modelo
Llama 3.3 Idioma O Llama 3.3 é um modelo de texto de 70B ajustado por instrução que oferece performance aprimorada em relação ao Llama 3.1 70B e ao Llama 3.2 90B quando usado para aplicativos somente de texto. Além disso, para alguns aplicativos, o Llama 3.3 70B se aproxima da performance do Llama 3.1 405B. Card de modelo
Llama 4 Maverick 17B-128E Linguagem, visão O maior e mais capaz modelo Llama 4 que tem recursos de programação, raciocínio e imagem. O Llama 4 Maverick 17B-128E é um modelo multimodal que usa a arquitetura de combinação de especialistas (MoE) e a fusão antecipada. Card de modelo
Llama 4 Scout 17B-16E Linguagem, visão O Llama 4 Scout 17B-16E oferece resultados de alta performance para a sua classe de tamanho, superando outros modelos abertos e proprietários em vários benchmarks. O Llama 4 Scout 17B-16E é um modelo multimodal que usa a arquitetura de combinação de especialistas (MoE) e a fusão antecipada. Card de modelo
MiniMax M2 Linguagem, código Projetado para tarefas de agente e relacionadas a código com recursos avançados no planejamento e execução de tarefas complexas de chamada de ferramentas. Card de modelo
Qwen3 235B Idioma Um modelo de peso aberto com um recurso de "raciocínio híbrido" para alternar entre raciocínio metódico e conversa rápida. Card de modelo
Qwen3 Coder Linguagem, código Um modelo de peso aberto desenvolvido para tarefas avançadas de desenvolvimento de software. Card de modelo
Qwen3-Next-80B Instruct Linguagem, código Um modelo da família de modelos Qwen3-Next, especializado em seguir comandos específicos. Card de modelo
Qwen3-Next-80B Thinking Linguagem, código Um modelo da família de modelos Qwen3-Next, especializado em solução de problemas complexos e raciocínio profundo. Card de modelo

Os seguintes modelos de embedding abertos são oferecidos como APIs gerenciadas no Model Garden da Plataforma de Agentes do Gemini Enterprise (MaaS):

Nome do modelo Descrição Dimensões de saída Comprimento máximo da sequência Idiomas de texto compatíveis Guia de início rápido
multilingual-e5-small Parte da família de modelos de embedding de texto E5. A variante pequena contém 12 camadas. Até 384 512 tokens Idiomas aceitos Card de modelo
multilingual-e5-large Parte da família de modelos de embedding de texto E5. A variante grande contém 24 camadas. Até 1024 512 tokens Idiomas aceitos Card de modelo

Conformidade regulatória de modelos abertos

As certificações da IA generativa na Plataforma de Agentes do Gemini Enterprise continuam sendo aplicadas quando modelos abertos são usados como uma API gerenciada usando a Plataforma de Agentes do Gemini Enterprise. Se você precisar de detalhes sobre os modelos, mais informações podem ser encontradas no card de modelo respectivo ou entre em contato com o editor do modelo.

Seus dados são armazenados em repouso na região ou multirregião selecionada para modelos abertos na Gemini Enterprise Agent Platform, mas a regionalização do tratamento de dados pode variar. Para uma lista detalhada dos compromissos de tratamento de dados de modelos abertos, consulte Residência de dados para modelos abertos.

Os comandos do cliente e as respostas do modelo não são compartilhados com terceiros ao usar a API Gemini Enterprise, incluindo modelos abertos. O Google só trata os dados do cliente conforme instruído por ele, o que é descrito com mais detalhes no nosso Aditivo sobre tratamento de dados do Cloud.

O armazenamento em cache de contexto

O armazenamento em cache de contexto ajuda a reduzir o custo e a latência das solicitações de modelos abertos que contêm conteúdo repetido. Isso é ativado apenas ao usar o tráfego de pagamento por uso e não oferece suporte a outros tipos de tráfego, como capacidade de processamento provisionada e em lote.

O tipo de armazenamento em cache com suporte é o implícito, que é o armazenamento automático ativado em todos os Google Cloud projetos por padrão e oferece um desconto de 90% nos tokens armazenados em cache em comparação com os tokens de entrada padrão quando ocorrem acertos de cache. Com esse tipo de armazenamento em cache, você não define nem chama os caches explicitamente. Em vez disso, nosso back-end extrai desses caches quando o contexto repetido é detectado.

Modelos compatíveis

  • qwen3-coder-480b-a35b-instruct-maas
  • kimi-k2-thinking-maas
  • minimax-m2-maas
  • gpt-oss-20b-maas
  • deepseek-v3.1-maas
  • deepseek-v3.2-maas
  • gemma-4-26b-a4b-it-maas

O cachedContentTokenCount campo nos metadados da resposta indica o número de tokens na parte armazenada em cache da entrada. As solicitações de armazenamento em cache precisam conter um mínimo de 4.096 tokens. Esse mínimo está sujeito a mudanças durante a visualização.

Quando ativadas, as economias de custo de ocorrência em cache implícitas são transmitidas automaticamente para você. Os acertos de cache não são garantidos e dependem das solicitações enviadas e de outros fatores. Para aumentar as chances de uma ocorrência em cache implícita, tente o seguinte:

  • Coloque conteúdos grandes e comuns no início do comando.
  • Envie solicitações com um prefixo semelhante em um curto período.

A seguir