Projete a infraestrutura de IA com o Compute Advisor

Este documento explica como planejar e projetar suas instâncias ou cluster de GPU solicitando o Compute Advisor, uma interface com tecnologia de IA que é alimentada pelo Gemini. Para saber mais sobre os componentes que você precisa configurar antes ou durante a criação de um cluster, consulte Planejar e criar sua infraestrutura de IA.

O Compute Advisor ajuda a avaliar opções de hardware, estimar custos de implantação e conferir as configurações recomendadas para seus clusters. Para personalizar as recomendações, o Compute Advisor avalia seu Google Cloud projeto verificando os limites de cota, as reservas atuais, os descontos por compromisso de uso (CUDs), a região e a zona padrão, e todas as restrições de local do recurso. Ao usar o Compute Advisor para ajudar no planejamento, você pode alcançar uma configuração ideal para sua carga de trabalho antes de criar ou modificar um cluster.

Limitações

Ao solicitar o Compute Advisor no Google Cloud console, não é possível criar, modificar ou excluir recursos diretamente.

Antes de começar

Quando você usa o Google Cloud console para acessar Google Cloud serviços e APIs, não é necessário configurar a autenticação.

Funções exigidas

Para receber as permissões necessárias para acessar e solicitar o Gemini, peça ao administrador para conceder a você o papel do IAM de Leitor do diretor de cluster (roles/hypercomputecluster.viewer) no projeto. Para mais informações sobre a concessão de papéis, consulte Gerenciar o acesso a projetos, pastas e organizações.

Esse papel predefinido contém as permissões necessárias para acessar e solicitar o Gemini. Para acessar as permissões exatas que são necessárias, expanda a seção Permissões necessárias:

Permissões necessárias

As permissões a seguir são necessárias para acessar e solicitar o Gemini:

  • Para conferir uma lista de clusters: hypercomputecluster.clusters.list

Essas permissões também podem ser concedidas com papéis personalizados ou outros papéis predefinidos.

Acessar o Compute Advisor no Google Cloud console do

Para acessar o Compute Advisor no Google Cloud console do, siga estas etapas:

  1. No Google Cloud console do, acesse a página Compute Advisor.

    Acessar o Compute Advisor

  2. Quando a página estiver pronta, você poderá conferir o seguinte:

    Elementos da interface da página do Compute Advisor.

    Os elementos da interface exibidos na captura de tela anterior são os seguintes:

    • Painel lateral do histórico de conversas: mostra seus chats recentes. Você pode interagir com esse painel da seguinte maneira:

      • Para iniciar uma nova conversa, clique em Novo chat.

      • Para retomar uma conversa recente, na seção Chats recentes , clique na conversa.

      • Para conferir uma lista de todas as conversas, clique em Ver tudo. Na página Meu histórico , você pode conferir os detalhes de uma conversa anterior e retomá-la ou excluir conversas se não precisar mais delas.

    • Cartões de comandos de ação rápida: um conjunto de cartões que contêm um comando de exemplo. Se você clicar em um cartão, o Google Cloud console vai preencher automaticamente a caixa de comandos com o comando de exemplo.

    • Caixa de comandos: esse campo permite inserir e enviar comandos. Para enviar um comando, clique em Enviar comando.

Solicitar o Compute Advisor

Depois de enviar um comando, o Compute Advisor começa a gerar uma resposta. Um painel aparece e Google Cloud o console mostra a resposta a seu comando no painel, conforme mostrado na captura de tela a seguir:

Resposta de recomendação gerada no painel do Compute Advisor.

Com base no comando, o painel de respostas inclui os seguintes elementos:

  • Fundamentação contextual: o Compute Advisor avalia automaticamente o contexto do projeto para oferecer recomendações altamente personalizadas, incluindo limites de cota, reservas atuais, CUDs, região e zona padrão e todas as restrições de local do recurso.

  • Snippets de código interativos: o Compute Advisor gera comandos gcloud, métodos da API REST ou recursos do Terraform. Você pode copiar e colar esses snippets de código ou executá-los no Cloud Shell.

  • Canvas visual: o Compute Advisor organiza as recomendações em tabelas estruturadas e comparações lado a lado. Essa visualização ajuda a avaliar recursos do produto e abordagens arquitetônicas. Ela também fornece um plano de implementação para seu caso de uso.

As seções a seguir descrevem as práticas recomendadas para escrever comandos e exemplos de comandos que podem ser usados antes de criar ou modificar um cluster.

Práticas recomendadas para comandos

Para receber as recomendações mais precisas e práticas do Compute Advisor, recomendamos que você estruture seus comandos da mesma forma que um bloco de código. Essa abordagem orienta a IA generativa usando declarações de parâmetros claras, definições de papéis, instruções específicas e formatos de saída explícitos.

Ao solicitar o Compute Advisor, considere as seguintes práticas recomendadas:

  • Foco no design e no planejamento: recomendamos que você não solicite o Compute Advisor para solucionar erros de cluster. Para resolver esses erros, consulte Solução de problemas na criação, atualização e exclusão de instâncias de computação.

  • Especificar uma persona ou papel: declare um papel ou persona de destino, como um administrador de TI, pesquisador de IA ou engenheiro de plataforma, para o Compute Advisor adotar. Essa abordagem orienta o tom, a profundidade e o nível de especialização das recomendações resultantes.

  • Fornecer instruções explícitas e numeradas: divida seu objetivo em perguntas ou tarefas concretas e passo a passo. Essa abordagem estrutura o processo de raciocínio do Compute Advisor e ajuda a garantir que ele atenda a todos os seus requisitos.

  • Definir um formato de saída específico: declare explicitamente como você quer que a recomendação seja formatada, como uma explicação detalhada, uma tabela de comparação do Markdown ou um bloco de código gcloud pronto para uso.

  • Aproveitar a fundamentação automática do contexto: não é necessário incluir a região ou zona padrão, as cotas disponíveis, os CUDs ou as restrições de local do recurso no comando. O Compute Advisor pode acessar estas informações no seu Google Cloud projeto.

  • Refinar seus designs de forma iterativa: você pode modificar ou expandir a resposta gerada pelo Compute Advisor enviando novos comandos. Por exemplo, você pode pedir ao assistente para adicionar recomendações de rede ao plano de implantação ou modificar os requisitos de armazenamento sem iniciar uma nova conversa.

Exemplos de comandos

A seguir, confira exemplos de comandos que podem ajudar você a projetar e otimizar seu cluster:

  • Topologia de cluster e estratégia de posicionamento: para determinar o modelo de implantação e a política de posicionamento ideais para uma carga de trabalho de IA de alta performance, use um comando como o seguinte:

    Act as an AI researcher. I need to design a GPU cluster topology in
    Cluster Director to train a foundation large language model that
    maximizes ML goodput and secures accelerator capacity. Please provide the
    following:
    
    1. A comparison of clustered GPU machine series across available regions.
    2. An explanation of how compact placement policies and workload policies
       reduce network latency and boost goodput.
    3. The optimal configuration for future reservations in
       AI Hypercomputer to secure capacity for this workload.
    
    Format the comparison as a Markdown table, and provide the deployment steps
    as a ready-to-use gcloud code block.
    
  • Modelo de provisionamento e otimização de custos: para avaliar modelos de provisionamento e reduzir os custos de processamento em lote, use um comando como o seguinte:

    Act as an IT administrator. I need to select the most cost-effective
    consumption option to run large fault-tolerant AI batch jobs on clusters in
    Cluster Director without data loss. Please provide the following:
    
    1. A cost and availability comparison of Flex-start VMs against
       Spot VMs for AI workloads.
    
    2. An explanation of how atomic allocation in Flex-start VMs
       provisions all accelerator nodes at the exact same time.
    
    3. A cluster configuration with checkpoint storage to save model state
       before Compute Engine reclaims a Spot VM.
    
    Format the comparison as a Markdown table, and provide the configuration
    steps to complete in the Google Cloud console.
    

A seguir