Este documento ajuda você a otimizar o goodput, a taxa de dados úteis
transferidos, para suas cargas de trabalho. Para alcançar essa otimização, selecionamos receitas de goodput reproduzíveis que usam modelos e frameworks comuns de machine learning (ML). Para analisar esses roteiros, consulte a
organização do Hipercomputador de IA no GitHub.
As receitas de goodput foram testadas em clusters criados usando o Cluster Toolkit.
Para garantir a confiabilidade ideal da carga de trabalho e maximizar o goodput, você também pode identificar proativamente os nós em um cluster do Google Kubernetes Engine (GKE) que provavelmente vão apresentar degradação nas próximas cinco horas. Esse aviso antecipado ajuda a evitar o agendamento de novas cargas de trabalho em VMs em risco, reduzindo o risco de interrupções nos seus jobs. Para mais informações, consulte
Ativar a previsão de integridade do nó.
Antes de começar
Antes de usar as receitas de goodput neste documento, siga estas etapas, caso ainda não tenha feito isso:
[[["Fácil de entender","easyToUnderstand","thumb-up"],["Meu problema foi resolvido","solvedMyProblem","thumb-up"],["Outro","otherUp","thumb-up"]],[["Difícil de entender","hardToUnderstand","thumb-down"],["Informações incorretas ou exemplo de código","incorrectInformationOrSampleCode","thumb-down"],["Não contém as informações/amostras de que eu preciso","missingTheInformationSamplesINeed","thumb-down"],["Problema na tradução","translationIssue","thumb-down"],["Outro","otherDown","thumb-down"]],["Última atualização 2026-09-09 UTC."],[],[]]