Este documento explica os requisitos e as limitações que você aplica ao usar políticas de carga de trabalho com grupos gerenciados de instâncias (MIGs). Por padrão, você gerencia o local das instâncias do Compute Engine apenas especificando as zonas delas. Com as políticas de carga de trabalho, é possível definir o posicionamento físico e a topologia das instâncias de computação em uma zona. Essa abordagem ajuda você, por exemplo, a minimizar a latência de rede nas instâncias de computação, colocando-as mais perto umas das outras.
Só é possível aplicar políticas de carga de trabalho a MIGs que usam instâncias A4X Max, A4X, A4, A3 Ultra, A3 Mega, A3 High (8 GPUs), H4D ou TPU (TPU7x, v6e ou v5p). Se você usar instâncias A4X Max ou A4X ou criar um MIG com uma fração de TPU de vários hosts, será necessária uma política de carga de trabalho, a menos que você crie uma única instância de computação para fins de teste. Para as outras séries de máquinas compatíveis, as políticas de carga de trabalho são opcionais.
Para controlar o posicionamento de instâncias de computação que usam outras séries de máquinas, use políticas de posicionamento.
Entender as políticas de carga de trabalho
As seções a seguir descrevem casos de uso de políticas de carga de trabalho e as propriedades especificadas ao criar essas políticas.
Gerenciar o posicionamento e a topologia de instâncias de computação
Depois de criar e aplicar uma política de carga de trabalho a um MIG, as políticas de carga de trabalho ajudam você a fazer o seguinte:
Criar instâncias de computação próximas umas das outras: se houver capacidade disponível, o Compute Engine vai criar instâncias de computação próximas umas das outras. Caso contrário, o Compute Engine vai criar apenas algumas ou nenhuma das instâncias de computação solicitadas.
Ganhe visibilidade na topologia da sua instância de computação: depois de aplicar uma política de carga de trabalho com um tipo de alta capacidade de processamento (
HIGH_THROUGHPUT) a um MIG, e o MIG criar instâncias de computação, você poderá conferir a posição das instâncias de computação em relação umas às outras. Essas informações ajudam a minimizar a latência da rede e solucionar erros. Para mais informações, consulte Ver o local físico de uma instância do Compute Engine.
É possível aplicar a mesma política de carga de trabalho a vários MIGs. Quando você faz isso, o Compute Engine aplica as regras de posicionamento a cada MIG de forma independente.
A seção a seguir descreve as propriedades que você precisa especificar ao criar políticas de carga de trabalho.
Configurar propriedades da política de carga de trabalho
Ao criar uma política de carga de trabalho, especifique as seguintes propriedades:
Tipo de carga de trabalho (
type): esse campo define a meta de alto nível do cluster. Só é possível especificarHIGH_THROUGHPUT, que instrui o Compute Engine a colocar as instâncias de computação o mais próximo possível para acelerar a comunicação.Com base na série de máquinas usada pelas instâncias de computação no MIG, você pode especificar uma das seguintes propriedades:
Topologia do acelerador (
acceleratorTopology): essa propriedade ajuda você a alcançar alto desempenho para cargas de trabalho distribuídas que são executadas em várias instâncias A4X Max ou A4X ou em nós da TPU de vários hosts que usam uma configuração de rede interaceleradora especializada. Para mais informações, consulte Propriedade de topologia do acelerador.Distância máxima da topologia (
maxTopologyDistance): essa propriedade define o limite físico mais restrito para criar instâncias A4, A3 Ultra, A3 Mega, A3 High (8 GPUs) ou H4D, como o mesmo bloco ou subbloco. Se o Compute Engine não puder atender a esse limite estrito devido a erros de disponibilidade de recursos, ele criará apenas parte ou nenhuma das instâncias de computação solicitadas. Para mais informações, consulte Propriedade de distância máxima da topologia.
Propriedade da topologia do acelerador
Para alcançar um desempenho de rede não bloqueador em grande escala, o Compute Engine organiza as instâncias A4X Max e A4X em uma hierarquia física de blocos e sub-blocos.
Para criar um MIG com instâncias A4X Max ou A4X ou frações de TPU de vários hosts, aplique uma política de carga de trabalho ao MIG que especifique a propriedade de topologia do acelerador (acceleratorTopology). Essa propriedade define a configuração de rede física para uma fração de instâncias de computação. Uma fração atua como um único acelerador massivo que oferece capacidade máxima de processamento para suas cargas de trabalho distribuídas de IA ou ML.
A tabela a seguir mostra os valores de topologia do acelerador para A4X Max e A4X. Para mais informações sobre valores de topologia para frações de TPU de vários hosts, consulte Topologia de TPU.
| Valor da topologia do acelerador | Descrição | Série de máquinas compatível | Número máximo de instâncias de computação |
|---|---|---|---|
1x72 |
O Compute Engine organiza as instâncias de computação em sub-blocos densamente alocados de 18 instâncias de computação, totalizando 72 GPUs. Como cada sub-bloco exige um MIG próprio, é possível criar no máximo 18 instâncias de computação por MIG. Um bloco completo consiste em 25 MIGs, totalizando 450 instâncias de computação. | A4X Max e A4X | 18 |
Para mais informações sobre as instâncias A4X Max e A4X, consulte As séries de máquinas A4X Max e A4X.
Propriedade de distância máxima da topologia
Quando você cria e aplica uma política de carga de trabalho a um MIG, o Compute Engine
faz o possível para criar as instâncias de computação próximas umas das outras. Se você precisar de compactação máxima em uma zona, recomendamos especificar a propriedade de distância máxima da topologia (maxTopologyDistance). Um valor máximo de distância de topologia especifica a criação de instâncias A4, A3 Ultra, A3 Mega, A3 High (8 GPUs) ou H4D no mesmo cluster, bloco ou sub-bloco.
A tabela a seguir mostra os valores máximos de distância da topologia e as séries de máquinas compatíveis:
| Valor máximo da distância da topologia | Descrição | Série de máquinas compatível | Número máximo de instâncias de computação |
|---|---|---|---|
| Não especificado (não recomendado) | O Compute Engine faz o possível para colocar as instâncias de computação o mais próximo possível umas das outras, mas sem garantia de distância máxima entre as instâncias de computação em uma zona. | A4, A3 Ultra, A3 Mega, A3 High (8 GPUs) e H4D | 1.500 |
CLUSTER |
O Compute Engine cria instâncias de computação em blocos adjacentes em um cluster. | A4 e H4D | 1.500 |
BLOCK |
O Compute Engine cria instâncias de computação no mesmo bloco. | A4, A3 Ultra, A3 Mega, A3 High (8 GPUs) ou H4D |
|
SUBBLOCK |
O Compute Engine cria instâncias de computação no mesmo subbloco, minimizando a latência de rede o máximo possível. | A4, A3 Ultra e H4D | 22 |
Preços
Não há custos extras associados à criação, exclusão ou aplicação de políticas de carga de trabalho a um MIG.
Série de máquinas compatível
Só é possível aplicar políticas de carga de trabalho a MIGs com instâncias de computação que usam as seguintes combinações de série de máquinas e modelos de provisionamento:
| Série de máquina | Início flexível | Spot | Vinculada à reserva | Padrão |
|---|---|---|---|---|
| A4X Max | Não | Não | Sim | Não |
| A4X | Não | Não | Sim | Não |
| A4 | Sim | Sim | Sim | Não |
| A3 Ultra | Sim | Sim | Sim | Não |
| A3 Mega | Não | Sim | Sim | Não |
| A3 High (8 GPUs) | Não | Sim | Sim | Não |
| H4D | Sim | Sim | Sim | Não |
| TPU7x | Sim | Sim | Sim | Sim |
| TPU v6e | Sim | Sim | Sim | Sim |
| TPU v5p | Sim | Sim | Sim | Sim |
Limitações
Para políticas de carga de trabalho em MIGs, as seguintes limitações se aplicam:
Só é possível aplicar ou mudar a política de cargas de trabalho de um MIG se ele não tiver instâncias de computação.
Só é possível aplicar políticas de carga de trabalho a MIGs regionais se eles usarem as seguintes formas de destino de distribuição:
Para MIGs com um tamanho de destino:
ANYouANY_SINGLE_ZONEPara solicitações de redimensionamento de MIG:
ANY_SINGLE_ZONE
Não é possível atualizar uma política de carga de trabalho depois de criá-la.
Não é possível configurar um segundo modelo de instância se o MIG usar uma política de carga de trabalho.
Não é possível usar políticas de carga de trabalho com políticas de posicionamento.
A seguir
Saiba como criar políticas de carga de trabalho para MIGs.
Saiba como consultar as políticas de carga de trabalho.