Este documento descreve o Collective Communication Analyzer (CoMMA), uma biblioteca para coletar telemetria da NCCL para Google Cloud serviços. A telemetria da NCCL coleta métricas de desempenho e eventos operacionais que a NCCL gera durante a execução. A NVIDIA Collective Communication Library (NCCL) acelera a comunicação de alto desempenho entre GPUs em sistemas de computação paralela e distribuída. Essa comunicação de alto desempenho é especialmente útil para aprendizado profundo e computação de alto desempenho (HPC).
Para as versões 2.23 e mais recentes da NCCL, a NVIDIA introduziu a API de plug-in do criador de perfil da NCCL, que permite que os desenvolvedores registrem callbacks de função para coletar telemetria durante as operações coletivas da NCCL. O Google oferece o Collective Communication Analyzer (CoMMA), uma biblioteca que usa a API de plug-in do criador de perfil da NCCL da NVIDIA para coletar telemetria da NCCL para Google Cloud serviços. O CoMMA é instalado e ativado automaticamente para algumas imagens, mas também é possível desativar, reativar ou instalar e ativar manualmente o CoMMA para controlar a coleta de dados.
Imagens com o CoMMA ativado
Para os tipos de máquina A4X Max, A4X, A4, A3 Ultra, A3 Mega e A3 High (8 GPUs), o CoMMA é instalado e ativado automaticamente quando você usa qualquer imagem que empacote o plug-in gIB NCCL. As imagens a seguir contêm o plug-in gIB NCCL:
- Imagens de nó do Container-Optimized OS com containerd (cos_containerd): o Google Kubernetes Engine (GKE) usa essas imagens para criar clusters do GKE Autopilot. Os binários do CoMMA estão disponíveis no diretório
/home/kubernetes/bin/gib. - Imagens de contêiner da camada de software de aprendizado profundo: use essas imagens para implantar e configurar frameworks de IA e ML e bibliotecas em clusters do GKE.
Se você usar alguma dessas imagens e quiser desativar a coleta de telemetria da NCCL pelo CoMMA, consulte Desativar o CoMMA. No entanto, o CoMMA precisa estar ativado para que recursos como a detecção de atrasados ou a detecção de cargas de trabalho sem resposta funcionem. Se você não usar essas imagens e quiser ativar o CoMMA para coletar telemetria da NCCL, consulte Instalar o CoMMA.
Benefícios
A telemetria da NCCL coletada pelo CoMMA ajuda a identificar gargalos de desempenho, especificamente atrasados, na comunicação da GPU. O CoMMA coleta dados detalhados, como histogramas de latência para operações de comunicação coletiva. Um serviço de diagnóstico pode processar e usar esses dados para identificar atrasados.
O uso do CoMMA para coletar telemetria oferece os seguintes benefícios:
Necessário para detecção de atrasados e detecção de cargas de trabalho sem resposta: o CoMMA coleta a telemetria detalhada da NCCL para identificar gargalos de desempenho ou atrasados na comunicação de GPU para GPU. O CoMMA fornece telemetria detalhada da NCCL que ajuda a identificar e resolver problemas em cargas de trabalho de treinamento de IA e ML em grande escala.
Por exemplo, o CoMMA captura o algoritmo usado nas operações da NCCL. Essas informações são valiosas para análise e ajuste de desempenho, porque algoritmos diferentes podem ter características de desempenho significativamente diferentes com base na carga de trabalho e na configuração do sistema.
O CoMMA também ajuda na solução de problemas de desempenho e erros abaixo do ideal. Ele rastreia erros originados em camadas de transporte de nível inferior, como TCP, RDMA ou estruturas de switch, de volta a coletivos específicos da NCCL e nós de inicialização. Ele pode reconhecer quando um sinal de telemetria de pulsação para de responder e rastrear possíveis causas para cargas de trabalho sem resposta.
Rastreamento de baixa sobrecarga: o CoMMA usa recursos computacionais mínimos durante a coleta ativa de telemetria da NCCL, o que o torna ideal para cargas de trabalho de machine learning sensíveis ao desempenho e de longa duração, como o treinamento de modelos de linguagem grandes (LLMs) .
Ampliar o escopo da telemetria da NCCL: o CoMMA usa a API de plug-in do criador de perfil da NCCL. Essa API coleta um escopo mais amplo de telemetria da NCCL em comparação com plug-ins baseados em transporte. Os plug-ins baseados em transporte coletam principalmente telemetria sobre o transporte de rede subjacente, incluindo transferências de dados em hardware e protocolos de rede. O plug-in do criador de perfil coleta telemetria para as operações de comunicação da NCCL, incluindo o tempo de comunicações coletivas, operações de proxy e transferências de dados.
Entender como o CoMMA funciona
Durante o tempo de execução do aplicativo, a NCCL carrega automaticamente as bibliotecas do CoMMA instaladas no local especificado pela variável de ambiente LD_LIBRARY_PATH. Em seguida, o CoMMA coleta a telemetria da NCCL, que outros serviços do Google podem usar. Também é possível exportar esses dados para o sistema de arquivos local.
A seguir
- Aprenda a ativar, desativar e configurar o CoMMA.
- Aprenda a resolver problemas com o CoMMA.
- Aprenda a detectar e resolver atrasados.
- Aprenda a detectar cargas de trabalho sem resposta.