Terminología

Los siguientes términos se aplican a AI Hypercomputer.

Acelerador
Es un dispositivo de hardware especializado, como una GPU o una TPU, diseñado para realizar tareas específicas, como cargas de trabajo de aprendizaje automático, de manera más eficiente que un procesador de uso general.

Bloque
Es una colección de subbloques interconectados por una red de alta velocidad que no bloquea y que proporciona un ancho de banda alto para todas las máquinas host del bloque.

Clúster
Es una colección de bloques interconectados por una estructura de red de alta velocidad. Cada clúster es único a nivel global. Para las máquinas A4X, A4, A3 Ultra, A3 Mega y A3 High (8 GPUs), un clúster proporciona una estructura de red común que no bloquea para tus bloques de capacidad de acelerador. Dentro de un clúster, la comunicación entre nodos (tráfico de este a oeste ) no bloquea toda la colección de bloques.

GPU en clúster
Es una categoría de familias de máquinas para GPUs, incluidas A4X, A4, A3 Ultra, A3 Mega y A3 High (8 GPUs). Las GPUs en clúster permiten que los equipos implementen y escalen miles de aceleradores interconectados como un solo sistema estrechamente acoplado mediante el uso de estructuras de redes especializadas y mantenimiento sincronizado. Son ideales para cargas de trabajo que requieren sincronización extrema de procesamiento, memoria y redes de alta velocidad. Entre los casos de uso comunes, se incluyen los modelos de base de entrenamiento previo con billones de parámetros, la entrega de modelos de vanguardia y las simulaciones para el descubrimiento de fármacos.

Mantenimiento emergentelink
A veces, se lo denomina mantenimiento de emergencia. Es un evento de mantenimiento no planificado causado por un problema crítico de hardware, software o seguridad. Para los tipos de máquinas aceleradoras compatibles, el mantenimiento emergente proporciona una notificación anticipada en lugar de una interrupción inmediata. Esta notificación te da tiempo para drenar tus cargas de trabajo de forma correcta y, de manera opcional, activar la reparación antes de que el sistema finalice las VMs.

GPU general
Es una categoría de familias de máquinas de GPU, incluidas G2, G4, A2, N1+T4 y A3 Edge. Las GPUs generales permiten que los equipos implementen y escalen aceleradores NVIDIA con autonomía operativa completa, sin pasar por la complejidad arquitectónica de los clústeres de supercomputación coordinados. Son ideales para cargas de trabajo que priorizan la alta disponibilidad, el aprovisionamiento de autoservicio y el escalamiento independiente. Entre los casos de uso comunes, se incluyen la inferencia en tiempo real, RAG, la creación de prototipos y el entrenamiento de modelos pequeños a medianos.

Estructura de red
Infraestructura de red de alta velocidad que proporciona un ancho de banda alto y una latencia baja en todos los bloques y Google Cloud servicios de un clúster. La estructura usa la arquitectura de la Jupiter. Para optimizar el rendimiento, la estructura usa una red definida por software y conmutadores ópticos.

Nodo o host
Es una sola máquina de servidor física en el centro de datos. Cada host tiene recursos de procesamiento asociados, como aceleradores. La cantidad y la configuración de estos recursos de procesamiento dependen de la familia de máquinas. Las instancias de Compute Engine se aprovisionan sobre un host físico.

Un dominio NVLink, también conocido como subbloque, es la unidad central de capacidad para las máquinas A4X Max y A4X. Un dominio NVLink consta de 18 instancias A4X Max o A4X (72 GPUs) que están conectadas por un sistema NVLink de varios nodos.

Subbloque
Es un grupo de hosts y hardware de conectividad asociado que se encuentran en un solo bloque físico. En el contexto de las máquinas A4X Max y A4X, un subbloque también se conoce como dominio NVLink.

Superbloque
Es una agrupación física de máquinas interconectadas dentro de los centros de datos. Si colocas máquinas dentro de un superbloque, obtendrás el rendimiento de red extremo y la latencia de menos de un milisegundo necesarios para ejecutar cargas de trabajo de entrenamiento estrechamente acopladas.

Más información

En los siguientes documentos, se proporcionan más explicaciones sobre las terminologías que son relevantes para los temas correspondientes: