Terminología

Se aplican las siguientes condiciones a AI Hypercomputer.

Accelerator
Un dispositivo de hardware especializado, como una GPU o TPU, diseñado para realizar tareas específicas, como cargas de trabajo de aprendizaje automático, de manera más eficiente que un procesador de uso general.

Block
Una colección de sub-bloques interconectados. Dentro de un bloque, se puede acceder a cualquier GPU a través de la estructura de red, lo que garantiza una comunicación de latencia ultrabaja para tus tareas de entrenamiento distribuido.

Cluster
Una colección de bloques interconectados unidos por una estructura de alta velocidad. La estructura de red de este a oeste sin bloqueo te permite escalar trabajos de entrenamiento masivos en miles de GPUs sin encontrar cuellos de botella de rendimiento o ancho de banda.

Clustered GPU
Una categoría de familias de máquinas para GPUs, incluidas A4X, A4, A3 Ultra, A3 Mega y A3 High (8 GPUs). Las GPUs agrupadas permiten que los equipos implementen y escalen miles de aceleradores interconectados como un solo sistema estrechamente acoplado mediante el uso de estructuras de redes especializadas y mantenimiento sincronizado. Son ideales para cargas de trabajo que requieren procesamiento extremo, memoria y sincronización de redes de alta velocidad. Los casos de uso comunes incluyen el entrenamiento previo de modelos de base con billones de parámetros, la entrega de modelos de frontera y simulaciones para el descubrimiento de fármacos.

Emergent maintenance
A veces, se conoce como mantenimiento de emergencia. Es un evento de mantenimiento no planificado causado por un problema crítico de hardware, software o seguridad. Para los tipos de máquinas aceleradoras compatibles, el mantenimiento emergente proporciona una notificación anticipada en lugar de una interrupción inmediata. Esta notificación te da tiempo para drenar tus cargas de trabajo de forma correcta y, de manera opcional, activar la reparación antes de que el sistema finalice las VMs.

General GPU
Una categoría de familias de máquinas de GPU, incluidas G2, G4, A2, N1+T4 y A3 Edge. Las GPUs generales permiten que los equipos implementen y escalen aceleradores NVIDIA con autonomía operativa completa, sin pasar por la complejidad arquitectónica de los clústeres de supercomputación coordinados. Son ideales para cargas de trabajo que priorizan la alta disponibilidad, el aprovisionamiento de autoservicio y el escalamiento independiente. Los casos de uso comunes incluyen la inferencia en tiempo real, RAG, la creación de prototipos y el entrenamiento de modelos pequeños a medianos.

Network fabric
Una estructura de red proporciona conectividad de alto ancho de banda y baja latencia en todos los bloques y Google Cloud servicios de un clúster. Jupiter es la arquitectura de red del centro de datos de Google que usa red definida por software y conmutadores de circuitos ópticos para desarrollar la red y optimizar su rendimiento.

Node or host
Una sola máquina de servidor física en el centro de datos. Cada host tiene recursos de procesamiento asociados, como aceleradores. La cantidad y la configuración de estos recursos de procesamiento dependen de la familia de máquinas. Las instancias de Compute Engine se aprovisionan sobre un host físico.

Un dominio NVLink, también conocido como sub-bloque, es la unidad central de capacidad para las máquinas A4X Max y A4X. Un dominio NVLink consta de 18 instancias A4X Max o A4X (72 GPUs) que están conectadas por un sistema NVLink de varios nodos.

Sub-block
Un grupo de hosts y hardware de conectividad asociado que se encuentran en un solo rack físico. En el contexto de las máquinas A4X Max y A4X, un sub-bloque también se conoce como dominio NVLink.

Superblock
Una agrupación física de máquinas interconectadas dentro de los centros de datos. Si colocas máquinas dentro de un superbloque, obtendrás la capacidad de procesamiento de red extrema y la latencia de sub-milisegundos necesarios para ejecutar cargas de trabajo de entrenamiento estrechamente acopladas.

Más información

En los siguientes documentos, se proporcionan más explicaciones de las terminologías que son relevantes para los temas correspondientes: