Für Arbeitslasten aus den Bereichen künstliche Intelligenz (KI), maschinelles Lernen (ML) und Hochleistungs-Computing (HPC) müssen Sie häufig ein benutzerdefiniertes Image erstellen, das zusätzliche Softwarepakete enthält und für optimale Leistung optimiert ist. Sie können jetzt Advanced Compute Images verwenden, um eine optimierte Umgebung für Ihre KI/ML- oder HPC-Arbeitslasten einzurichten.
Advanced Compute Images bieten einen standardisierten Image-Stack für die KI/ML- und HPC-Infrastruktur. Mit diesen Images müssen Sie keine benutzerdefinierten Images für KI/ML- und HPC-Arbeitslasten mehr manuell erstellen.
Vorteile
Advanced Compute Images bieten folgende Vorteile:
- Compute-Instanzen sind standardmäßig für KI/ML- oder HPC-Arbeitslasten bereit. Sie müssen die Leistung nicht manuell abstimmen, keine Instanzneustarts verwalten, keine Slurm-Agents installieren oder mit den neuesten Google Cloud Updates für eng gekoppelte KI/ML- oder HPC-Arbeitslasten auf dem Laufenden bleiben.
- Konsistente, reproduzierbare Leistung. Die Image-Standardisierung ermöglicht eine konsistente, reproduzierbare Leistung auf Anwendungsebene.
Arten von Advanced Compute Images
Advanced Compute Images enthalten mehrere Konfigurationsebenen, um die Ausführung von KI/ML- und HPC-Arbeitslasten zu unterstützen.
- Betriebssystemkonfigurationen: Dazu gehören das Deaktivieren automatischer Updates, das Festlegen von für HPC optimierten ulimits, das Optimieren von Kernel-Sysctl-Parametern und das Konfigurieren von Sicherheitseinstellungen wie SELinux.
- Netzwerkoptimierung: Enthält die erforderlichen Skripts für die Netzwerkoptimierung, z. B. zum Aktivieren des Multi-Queue-Dienstes.
- Google Cloud Integration: Installiert und konfiguriert die Google Cloud CLI und den Ops-Agent.
- Container-Tools: Installiert und konfiguriert alle containerbezogenen Software,
einschließlich:
- Docker
- NVIDIA Container Toolkit (Version 1.19.0-1)
- NVIDIA Enroot
- NVIDIA Pyxis
- NVIDIA: Installiert die folgenden Tools:
- NVIDIA CUDA Toolkit, version 13.0
- NVIDIA Data Center GPU Manager (DCGM) , Version 4
- NVIDIA Fabric Manager
- NCCL/gIB-Plug-in
- MPI: Installiert die Message Passing Interface-Bibliotheken (MPI). Installiert Open MPI auf Ubuntu-basierten Images.
- Slurm: Installiert die Kernkomponenten, die zum Erstellen eines
Slurm-Clusterknotens erforderlich sind, einschließlich:
- Slurm-Binärdateien (Version 25.11)
- Munge für die Authentifizierung
- PMIx für die Prozessverwaltung
- JSON Web Token (JWT)
Bibliothek (
libjwt)
- Dateisystemclients: Installiert clientseitige Tools für den Zugriff auf verschiedene
Dateisysteme, z. B. Cloud Storage FUSE, NFS-Dienstprogramme (
nfs-utils) und den Lustre-Client. - Entwicklertools: Installiert gängige Entwicklungs- und Debugging-Toolchains und -Dienstprogramme, z. B.:
- Umgebungsverwaltung: Installiert und konfiguriert Tools zur Umgebungsverwaltung, hauptsächlich Lmod, und richtet die erforderlichen Profilskripts ein, damit der Befehl „module“ für Nutzer verfügbar ist.
Unterstützte Hardware- und Image-Familien
Advanced Compute Images unterstützen GPU-Arbeitslasten und haben die folgenden Merkmale:
- Sind für NVIDIA-Beschleuniger optimiert
- Unterstützen Ubuntu LTS 22.04 und Ubuntu LTS 24.04
- Werden mit vorintegrierten CUDA- und NVIDIA-Treibern geliefert
- Sind für KI-, ML- oder HPC-Arbeitslasten geeignet
- Sind die Standard-Images, die installiert werden, wenn Sie Slurm-Cluster-Blueprints für die Maschinentypen A4X, A4 und A3 Ultra im Cluster Toolkit bereitstellen
| Hardware | Betriebssystem | Orchestrator | Features | Architektur | Unterstützte Maschinenserien | Image-Familie |
|---|---|---|---|---|---|---|
| GPU | Ubuntu LTS 22.04 | Slurm 25.11 |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
AMD x86_64 | A4 | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
Arm64 | A4X | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-arm64 |
| GPU | Ubuntu LTS 22.04 | Keine |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2204-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 24.04 | Keine |
|
AMD x86_64 | A3 Ultra, A4 | aci-gpu-u2404-cuda-130-nvidia-580-amd64 |
Vorinstallierte Pakete (oder RPMs)
Advanced Compute Images enthalten eine Vielzahl von Tools, Bibliotheken, Treibern und RPMs, die vorinstalliert sind. Eine Liste der für ein Image installierten Komponenten finden Sie in der Manifestdatei für dieses Image.
Die Manifestdatei finden Sie unter /usr/share/google/manifest.txt.
Preise
Advanced Compute Images sind ohne zusätzliche Kosten verfügbar. Da Advanced Compute Images auf Compute Engine ausgeführt werden, können Kosten für Compute Engine-Ressourcen wie vCPUs, GPUs, TPUs, Festplatten und Arbeitsspeicher anfallen. Weitere Informationen finden Sie unter Preise für Compute Engine.
Nächste Schritte
- Instanz mit Advanced Compute Images erstellen
Informationen zum Bereitstellen von schlüsselfertigen Slurm-Cluster-Blueprints mit Advanced Compute Images: