KI-Infrastruktur mit Compute Advisor entwerfen

In diesem Dokument wird erläutert, wie Sie Ihre GPU-Instanzen oder -Cluster planen und entwerfen, indem Sie den Compute Advisor verwenden. Compute Advisor ist eine KI-gestützte Schnittstelle, die auf Gemini basiert. Weitere Informationen zu den Komponenten, die Sie vor oder beim Erstellen eines Clusters konfigurieren müssen, finden Sie unter KI-Infrastruktur planen und erstellen.

Mit Compute Advisor können Sie Hardwareoptionen bewerten, Bereitstellungskosten schätzen und empfohlene Konfigurationen für Ihre Cluster ansehen. Um die Empfehlungen anzupassen, wertet Compute Advisor Ihr Google Cloud Projekt aus. Dabei werden Ihre Kontingentlimits, vorhandenen Reservierungen, Rabatte für zugesicherte Nutzung (Committed Use Discounts, CUDs), die Standardregion und ‑zone, sowie alle Einschränkungen für den Ressourcenstandortgeprüft. Wenn Sie Compute Advisor bei der Planung verwenden, können Sie eine optimale Konfiguration für Ihre Arbeitslast erreichen, bevor Sie einen Cluster erstellen oder ändern.

Beschränkungen

Wenn Sie Compute Advisor in der Google Cloud Console verwenden, können Sie keine Ressourcen direkt erstellen, ändern oder löschen.

Hinweis

Wenn Sie über die Google Cloud Console auf Google Cloud Dienste und APIs zugreifen, müssen Sie die Authentifizierung nicht einrichten.

Erforderliche Rollen

Bitten Sie Ihren Administrator, Ihnen die IAM-Rolle „Betrachter von Cluster Director (roles/hypercomputecluster.viewer)“ für das Projekt zuzuweisen, um die Berechtigungen zu erhalten, die Sie für den Zugriff auf Gemini und die Verwendung von Gemini benötigen. Weitere Informationen zum Zuweisen von Rollen finden Sie unter Zugriff auf Projekte, Ordner und Organisationen verwalten.

Diese vordefinierte Rolle enthält die Berechtigungen, die für den Zugriff auf Gemini und die Verwendung von Gemini erforderlich sind. Maximieren Sie den Abschnitt Erforderliche Berechtigungen , um die notwendigen Berechtigungen anzuzeigen, die erforderlich sind:

Erforderliche Berechtigungen

Die folgenden Berechtigungen sind für den Zugriff auf Gemini und die Verwendung von Gemini erforderlich:

  • Liste der Cluster aufrufen: hypercomputecluster.clusters.list

Sie können diese Berechtigungen auch mit benutzerdefinierten Rollen oder anderen vordefinierten Rollen erhalten.

In der Google Cloud Console auf Compute Advisor zugreifen

So greifen Sie in der Google Cloud Console auf Compute Advisor zu:

  1. Rufen Sie in der Google Cloud Console die Seite Compute Advisor auf.

    Zu Compute Advisor

  2. Wenn die Seite bereit ist, können Sie Folgendes sehen:

    Elemente der Benutzeroberfläche der Compute Advisor-Seite.

    Die UI-Elemente, die im vorherigen Screenshot angezeigt werden, sind folgende:

    • Seitenleiste „Unterhaltungsverlauf“: Hier werden Ihre letzten Chats angezeigt. Sie können auf folgende Weise mit dieser Seitenleiste interagieren:

      • Wenn Sie eine neue Unterhaltung beginnen möchten, klicken Sie auf Neuer Chat.

      • Wenn Sie eine aktuelle Unterhaltung fortsetzen möchten, klicken Sie im Abschnitt Letzte Chats auf die Unterhaltung.

      • Wenn Sie eine Liste aller Unterhaltungen aufrufen möchten, klicken Sie auf Alle ansehen. Auf der Seite Mein Verlauf können Sie die Details einer früheren Unterhaltung aufrufen und sie fortsetzen oder Unterhaltungen löschen, wenn Sie sie nicht mehr benötigen.

    • Prompt-Karten für Schnellaktionen: Eine Reihe von Karten, die jeweils einen Beispiel Prompt enthalten. Wenn Sie auf eine Karte klicken, wird die Google Cloud Console automatisch mit dem Beispiel-Prompt gefüllt.

    • Prompt-Feld: In diesem Feld können Sie Prompts eingeben und senden. Klicken Sie auf Prompt senden, um einen Prompt zu senden.

Compute Advisor verwenden

Nachdem Sie einen Prompt gesendet haben, generiert Compute Advisor eine Antwort. Ein Bereich wird angezeigt und Google Cloud in derConsole wird die Antwort auf Ihren Prompt in diesem Bereich angezeigt, wie im folgenden Screenshot zu sehen:

Generierte Empfehlungsantwort im Bereich „Compute Advisor“.

Je nach Prompt enthält der Antwortbereich die folgenden Elemente:

  • Kontextbezogene Informationen: Compute Advisor wertet automatisch den Kontext Ihres Projekts aus, um hochgradig angepasste Empfehlungen zu geben, einschließlich Kontingentlimits, vorhandener Reservierungen, CUDs, Ihrer Standardregion und ‑zone sowie aller Einschränkungen für den Ressourcenstandort.

  • Interaktive Code-Snippets: Compute Advisor generiert gcloud-Befehle, REST API-Methoden oder Terraform-Ressourcen. Sie können diese Code-Snippets kopieren und einfügen oder in Cloud Shell ausführen.

  • Visuelle Canvas: Compute Advisor organisiert Empfehlungen in strukturierten Tabellen und nebeneinanderliegenden Vergleichen. Diese Ansicht hilft Ihnen, Produktfunktionen und Architekturansätze zu bewerten. Außerdem wird ein Implementierungsplan für Ihren Anwendungsfall bereitgestellt.

In den folgenden Abschnitten finden Sie Best Practices für das Schreiben von Prompts und Beispiel-Prompts, die Sie verwenden können, bevor Sie einen Cluster erstellen oder ändern.

Best Practices für Prompts

Damit Sie möglichst genaue und umsetzbare Empfehlungen von Compute Advisor erhalten, empfehlen wir, Ihre Prompts so zu strukturieren wie einen Codeblock. Dieser Ansatz führt die generative KI durch klare Parameterdeklarationen, Rollendefinitionen, spezifische Anweisungen und explizite Ausgabeformate.

Beachten Sie beim Verwenden von Compute Advisor die folgenden Best Practices:

  • Fokus auf Design und Planung: Wir empfehlen, Compute Advisor nicht zur Fehlerbehebung bei Clusterfehlern zu verwenden. Informationen zum Beheben dieser Fehler finden Sie stattdessen unter Fehlerbehebung beim Erstellen, Aktualisieren und Löschen von Compute-Instanzen.

  • Rolle oder Persona angeben: Deklarieren Sie eine Zielrolle oder Persona, z. B. einen IT-Administrator, KI-Forscher oder Plattformtechniker, die Compute Advisor annehmen soll. Dieser Ansatz bestimmt den Ton, die Tiefe und das Fachwissen der resultierenden Empfehlungen.

  • Explizite, nummerierte Anweisungen geben: Teilen Sie Ihr Ziel in konkrete, schrittweise Fragen oder Aufgaben auf. Dieser Ansatz strukturiert den Denkprozess von Compute Advisor und trägt dazu bei, dass alle Ihre Anforderungen erfüllt werden.

  • Bestimmtes Ausgabeformat definieren: Geben Sie explizit an, wie die Empfehlung formatiert werden soll, z. B. als Schritt-für-Schritt-Anleitung, als Markdown-Vergleichstabelle oder als einsatzbereiter gcloud-Code block.

  • Automatische Kontextinformationen nutzen: Sie müssen Ihre Standardregion oder ‑zone, verfügbaren Kontingente, CUDs oder Einschränkungen für den Ressourcenstandort nicht in Ihren Prompt aufnehmen. Compute Advisor kann auf diese Informationen in Ihrem Google Cloud Projekt zugreifen.

  • Designs iterativ verfeinern: Sie können die Antwort ändern oder erweitern, die von Compute Advisor generiert wurde, indem Sie neue Prompts senden. Sie können den Assistenten beispielsweise bitten, Ihrem Bereitstellungsplan Empfehlungen für die Netzwerkkonfiguration hinzuzufügen oder die Speicheranforderungen zu ändern, ohne eine neue Unterhaltung zu starten.

Prompt-Beispiele

Im Folgenden finden Sie Beispiele für Prompts, mit denen Sie Ihren Cluster entwerfen und optimieren können:

  • Clustertopologie und Platzierungsstrategie: Um das optimale Bereitstellungsmodell und die optimale Platzierungsrichtlinie für eine leistungsstarke KI-Arbeitslast zu ermitteln, verwenden Sie einen Prompt wie den folgenden:

    Act as an AI researcher. I need to design a GPU cluster topology in
    Cluster Director to train a foundation large language model that
    maximizes ML goodput and secures accelerator capacity. Please provide the
    following:
    
    1. A comparison of clustered GPU machine series across available regions.
    2. An explanation of how compact placement policies and workload policies
       reduce network latency and boost goodput.
    3. The optimal configuration for future reservations in
       AI Hypercomputer to secure capacity for this workload.
    
    Format the comparison as a Markdown table, and provide the deployment steps
    as a ready-to-use gcloud code block.
    
  • Bereitstellungsmodell und Kostenoptimierung: Um Bereitstellungsmodelle zu bewerten und die Kosten für die Batchverarbeitung zu senken, verwenden Sie einen Prompt wie den folgenden:

    Act as an IT administrator. I need to select the most cost-effective
    consumption option to run large fault-tolerant AI batch jobs on clusters in
    Cluster Director without data loss. Please provide the following:
    
    1. A cost and availability comparison of Flex-start VMs against
       Spot VMs for AI workloads.
    
    2. An explanation of how atomic allocation in Flex-start VMs
       provisions all accelerator nodes at the exact same time.
    
    3. A cluster configuration with checkpoint storage to save model state
       before Compute Engine reclaims a Spot VM.
    
    Format the comparison as a Markdown table, and provide the configuration
    steps to complete in the Google Cloud console.
    

Nächste Schritte