Hyperdisks an Managed Service for Apache Spark-VMs anhängen

Auf dieser Seite wird beschrieben, wie Sie Hyperdisks an VMs in einem Managed Service for Apache Spark-Cluster anhängen. Sie können die Laufwerke unabhängig für Master-, primäre Worker- und sekundäre Worker-Knotengruppen konfigurieren. Diese Laufwerke werden zusätzlich zum Bootlaufwerk und allen lokalen SSDs, die an Clusterknoten angehängt sind, an Clusterknoten angehängt.

Hinweis

  1. Melden Sie sich in Ihrem Google Cloud -Konto an. Wenn Sie mit Google Cloudnoch nicht vertraut sind, erstellen Sie ein Konto, um die Leistungsfähigkeit unserer Produkte in der Praxis sehen und bewerten zu können. Neukunden erhalten außerdem ein Guthaben von 300 $, um Arbeitslasten auszuführen, zu testen und bereitzustellen.
  2. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  3. Verify that you have the permissions required to complete this guide.

  4. Verify that billing is enabled for your Google Cloud project.

  5. Enable the Managed Service for Apache Spark API.

    Roles required to enable APIs

    To enable APIs, you need the serviceusage.services.enable permission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.

    Enable the API

  6. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  7. Verify that you have the permissions required to complete this guide.

  8. Verify that billing is enabled for your Google Cloud project.

  9. Enable the Managed Service for Apache Spark API.

    Roles required to enable APIs

    To enable APIs, you need the serviceusage.services.enable permission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.

    Enable the API

Erforderliche Rollen

Für die Ausführung der Beispiele auf dieser Seite sind bestimmte IAM-Rollen erforderlich. Abhängig von den Organisationsrichtlinien wurden diese Rollen möglicherweise bereits gewährt. Informationen zum Prüfen von Rollenzuweisungen finden Sie unter Müssen Sie Rollen zuweisen?.

Weitere Informationen zum Zuweisen von Rollen finden Sie unter Zugriff auf Projekte, Ordner und Organisationen verwalten.

Nutzerrollen

Bitten Sie Ihren Administrator, Ihnen die folgenden IAM-Rollen zuzuweisen, um die Berechtigungen zu erhalten, die Sie zum Erstellen eines Managed Service for Apache Spark-Clusters benötigen:

Dienstkontorolle

Bitten Sie Ihren Administrator, dem Compute Engine-Standarddienstkonto die IAM-Rolle Dataproc-Worker (roles/dataproc.worker) für das Projekt zuzuweisen, damit das Compute Engine-Standarddienstkonto die erforderlichen Berechtigungen zum Erstellen eines Managed Service for Apache Spark-Clusters hat.

Laufwerkseigenschaften

Angehängte Laufwerke haben die folgenden Eigenschaften:

  • Lebenszyklus: Die Lebensdauer eines angehängten Laufwerks entspricht der Lebensdauer der VM, an die es angehängt ist. Managed Service for Apache Spark erstellt das Laufwerk, wenn die VM erstellt wird, und löscht das Laufwerk, wenn die VM gelöscht wird.
  • Unveränderlichkeit: Sie können die Eigenschaften eines angehängten Laufwerks, z. B. Größe, IOPS oder Durchsatz, nach dem Erstellen des Clusters nicht mehr aktualisieren.
  • Bereitstellung und Verwendung: Managed Service for Apache Spark stellt Laufwerke unter /mnt/N bereit, wobei N eine positive Ganzzahl ist (z. B. /mnt/1, /mnt/2). HDFS- und temporäre Daten wie Shuffle-Ausgaben verwenden die angehängten Laufwerke anstelle des nichtflüchtigen Startlaufwerks.

Laufwerkkonfiguration

Sie können die folgenden Parameter für die Datenträgerkonfiguration angeben, wenn Sie Datenträger an Managed Service for Apache Spark-Clusterknoten anhängen:

  • Laufwerkstyp (erforderlich): Der Typ des Laufwerks, das an VM-Instanzen angehängt werden soll. Die folgenden Hyperdisks werden unterstützt:

    • hyperdisk-balanced
    • hyperdisk-extreme
    • hyperdisk-ml
    • hyperdisk-throughput

    Der Typ hyperdisk balanced high availability und nichtflüchtige Speicher können nicht an Clusterknoten angehängt werden.

  • Größe (optional): Die Größe des Laufwerks. Der Wert muss eine ganze Zahl sein, gefolgt von GB für Gigabyte oder TB für Terabyte. Mit 10GB wird beispielsweise ein Laufwerk mit 10 Gigabyte angehängt. Weitere Informationen finden Sie unter Größenlimits für Hyperdisk.

  • IOPs (optional): Gibt die IOPS an, die für das angehängte Laufwerk bereitgestellt werden sollen. Mit diesem Parameter wird das Limit für Datenträger-E/A-Vorgänge pro Sekunde festgelegt. Weitere Informationen finden Sie unter Standardleistungsstufen.

  • Durchsatz – optional: Gibt den Durchsatz an, der für das angehängte Laufwerk bereitgestellt werden soll. Mit diesem Parameter wird das Limit für den Durchsatz in MiB pro Sekunde festgelegt. Weitere Informationen finden Sie unter Standardleistungsstufen.

Laufwerke an einen Cluster anhängen

Sie können Laufwerke anhängen, wenn Sie einen Managed Service for Apache Spark-Cluster erstellen. Verwenden Sie dazu die gcloud CLI oder die Dataproc API, um die Laufwerkskonfigurationen anzugeben.

gcloud-CLI

  • Wenn Sie beim Erstellen eines Clusters Laufwerke anhängen möchten, verwenden Sie den Befehl gcloud dataproc clusters create mit dem Flag --master-attached-disks, --worker-attached-disks oder --secondary-worker-attached-disks.

  • Jedes Flag akzeptiert eine durch Semikolons getrennte Liste von Festplattenkonfigurationen. Jede Laufwerkkonfiguration ist eine durch Kommas getrennte Liste von Schlüssel/Wert-Paaren für type, size, iops und throughput (siehe Laufwerkkonfiguration).

Beispiel: Mit dem folgenden Befehl wird ein Cluster erstellt und jeder primäre Worker-Knoten erhält zwei Hyperdisks.

gcloud dataproc clusters create CLUSTER_NAME \
    --region=REGION \
    --worker-attached-disks='type=hyperdisk-balanced,size=100GB,iops=5000,throughput=200;type=hyperdisk-throughput,size=9000GB'

API

  • Wenn Sie Laufwerke anhängen möchten, fügen Sie dem diskConfig-Objekt für die Instanzgruppe masterConfig, workerConfig oder secondaryWorkerConfig ein attachedDiskConfigs-Array hinzu.

  • Geben Sie die Konfiguration im Text einer clusters.create-API-Anfrage an.

Beispiel: Das folgende JSON-Snippet zeigt ein attachedDiskConfigs-Array, mit dem zwei Hyperdisks angehängt werden:

[
  {
    "diskType": "HYPERDISK_BALANCED",
    "diskSizeGb": 100,
    "provisionedIops": 5000,
    "provisionedThroughput": 200
  },
  {
    "diskType": "HYPERDISK_THROUGHPUT",
    "diskSizeGb": 9000
  }
]