Cluster erstellen
Voraussetzungen:
Name:Der Clustername muss mit einem Kleinbuchstaben beginnen und darf maximal 51 Kleinbuchstaben, Ziffern und Bindestriche enthalten. Er darf nicht mit einem Bindestrich enden.
Clusterregion:Sie müssen eine Compute Engine-Region für den Cluster angeben, z. B.
us-east1odereurope-west1, um Clusterressourcen wie VM-Instanzen und in Cloud Storage gespeicherte Clustermetadaten innerhalb der Region zu isolieren.- Weitere Informationen zu Compute Engine-Regionen finden Sie unter Clusterregion.
- Informationen zum Auswählen von Regionen finden Sie unter Verfügbare Regionen und Zonen. Sie können auch den Befehl
gcloud compute regions listausführen, um eine Liste der verfügbaren Regionen anzuzeigen.
Verbindung: Compute Engine-VM-Instanzen (VMs) in einem Managed Service for Apache Spark-Cluster, die aus Master- und Worker-VMs bestehen, erfordern vollständige interne IP-Netzwerkverbindungen. Das
defaultVPC-Netzwerk bietet diese Verbindung (siehe Netzwerkkonfiguration für Managed Service for Apache Spark-Cluster).Maschinentyp (empfohlen): Die Angabe eines Maschinentyps ist optional. Google empfiehlt jedoch, explizit einen Maschinentyp für die Master- und Worker-VMs in Ihrem Cluster auszuwählen. Wenn Sie keinen Maschinentyp angeben, wählt Managed Service for Apache Spark Maschinentypen dynamisch basierend auf der Ressourcenverfügbarkeit aus. Diese dynamische Auswahl kann zu Abweichungen bei Kosten und Leistung führen.
- Weitere Informationen zur Auswahl eines Maschinentyps finden Sie unter Unterstützte Maschinentypen.
- Um potenzielle Probleme mit der Ressourcenverfügbarkeit zu vermeiden, empfehlen wir die Verwendung flexibler VMs, mit denen Sie eine Liste akzeptabler Maschinentypen angeben können.
Console
Öffnen Sie die Google Cloud Console Seite „Cluster erstellen“ , um die Standardeinstellungen für den Cluster anzuzeigen. Sie können die angezeigten Standardeinstellungen bestätigen oder ändern und dann auf Zusätzliche Konfiguration klicken, um den Cluster weiter anzupassen.
Klicken Sie auf Cluster erstellen , um den Cluster zu erstellen. Der Clustername wird auf der Seite Cluster angezeigt und sein Status wird in Running aktualisiert, nachdem der Cluster bereitgestellt wurde. Klicken Sie auf den Clusternamen, um die Seite „Clusterdetails“ zu öffnen. Hier können Sie Jobs, Instanzen und Konfigurationseinstellungen für den Cluster überprüfen und eine Verbindung zu den Weboberflächen herstellen, die auf dem Cluster ausgeführt werden.
gcloud
Führen Sie zum Erstellen eines Managed Service for Apache Spark-Clusters in der Befehlszeile den Befehl gcloud dataproc clusters create lokal in einem Terminalfenster oder in Cloud Shellaus.
gcloud dataproc clusters create CLUSTER_NAME \ --region=REGION \ --master-machine-type=MASTER_MACHINE_TYPE \ --worker-machine-type=WORKER_MACHINE_TYPE
Mit dem Befehl wird ein Cluster erstellt. Die Angabe von Maschinentypen für Master und Worker ist optional. Es wird jedoch empfohlen, sie mit den Flags --master-machine-type und --worker-machine-type explizit anzugeben (z. B. n4-standard-4), um einheitliche Kosten und Leistung zu gewährleisten. Wenn Sie keine Maschinentypen angeben, werden Standardmaschinentypen dynamisch basierend auf der Ressourcenverfügbarkeit ausgewählt. Weitere Informationen dazu, wie Sie mit Befehlszeilen-Flags Clustereinstellungen anpassen können, finden Sie im Befehl
gcloud dataproc clusters create.
Erstellen Sie einen Cluster mit einer YAML-Datei
- Führen Sie den folgenden
gcloud-Befehl aus, um die Konfiguration eines vorhandenen Managed Service for Apache Spark-Clusters in einecluster.yaml-Datei zu exportieren.gcloud dataproc clusters export EXISTING_CLUSTER_NAME \ --region=REGION \ --destination=cluster.yaml
- Erstellen Sie einen neuen Cluster. Dazu importieren Sie die Konfiguration der YAML-Datei.
gcloud dataproc clusters import NEW_CLUSTER_NAME \ --region=REGION \ --source=cluster.yaml
**Hinweis** : Während des Exportvorgangs werden clusterspezifische Felder (z. B. der Clustername), Nur-Ausgabe-Felder und automatisch angewendete Labels gefiltert. Diese Felder sind in der importierten YAML-Datei, die zum Erstellen eines Clusters verwendet wurde, nicht zulässig.
REST
In diesem Abschnitt wird beschrieben, wie Sie einen Cluster erstellen. Die Angabe von Maschinentypen ist optional. Es wird jedoch empfohlen, machine_type_uri explizit in master_config und worker_config anzugeben (z. B. n4-standard-4), um einheitliche Kosten und Leistung zu gewährleisten. Wenn Sie keine Maschinentypen angeben, werden Standardmaschinentypen dynamisch basierend auf der Ressourcenverfügbarkeit ausgewählt.
Ersetzen Sie folgende Werte in den Anfragedaten:
- CLUSTER_NAME: Clustername
- PROJECT: Google Cloud Projekt-ID
- REGION: Eine verfügbare Compute Engine Region, in der der Cluster erstellt wird.
- ZONE: Eine optionale Zone innerhalb der ausgewählten Region, in der der Cluster erstellt wird.
- MASTER_MACHINE_TYPE: (Empfohlen) Der Maschinentyp für den Master-Knoten (z. B.
n4-standard-4). - WORKER_MACHINE_TYPE: (Empfohlen) Der Maschinentyp für Worker-Knoten (z. B.
n4-standard-4).
HTTP-Methode und URL:
POST https://dataproc.googleapis.com/v1/projects/PROJECT/regions/REGION/clusters
JSON-Text der Anfrage:
{
"project_id":"PROJECT",
"cluster_name":"CLUSTER_NAME",
"config":{
"master_config":{
"num_instances":1,
"machine_type_uri":"MASTER_MACHINE_TYPE",
"image_uri":""
},
"softwareConfig": {
"imageVersion": "",
"properties": {},
"optionalComponents": []
},
"worker_config":{
"num_instances":2,
"machine_type_uri":"WORKER_MACHINE_TYPE",
"image_uri":""
},
"gce_cluster_config":{
"zone_uri":"ZONE"
}
}
}
Wenn Sie die Anfrage senden möchten, maximieren Sie eine der folgenden Optionen:
Sie sollten eine JSON-Antwort ähnlich wie diese erhalten:
{
"name": "projects/PROJECT/regions/REGION/operations/b5706e31......",
"metadata": {
"@type": "type.googleapis.com/google.cloud.dataproc.v1.ClusterOperationMetadata",
"clusterName": "CLUSTER_NAME",
"clusterUuid": "5fe882b2-...",
"status": {
"state": "PENDING",
"innerState": "PENDING",
"stateStartTime": "2019-11-21T00:37:56.220Z"
},
"operationType": "CREATE",
"description": "Create cluster with 2 workers",
"warnings": [
"For PD-Standard without local SSDs, we strongly recommend provisioning 1TB ...""
]
}
}
Go
- Installieren Sie die Clientbibliothek.
- Richten Sie Standardanmeldedaten für Anwendungen ein.
- Führen Sie den Code aus.
Hinweis:Die Angabe von Maschinentypen ist optional. Es wird jedoch empfohlen, die Maschinentypen für Master und Worker in der Clusterkonfiguration explizit festzulegen (z. B. auf
n4-standard-4), um einheitliche Kosten und Leistung zu gewährleisten. Wenn Sie keine Maschinentypen angeben, werden Standardmaschinentypen dynamisch basierend auf der Ressourcenverfügbarkeit ausgewählt.
Java
- Installieren Sie die Clientbibliothek.
- Richten Sie Standardanmeldedaten für Anwendungen ein.
- Führen Sie den Code aus.
Hinweis:Die Angabe von Maschinentypen ist optional. Es wird jedoch empfohlen, die Maschinentypen für Master und Worker in der Clusterkonfiguration explizit festzulegen (z. B. auf
n4-standard-4), um einheitliche Kosten und Leistung zu gewährleisten. Wenn Sie keine Maschinentypen angeben, werden Standardmaschinentypen dynamisch basierend auf der Ressourcenverfügbarkeit ausgewählt.
Node.js
- Installieren Sie die Clientbibliothek.
- Richten Sie Standardanmeldedaten für Anwendungen ein.
- Führen Sie den Code aus.
Hinweis:Die Angabe von Maschinentypen ist optional. Es wird jedoch empfohlen, die Maschinentypen für Master und Worker in der Clusterkonfiguration explizit festzulegen (z. B. auf
n4-standard-4), um einheitliche Kosten und Leistung zu gewährleisten. Wenn Sie keine Maschinentypen angeben, werden Standardmaschinentypen dynamisch basierend auf der Ressourcenverfügbarkeit ausgewählt.
Python
- Installieren Sie die Clientbibliothek.
- Richten Sie Standardanmeldedaten für Anwendungen ein.
- Führen Sie den Code aus.
Hinweis:Die Angabe von Maschinentypen ist optional. Es wird jedoch empfohlen, die Maschinentypen für Master und Worker in der Clusterkonfiguration explizit festzulegen (z. B. auf
n4-standard-4), um einheitliche Kosten und Leistung zu gewährleisten. Wenn Sie keine Maschinentypen angeben, werden Standardmaschinentypen dynamisch basierend auf der Ressourcenverfügbarkeit ausgewählt.