In diesem Dokument wird beschrieben, wie Sie einen Managed Service for Apache Spark-Cluster ohne Knoten erstellen.
Managed Service for Apache Spark-Cluster ohne Knoten sind eine kostengünstige Möglichkeit, Managed Service for Apache Spark-Cluster zu verwenden. Im Gegensatz zu Standard-Managed Service for Apache Spark-Clustern , für die mindestens zwei primäre Worker erforderlich sind, verwenden Managed Service for Apache Spark-Cluster ohne Knoten nur sekundäre Worker , die auf null skaliert werden können.
Managed Service for Apache Spark-Cluster ohne Knoten eignen sich ideal für die Verwendung als Cluster mit langer Laufzeit, die Leerlaufzeiten aufweisen, z. B. ein Cluster, auf dem ein Jupiter-Notebook gehostet wird. Sie bieten eine verbesserte Ressourcennutzung durch die Verwendung von Autoscaling-Richtlinien ohne Knoten.
Merkmale und Einschränkungen
Ein Managed Service for Apache Spark-Cluster ohne Knoten ähnelt einem Standardcluster, hat aber die folgenden einzigartigen Merkmale und Einschränkungen:
- Erfordert die Image-Version
2.2.53oder höher. - Unterstützt nur sekundäre Worker, keine primären Worker.
Enthält Dienste wie YARN, unterstützt aber das HDFS-Dateisystem nicht.
- Wenn Sie Cloud Storage als Standarddateisystem verwenden möchten, legen Sie das
core:fs.defaultFSClusterattribut auf einen Cloud Storage-Bucket-Speicherort (gs://BUCKET_NAME) fest. - Wenn Sie eine Komponente während der Clustererstellung deaktivieren, deaktivieren Sie auch HDFS.
- Wenn Sie Cloud Storage als Standarddateisystem verwenden möchten, legen Sie das
Kann nicht in einen Standardcluster konvertiert werden und umgekehrt.
Erfordert eine Autoscaling-Richtlinie für
ZERO_SCALE-Clustertypen.Erfordert die Auswahl flexibler VMs als Maschinentyp.
Unterstützt die Oozie-Komponente nicht.
Kann nicht über die Google Cloud console erstellt werden.
Optional: Autoscaling-Richtlinie konfigurieren
Sie können eine Autoscaling-Richtlinie konfigurieren, um die Skalierung sekundärer Worker für einen Cluster ohne Knoten zu definieren. Beachten Sie dabei Folgendes:
- Legen Sie den Clustertyp auf
ZERO_SCALEfest. - Konfigurieren Sie eine Autoscaling-Richtlinie nur für die Konfiguration sekundärer Worker.
Weitere Informationen finden Sie unter Autoscaling-Richtlinie erstellen.
Managed Service for Apache Spark-Cluster ohne Knoten erstellen
Erstellen Sie einen Cluster ohne Knoten mit der gcloud CLI oder der Dataproc API.
gcloud
Führen Sie
gcloud dataproc clusters create
Befehl lokal in einem Terminalfenster oder in
Cloud Shellaus.
gcloud dataproc clusters create CLUSTER_NAME \
--region=REGION \
--cluster-type=zero-scale \
--autoscaling-policy=AUTOSCALING_POLICY \
--properties=core:fs.defaultFS=gs://BUCKET_NAME \
--secondary-worker-machine-types="type=MACHINE_TYPE1[,type=MACHINE_TYPE2...][,rank=RANK]"
...other args
Ersetzen Sie Folgendes:
- CLUSTER_NAME: Name des Managed Service for Apache Spark -Clusters ohne Knoten.
- REGION: eine verfügbare Compute Engine-Region.
- AUTOSCALING_POLICY: Die ID oder der Ressourcen-URI der Autoscaling-Richtlinie.
- BUCKET_NAME: Name Ihres Cloud Storage-Bucket.
- MACHINE_TYPE: Spezifischer Compute Engine
Maschinentyp, z. B.
n1-standard-4,e2-standard-8. - RANK: Definiert die Priorität einer Liste von Maschinen typen.
REST
Erstellen Sie einen Cluster ohne Knoten mit einer Managed Service for Apache Spark REST API cluster.create Anfrage:
- Legen Sie
ClusterConfig.ClusterTypefürsecondaryWorkerConfigaufZERO_SCALEfest. - Legen Sie
AutoscalingConfig.policyUrimit der ID der Autoscaling-RichtlinieZERO_SCALEfest. - Fügen Sie das
core:fs.defaultFS:gs://BUCKET_NAMESoftwareConfig.property hinzu. Ersetzen Sie BUCKET_NAME durch den Namen Ihres Cloud Storage-Bucket.
Nächste Schritte
- Weitere Informationen zum Autoscaling von Managed Service for Apache Spark.