Optionale Pig-Komponente für Managed Service for Apache Spark

Sie können zusätzliche Komponenten wie Apache Pig installieren, wenn Sie einen Managed Service for Apache Spark-Cluster mit dem Feature Optionale Komponenten erstellen. Auf dieser Seite wird die Pig-Komponente beschrieben, eine Open-Source-Plattform zum Analysieren großer Datasets.

Komponente installieren

Installieren Sie die Komponente, wenn Sie einen Managed Service for Apache Spark-Cluster erstellen.

Apache Pig ist eine optionale Komponente in Managed Service for Apache Spark-Imageversionen 2.3 und höher.

Informationen zu den Komponentenversionen, die in den neuesten Managed Service for Apache Spark-Image-Releases enthalten sind, finden Sie unter Unterstützte Managed Service for Apache Spark-Versionen.

Google Cloud Console

  1. Öffnen Sie in der Google Cloud Console die Seite Cluster erstellen.
  2. Klicken Sie auf Zusätzliche Konfiguration, um den Bereich zu maximieren.
  3. Bearbeiten Sie Optionale Komponenten.
  4. Wählen Sie im angezeigten Bereich das Kästchen für Schwein aus und klicken Sie dann auf Speichern.

gcloud-CLI

Verwenden Sie zum Erstellen eines Managed Service for Apache Spark-Clusters, der die Pig-Komponente enthält, den Befehl gcloud dataproc clusters create CLUSTER_NAME mit dem Flag --optional-components (mit Image-Version 2.3 oder höher).

gcloud dataproc clusters create CLUSTER_NAME \
    --region=REGION \
    --optional-components=PIG \
    --image-version=2.3 \
    ... other flags

REST API

Die Pig-Komponente kann über die Dataproc API mit SoftwareConfig.Component als Teil einer clusters.create-Anfrage angegeben werden.