Componente Pig opcional de Managed Service for Apache Spark

Puedes instalar componentes adicionales, como Apache Pig, cuando creas un clúster de Managed Service para Apache Spark con la función de componentes opcionales. En esta página, se describe el componente de Pig, una plataforma de código abierto para analizar grandes conjuntos de datos.

Instala el componente

Instala el componente cuando crees un clúster de Managed Service para Apache Spark.

Apache Pig es un componente opcional en Managed Service para Apache Spark 2.3 y versiones de imagen posteriores.

Consulta las versiones compatibles de Managed Service para Apache Spark para conocer las versiones de los componentes incluidas en las versiones más recientes de la imagen de Managed Service para Apache Spark.

Consola deGoogle Cloud

  1. En la consola de Google Cloud , abre la página Crear clúster.
  2. Haz clic en Configuración adicional para expandir esa sección.
  3. Edita Componentes opcionales.
  4. En el panel que se abre, selecciona la casilla de verificación de Pig y, luego, haz clic en Guardar.

gcloud CLI

Para crear un clúster de Managed Service para Apache Spark que incluya el componente de Pig, usa el comando gcloud dataproc clusters create CLUSTER_NAME con la marca --optional-components (con la versión 2.3 o posterior de la imagen).

gcloud dataproc clusters create CLUSTER_NAME \
    --region=REGION \
    --optional-components=PIG \
    --image-version=2.3 \
    ... other flags

API de REST

El componente de Pig se puede especificar a través de la API de Dataproc con SoftwareConfig.Component como parte de una solicitud clusters.create.