Componente Pig opcional do Managed Service for Apache Spark

É possível instalar outros componentes, como o Apache Pig ao criar um cluster do Serviço Gerenciado para Apache Spark usando o recurso Componentes opcionais. Esta página descreve o componente Pig, uma plataforma de código aberto para analisar grandes conjuntos de dados.

Instalar o componente

Instale o componente ao criar um cluster do Serviço Gerenciado para Apache Spark.

O Apache Pig é um componente opcional no Serviço Gerenciado para Apache Spark 2.3 e versões de imagem mais recentes.

Consulte as versões compatíveis do Serviço Gerenciado para Apache Spark para conferir as versões de componentes incluídas nas versões de imagem mais recentes do Serviço Gerenciado para Apache Spark.

Google Cloud Console do

  1. Noconsole, abra a página Criar cluster. Google Cloud
  2. Clique em Configuração adicional para expandir essa seção.
  3. Edite Componentes opcionais.
  4. No painel que é aberto, selecione a caixa de seleção para Pig, e clique em Salvar.

CLI gcloud

Para criar um cluster do Serviço Gerenciado para Apache Spark que inclua o componente Pig, use o gcloud dataproc clusters create CLUSTER_NAME comando com a flag --optional-components (usando a versão de imagem 2.3 ou mais recente).

gcloud dataproc clusters create CLUSTER_NAME \
    --region=REGION \
    --optional-components=PIG \
    --image-version=2.3 \
    ... other flags

API REST

O componente Pig pode ser especificado por meio da API Dataproc usando SoftwareConfig.Component como parte de uma clusters.create.