É possível instalar outros componentes, como o Trino, ao criar um cluster do Serviço Gerenciado para Apache Spark usando o recurso Componentes opcionais. Nesta página, descrevemos como instalar o componente Trino em um cluster do Serviço Gerenciado para Apache Spark.
Trino é um mecanismo de consulta SQL distribuído de código aberto. Por padrão, o servidor e a IU da Web do Trino estão disponíveis na porta 8060 (ou 7778, se o Kerberos estiver ativado) no primeiro nó mestre do cluster.
Por padrão, o Trino no Serviço Gerenciado para Apache Spark está configurado para funcionar com Hive, BigQuery,
Memory, TPCH e TPCDS conectores.
Depois de criar um cluster com o componente Trino, execute consultas:
- de um terminal local com o
gcloud dataproc jobs submit trinocomando - em uma janela de terminal no primeiro nó mestre do cluster usando a
trinoCLI (interface de linha de comando). Consulte Usar o Trino com o Serviço Gerenciado para Apache Spark.
Instalar o componente
Instale o componente ao criar um cluster do Serviço Gerenciado para Apache Spark.
Consulte Versões compatíveis do Serviço Gerenciado para Apache Spark para a versão do componente incluída em cada versão de imagem do Serviço Gerenciado para Apache Spark.
Google Cloud Console do
- No Google Cloud Console do Cloud, abra a página Criar cluster.
- Clique em Configuração adicional para abrir a seção.
- Edite Componentes opcionais.
- No painel que aparece, selecione a caixa de seleção para Trino, e clique em Salvar.
CLI gcloud
Para criar um cluster do Serviço Gerenciado para Apache Spark que inclua o componente Trino,
use o
comando gcloud dataproc clusters create
com a flag --optional-components.
gcloud dataproc clusters create CLUSTER_NAME \
--optional-components=TRINO \
--region=region \
--enable-component-gateway \
... other flags
- CLUSTER_NAME: o nome do cluster.
- REGION: uma região do Compute Engine em que o cluster será localizado.
Como configurar propriedades
Adicione a --properties flag ao
gcloud dataproc clusters create comando para definir
trino, trino-jvm e trino-catalog
propriedades de configuração.
-
Propriedades do aplicativo: use as propriedades do cluster com o
trino:prefixo para configurar as propriedades do aplicativo Trino, por exemplo,--properties="trino:join-distribution-type=AUTOMATIC". - Propriedades de configuração da JVM:use as propriedades do cluster com o
trino-jvm:prefixo para configurar as propriedades da JVM para os processos Java do coordenador e do worker do Trino, por exemplo,--properties="trino-jvm:XX:+HeapDumpOnOutOfMemoryError". - Criar novos catálogos e adicionar propriedades de catálogo:use
trino-catalog:catalog-name.property-namepara configurar catálogos do Trino.Exemplo: a seguinte flag "properties" pode ser usada com o comando "gcloud dataproc clusters create" para criar um cluster Trino com um catálogo do Hive "prodhive". Um arquivo
prodhive.propertiesserá criado em/usr/lib/trino/etc/catalog/para ativar o catálogo do prodhive.--properties="trino-catalog:prodhive.connector.name=hive,trino-catalog:prodhive.hive.metastore.uri=thrift://localhost:9000"
API REST
O componente Trino pode ser especificado por meio da API Dataproc usando SoftwareConfig.Component como parte de uma solicitação clusters.create.