Quando você ativa o cache de cluster do Serviço Gerenciado para Apache Spark, o cluster armazena em cache os dados do Cloud Storage acessados com frequência pelos jobs do Spark.
Vantagens
- Melhoria na performance:o armazenamento em cache pode melhorar a performance do job ao reduzir o tempo gasto para recuperar dados do armazenamento.
- Custos de armazenamento reduzidos:como os dados ativos são armazenados em cache no disco local, menos chamadas de API são feitas para o armazenamento para recuperar dados.
- Aplicabilidade do job do Spark: quando o cache de cluster está ativado em um cluster, ele se aplica a todos os jobs do Spark executados nele, sejam enviados ao Serviço Gerenciado para Apache Spark ou executados de forma independente no cluster.
Limitações e requisitos
- O armazenamento em cache se aplica apenas a jobs do Serviço Gerenciado para Apache Spark.
- Somente os dados do Cloud Storage são armazenados em cache.
- O armazenamento em cache só se aplica a clusters que atendem aos seguintes requisitos:
- O cluster tem um mestre e
nworkers. Os clusters de alta disponibilidade (HA) e de nó único não são compatíveis. - Esse recurso está disponível nas versões de imagem
2.0.72+,2.1.20+e2.2.0+do Serviço Gerenciado para Apache Spark. - Cada nó de cluster precisa ter SSDs locais anexados com a interface NVME (Non-Volatile Memory Express). Discos permanentes (PDs, na sigla em inglês) não são compatíveis. Os dados são armazenados em cache apenas em SSDs locais NVME.
- O cluster usa a conta de serviço padrão da VM para autenticação. Contas de serviço de VM personalizadas estão indisponíveis.
- O cluster tem um mestre e
Ativar o armazenamento em cache de cluster
É possível ativar o armazenamento em cache de cluster ao criar um cluster do Serviço Gerenciado para Apache Spark usando o console Google Cloud , a Google Cloud CLI ou a API Dataproc.
Console doGoogle Cloud
- Abra a página Criar cluster do console Google Cloud .
- Clique em Configuração adicional para abrir a seção.
- Edite Personalização e outros.
- No painel aberto, na seção Propriedades do cluster, clique em + Adicionar propriedades.
- Selecione dataproc na lista Prefixo e adicione a chave
dataproc.cluster.caching.enablede o valortrue.
CLI da gcloud
Execute o comando gcloud dataproc clusters create localmente em uma janela de terminal ou no Cloud Shell usando a propriedade do cluster dataproc:dataproc.cluster.caching.enabled=true.
Exemplo:
gcloud dataproc clusters create CLUSTER_NAME \ --region=REGION \ --properties dataproc:dataproc.cluster.caching.enabled=true \ --num-master-local-ssds=2 \ --master-local-ssd-interface=NVME \ --num-worker-local-ssds=2 \ --worker-local-ssd-interface=NVME \ other args ...
API REST
Defina SoftwareConfig.properties
para incluir a propriedade do cluster
"dataproc:dataproc.cluster.caching.enabled": "true" como parte de uma
solicitação clusters.create.