Almacenamiento en caché del clúster

Cuando habilitas el almacenamiento en caché del clúster de Managed Service para Apache Spark, el clúster almacena en caché los datos de Cloud Storage a los que acceden con frecuencia tus trabajos de Spark.

Beneficios

  • Rendimiento mejorado: El almacenamiento en caché puede mejorar el rendimiento del trabajo, ya que reduce la cantidad de tiempo que se dedica a recuperar datos del almacenamiento.
  • Reducción de los costos de almacenamiento: Como los datos activos se almacenan en caché en el disco local, se realizan menos llamadas a la API al almacenamiento para recuperar datos.
  • Aplicabilidad del trabajo de Spark: Cuando el almacenamiento en caché del clúster está habilitado en un clúster, se aplica a todos los trabajos de Spark que se ejecutan en el clúster, ya sea que se envíen a Managed Service para Apache Spark o se ejecuten de forma independiente en el clúster.

Limitaciones y requisitos

  • El almacenamiento en caché solo se aplica a los trabajos de Managed Service para Apache Spark.
  • Solo se almacenan en caché los datos de Cloud Storage.
  • El almacenamiento en caché solo se aplica a los clústeres que cumplen con los siguientes requisitos:

Habilita el almacenamiento en caché del clúster

Puedes habilitar el almacenamiento en caché del clúster cuando creas un clúster de Managed Service para Apache Spark con la Google Cloud consola, Google Cloud CLI o la API de Dataproc.

Google Cloud Consola de

  1. Abre la página Crear clúster de la Google Cloud consola.
  2. Haz clic en Configuración adicional para expandir esa sección.
  3. Edita Personalización y otros.
  4. En el panel que se abre, en la sección Propiedades del clúster, haz clic en + Agregar propiedades.
  5. Selecciona dataproc en la lista Prefijo y, luego, agrega la clave dataproc.cluster.caching.enabled y el valor true.

gcloud CLI

Ejecuta el comando gcloud dataproc clusters create de forma local en una ventana de la terminal o en Cloud Shell con la propiedad del clúster dataproc:dataproc.cluster.caching.enabled=true.

Ejemplo:

gcloud dataproc clusters create CLUSTER_NAME \
    --region=REGION \
    --properties dataproc:dataproc.cluster.caching.enabled=true \
    --num-master-local-ssds=2 \
    --master-local-ssd-interface=NVME \
    --num-worker-local-ssds=2 \
    --worker-local-ssd-interface=NVME \
    other args ...
  

API de REST

Configura SoftwareConfig.properties para incluir la "dataproc:dataproc.cluster.caching.enabled": "true" propiedad del clúster como parte de una clusters.create.