Cuando habilitas el almacenamiento en caché del clúster de Managed Service para Apache Spark, el clúster almacena en caché los datos de Cloud Storage a los que acceden con frecuencia tus trabajos de Spark.
Beneficios
- Rendimiento mejorado: El almacenamiento en caché puede mejorar el rendimiento del trabajo, ya que reduce la cantidad de tiempo que se dedica a recuperar datos del almacenamiento.
- Reducción de los costos de almacenamiento: Como los datos activos se almacenan en caché en el disco local, se realizan menos llamadas a la API al almacenamiento para recuperar datos.
- Aplicabilidad del trabajo de Spark: Cuando el almacenamiento en caché del clúster está habilitado en un clúster, se aplica a todos los trabajos de Spark que se ejecutan en el clúster, ya sea que se envíen a Managed Service para Apache Spark o se ejecuten de forma independiente en el clúster.
Limitaciones y requisitos
- El almacenamiento en caché solo se aplica a los trabajos de Managed Service para Apache Spark.
- Solo se almacenan en caché los datos de Cloud Storage.
- El almacenamiento en caché solo se aplica a los clústeres que cumplen con los siguientes requisitos:
- El clúster tiene un maestro y
ntrabajadores (no se admiten los clústeres de alta disponibilidad (HA) ni de un solo nodo). - Esta función está disponible en las versiones de imagen de Managed Service para Apache Spark
2.0.72+,2.1.20+y2.2.0+. - Cada nodo del clúster debe tener SSD locales conectadas con la interfaz NVME (Non-Volatile Memory Express) (no se admiten los discos persistentes [PDs]). Los datos solo se almacenan en caché en las SSD locales NVME.
- El clúster usa la cuenta de servicio de VM predeterminada para la autenticación. No se admiten las cuentas de servicio de VM personalizadas.
- El clúster tiene un maestro y
Habilita el almacenamiento en caché del clúster
Puedes habilitar el almacenamiento en caché del clúster cuando creas un clúster de Managed Service para Apache Spark con la Google Cloud consola, Google Cloud CLI o la API de Dataproc.
Google Cloud Consola de
- Abre la página Crear clúster de la Google Cloud consola.
- Haz clic en Configuración adicional para expandir esa sección.
- Edita Personalización y otros.
- En el panel que se abre, en la sección Propiedades del clúster, haz clic en + Agregar propiedades.
- Selecciona dataproc en la lista Prefijo y, luego, agrega la clave
dataproc.cluster.caching.enabledy el valortrue.
gcloud CLI
Ejecuta el comando gcloud dataproc clusters create
de forma local en una ventana de la terminal o en
Cloud Shell
con la propiedad del clúster
dataproc:dataproc.cluster.caching.enabled=true.
Ejemplo:
gcloud dataproc clusters create CLUSTER_NAME \ --region=REGION \ --properties dataproc:dataproc.cluster.caching.enabled=true \ --num-master-local-ssds=2 \ --master-local-ssd-interface=NVME \ --num-worker-local-ssds=2 \ --worker-local-ssd-interface=NVME \ other args ...
API de REST
Configura SoftwareConfig.properties
para incluir la "dataproc:dataproc.cluster.caching.enabled": "true"
propiedad del clúster
como parte de una
clusters.create.