SSD locales de Managed Service para Apache Spark

Para complementar el disco de arranque, puedes adjuntar unidades de estado sólido locales (SSD locales) a los nodos principales, trabajadores principales y trabajadores secundarios en tu clúster. Cuando se proporcionan SSD locales al clúster, los datos HDFS y provisiorios, como los resultados aleatorios, usan los SSD locales en lugar del disco persistente de arranque.

  • Los SSD locales pueden proporcionar tiempos de lectura y escritura más rápidos que disco persistente (consulta Rendimiento de SSD locales).
  • El tamaño de 375 GB de cada SSD local es fijo, pero puedes conectar varios SSD locales para aumentar el almacenamiento SSD (consulta Acerca de los SSD locales).
  • Cada SSD local se activa en /mnt/<id> en los nodos del clúster de Managed Service para Apache Spark.
  • Los SSD locales usan ext4 como sistema de archivos predeterminado.

Usa SSD locales

Google Cloud Consola de

Crea un clúster y conecta SSD locales a los nodos:

  1. Abre la página Crear clúster de Managed Service para Apache Spark.
  2. Haz clic en Configuración adicional para expandir esa sección.
  3. Edita Trabajadores principales y Trabajadores secundarios para configurar los parámetros de configuración de SSD locales.
  4. De forma predeterminada, la configuración del nodo del controlador (principal) es la misma que la configuración del trabajador principal. En Configuración adicional, puedes hacer clic en Nodo controlador para borrar la casilla de verificación Nodo controlador predeterminado igual que el trabajador principal y, luego, especificar la configuración del nodo controlador.

Comando de gcloud CLI

Usa el gcloud dataproc clusters create comando con las marcas --num-master-local-ssds, --num-workers-local-ssds y --num-secondary-worker-local-ssds para conectar SSD locales a los nodos principales, trabajadores principales y trabajadores secundarios del clúster.

Las SSD locales se pueden conectar a las VMs de Managed Service para Apache Spark mediante una interfaz SCSI (Small Computer System Interface) o NVME (Non-Volatile Memory Express) (consulta Rendimiento de SSD locales). La interfaz de SSD local de VM del clúster de Managed Service para Apache Spark predeterminada es la interfaz SCSI. Usa el comando gcloud dataproc clusters create con las marcas --master-local-ssd-interface, --worker-local-ssd-interface y --secondary-worker-local-ssd-interface para especificar la interfaz de SSD local para los nodos principales, trabajadores principales y secundarios.

Ejemplo:

gcloud dataproc clusters create cluster-name \
    --region=region \
    --num-master-local-ssds=1 \
    --num-worker-local-ssds=1 \
    --num-secondary-worker-local-ssds=1 \
    --master-local-ssd-interface=NVME \
    --worker-local-ssd-interface=NVME \
    --secondary-worker-local-ssd-interface=NVME \
    ... other args ...

API de REST

Establece el numLocalSsds campo en masterConfig, workerConfig, y secondaryWorkerConfig InstanceGroupConfig en una cluster.create solicitud a la API para conectar SSD locales a los nodos principales, trabajadores principales y trabajadores secundarios del clúster.

Las SSD locales se pueden conectar a las VMs de Managed Service para Apache Spark mediante una interfaz SCSI (Small Computer System Interface) o NVME (Non-Volatile Memory Express) (consulta Rendimiento de SSD locales). La interfaz de SSD local de VM del clúster de Managed Service para Apache Spark predeterminada es la interfaz SCSI. Establece el localSsdInterface campo en masterConfig, workerConfig, y secondaryWorkerConfig InstanceGroupConfig en una cluster.create solicitud a la API para especificar la interfaz "SCSI" o "NVME" para conectar SSD locales a los nodos principales, trabajadores principales y trabajadores secundarios del clúster.