SSD locali di Managed Service per Apache Spark

Per integrare il disco di avvio, puoi collegare unità a stato solido (SSD) locali ai nodi master, worker primari e worker secondari del cluster. Quando vengono forniti SSD locali al cluster, sia HDFS che i dati temporanei, come gli output di shuffle, utilizzano gli SSD locali anziché ildisco permanentete di avvio.

  • Gli SSD locali possono fornire tempi di lettura e scrittura più rapidi rispetto al disco permanente (vedi Prestazioni degli SSD locali).
  • Le dimensioni di 375 GB di ogni SSD locale sono fisse, ma puoi collegare più SSD locali per aumentare lo spazio di archiviazione SSD (vedi Informazioni sugli SSD locali).
  • Ogni SSD locale è montato su /mnt/<id> nei nodi del cluster Managed Service for Apache Spark.
  • Gli SSD locali utilizzano ext4 come file system predefinito.

Utilizzare gli SSD locali

ConsoleGoogle Cloud

Crea un cluster e collega gli SSD locali ai nodi:

  1. Apri la pagina Crea cluster di Managed Service for Apache Spark.
  2. Fai clic su Configurazione aggiuntiva per espandere la sezione.
  3. Modifica Worker principali e Worker secondari per configurare le impostazioni SSD locale.
  4. Per impostazione predefinita, le impostazioni del nodo driver (master) sono le stesse del worker principale. Nella sezione Configurazione aggiuntiva, puoi fare clic su Nodo driver per deselezionare la casella di controllo Imposta il nodo driver come il worker principale, quindi specificare le impostazioni del nodo driver.

Comando gcloud CLI

Utilizza il gcloud dataproc clusters create comando con i flag --num-master-local-ssds, --num-workers-local-ssds e --num-secondary-worker-local-ssds per collegare gli SSD locali ai nodi master, primario e secondario del cluster.

Le unità SSD locali possono essere collegate alle VM Managed Service for Apache Spark utilizzando un'interfaccia SCSI (Small Computer System Interface) o NVME (Non-Volatile Memory Express) (vedi Prestazioni SSD locali). L'interfaccia SSD locale della VM del cluster Managed Service for Apache Spark predefinita è l'interfaccia SCSI. Utilizza il comando gcloud dataproc clusters create con i flag --master-local-ssd-interface, --worker-local-ssd-interface e --secondary-worker-local-ssd-interface per specificare l'interfaccia SSD locale per i nodi master, worker primari e secondari.

Esempio:

gcloud dataproc clusters create cluster-name \
    --region=region \
    --num-master-local-ssds=1 \
    --num-worker-local-ssds=1 \
    --num-secondary-worker-local-ssds=1 \
    --master-local-ssd-interface=NVME \
    --worker-local-ssd-interface=NVME \
    --secondary-worker-local-ssd-interface=NVME \
    ... other args ...

API REST

Imposta il campo numLocalSsds in masterConfig, workerConfig e secondaryWorkerConfig InstanceGroupConfig in una richiesta API cluster.create per collegare gli SSD locali ai nodi master, worker primari e worker secondari del cluster.

Le unità SSD locali possono essere collegate alle VM Managed Service for Apache Spark utilizzando un'interfaccia SCSI (Small Computer System Interface) o NVME (Non-Volatile Memory Express) (vedi prestazioni degli SSD locali). L'interfaccia SSD locale della VM del cluster Managed Service for Apache Spark predefinita è l'interfaccia SCSI. Imposta il campo localSsdInterface in masterConfig, workerConfig e secondaryWorkerConfig InstanceGroupConfig in una richiesta API cluster.create per specificare l'interfaccia"SCSI " o"NVME" per collegare gli SSD locali ai nodi master, worker primari e worker secondari del cluster.