Componente Jupyter facoltativo di Managed Service per Apache Spark

Puoi installare componenti aggiuntivi come Jupyter quando crei un cluster Managed Service for Apache Spark utilizzando la funzionalità Componenti facoltativi. Questa pagina descrive il componente Jupyter.

Il componente Jupyter è un notebook basato sul web a utente singolo per l'analisi interattiva dei dati e supporta l'interfaccia utente web di JupyterLab. L'interfaccia utente web di Jupyter è disponibile sulla porta 8123 nel primo nodo master del cluster.

Avvia notebook per più utenti. Puoi creare un'istanza di Vertex AI Workbench abilitata per Managed Service for Apache Spark o installare il plug-in JupyterLab di Managed Service for Apache Spark su una VM per pubblicare notebook per più utenti.

Configura Jupyter. Jupyter può essere configurato fornendo dataproc:jupyter le proprietà del cluster. Per ridurre il rischio di esecuzione di codice remoto tramite le API del server notebook non protette, l'impostazione predefinita della proprietà del cluster dataproc:jupyter.listen.all.interfaces è false, che limita le connessioni a localhost (127.0.0.1) quando il gateway dei componenti è abilitato (l'attivazione del gateway dei componenti è obbligatoria quando si installa il componente Jupyter).

Il notebook Jupyter fornisce un kernel Python per eseguire il codice Spark e un kernel PySpark. Per impostazione predefinita, i notebook vengono salvati in Cloud Storage nel bucket gestione temporanea di Managed Service for Apache Spark, specificato dall'utente o creato automaticamente quando viene creato il cluster. La località può essere modificata al momento della creazione del cluster utilizzando la dataproc:jupyter.notebook.gcs.dir proprietà del cluster.

Utilizza i file di dati. Puoi utilizzare un notebook Jupyter per lavorare con i file di dati che sono stati caricati in Cloud Storage. Poiché il connettore Cloud Storage è preinstallato in un cluster Managed Service for Apache Spark, puoi fare riferimento ai file direttamente nel notebook. Ecco un esempio di accesso ai file CSV in Cloud Storage:

df = spark.read.csv("gs://bucket/path/file.csv")
df.show()

Per esempi di PySpark, consulta Funzioni di caricamento e salvataggio generiche.

Installa Jupyter

Installa il componente quando crei un cluster Managed Service for Apache Spark. Il componente Jupyter richiede l'attivazione del gateway dei componenti di Managed Service for Apache Spark Component Gateway.

Google Cloud Console

  1. Nellaconsole, apri la pagina Crea cluster. Google Cloud
  2. Fai clic su Configurazione aggiuntiva per espandere la sezione.
  3. Modifica Componenti facoltativi.
  4. Nel riquadro che si apre, seleziona la casella di controllo per Notebook Jupyter, quindi fai clic su Salva.

gcloud CLI

Per creare un cluster Managed Service for Apache Spark che includa il componente Jupyter, utilizza il comando gcloud dataproc clusters create cluster-name con il flag --optional-components.

Esempio di versione immagine predefinita più recente

L'esempio seguente installa il componente Jupyter su un cluster che utilizza la versione immagine predefinita più recente.

gcloud dataproc clusters create cluster-name \
    --optional-components=JUPYTER \
    --region=region \
    --enable-component-gateway \
    ... other flags

API REST

Il componente Jupyter può essere installato tramite l'API Dataproc utilizzando SoftwareConfig.Component come parte di una clusters.create richiesta.

Apri le interfacce utente di Jupyter e JupyterLab

Fai clic sui Google Cloud link del gateway dei componenti della console per aprire nel browser locale l'interfaccia utente del notebook Jupyter o di JupyterLab in esecuzione su l nodo master del cluster.

Seleziona "GCS" o "Disco locale" per creare un nuovo notebook Jupyter in una delle due località.

Collega le GPU ai nodi master e worker

Puoi aggiungere GPU ai nodi master e worker del cluster quando utilizzi un notebook Jupyter per:

  1. Preelaborare i dati in Spark, quindi raccogliere un DataFrame sul master ed eseguire TensorFlow
  2. Utilizzare Spark per orchestrare le esecuzioni di TensorFlow in parallelo
  3. Eseguire Tensorflow-on-YARN
  4. Utilizzare con altri scenari di machine learning che utilizzano le GPU