Crea un clúster con la Google Cloud consola de
En esta página, se muestra cómo usar la Google Cloud consola de para crear un clúster de Managed Service para Apache Spark, ejecutar un trabajo básico Apache Spark en el clúster y, luego, modificar la cantidad de trabajadores en él.
Para seguir la guía paso a paso sobre esta tarea directamente en la Google Cloud consola, haz clic en Guiarme:
Antes de comenzar
- Accede a tu Google Cloud cuenta de. Si eres nuevo en Google Cloud, crea una cuenta para evaluar el rendimiento de nuestros productos en situaciones reales. Los clientes nuevos también obtienen $300 en créditos gratuitos para ejecutar, probar y, además, implementar cargas de trabajo.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that you have the permissions required to complete this guide.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Dataproc API.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that you have the permissions required to complete this guide.
-
Verify that billing is enabled for your Google Cloud project.
Enable the Dataproc API.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.
Roles obligatorios
Se requieren ciertos roles de Identity and Access Management (IAM) para ejecutar los ejemplos de esta página. Según las políticas de la organización, es posible que ya se hayan otorgado estos roles. Para verificar las concesiones de roles, consulta ¿Necesitas otorgar roles?.
Para obtener más información sobre cómo otorgar roles, consulta Administra el acceso a proyectos, carpetas y organizaciones.
Funciones de usuario
Para obtener los permisos que necesitas para crear un clúster de Managed Service para Apache Spark, pídele a tu administrador que te otorgue los siguientes roles de IAM:
- Editor de Dataproc (
roles/dataproc.editor) en el proyecto - Usuario de cuenta de servicio (
roles/iam.serviceAccountUser) en la cuenta de servicio predeterminada de Compute Engine
Función de cuenta de servicio
Para garantizar que la cuenta de servicio predeterminada de Compute Engine tenga los permisos necesarios para crear un clúster de Managed Service para Apache Spark, pídele a tu administrador que otorgue los siguientes roles de IAM a la cuenta de servicio predeterminada de Compute Engine en el proyecto:
-
Todos:
Trabajador de Dataproc (
roles/dataproc.worker)
Crea un clúster
En la Google Cloud consola de, ve a la página de Managed Service para Apache Spark Clústeres.
Haz clic en Crear clúster.
En el diálogo Crear clúster de Dataproc, haz clic en Crear en la fila Clúster en Compute Engine.
En el campo Nombre del clúster, ingresa
example-cluster.En las listas Región y Zona, selecciona una región y una zona.
Selecciona una región (por ejemplo,
us-east1oeurope-west1) para aislar recursos, como instancias de máquina virtual (VM) y ubicaciones de almacenamiento de Cloud Storage y metadatos que usa Managed Service para Apache Spark, en la región. Para obtener más información, consulta Regiones y zonas disponibles y Región del clústerUsa la configuración predeterminada en las demás opciones.
Para crear el clúster, haz clic en Crear.
El clúster nuevo aparece en una lista en la página Clústeres. El estado es Aprovisionando hasta que el clúster esté listo para usarse y, luego, cambia a En ejecución. El aprovisionamiento del clúster puede tardar un par de minutos.
Enviar un trabajo de Spark
Envía un trabajo de Spark que calcule un valor de Pi:
- En el menú de navegación de Managed Service para Apache Spark, haz clic en Trabajos.
En la página Trabajos, haz clic en Enviar trabajo y, luego, haz lo siguiente:
- En el campo ID de trabajo , usa el parámetro de configuración predeterminado o proporciona un ID que sea único para tu Google Cloud proyecto.
- En el menú desplegable Clúster, selecciona
example-cluster. - En Tipo de trabajo, selecciona Spark.
- En el campo Clase principal o jar, ingresa
org.apache.spark.examples.SparkPi. En el campo Archivos JAR, ingresa
file:///usr/lib/spark/examples/jars/spark-examples.jar. (Este jar de muestra está preinstalado en el clúster. Para trabajos personalizados, especifica una ruta de acceso de Cloud Storage; consulta Envía un trabajo).En el campo Argumentos, ingresa
1000para configurar el número de tareas.Genera coordenadas x y y en un plano cartesiano que da forma a un cuadrado unitario que encierra un círculo. El argumento de entrada (
1000) determina la cantidad de pares x, y que se generarán; cuantos más pares se generen, mayor será la precisión de la estimación. Esta estimación usa nodos trabajadores de Managed Service para Apache Spark para paralelizar el cálculo. Para obtener más información, consulta Estimating Pi using the Monte Carlo Method y JavaSparkPi.java en GitHub.Haz clic en Enviar.
Tu trabajo se muestra en la página Detalles del trabajo. El estado del trabajo es En ejecución o Iniciando y, luego, cambia a Completado después de que se envía.
Para evitar el desplazamiento en el resultado, haz clic en Ajuste de línea: desactivado. El resultado es similar al siguiente:
Pi is roughly 3.1416759514167594
Para ver los detalles del trabajo, haz clic en la pestaña Configuración.
Actualiza un clúster
Actualiza tu clúster cambiando la cantidad de instancias de trabajadores:
- En el menú de navegación de Managed Service para Apache Spark, haz clic en Clústeres.
- En la lista de clústeres, haz clic en
example-cluster. En la página Detalles del clúster, haz clic en la pestaña Configuración.
Se muestra la configuración del clúster.
Haz clic en Editar.
En el campo Nodos trabajadores, ingresa
5.Haz clic en Guardar.
El clúster ya se actualizó. Para disminuir la cantidad de nodos trabajadores al valor original, sigue el mismo procedimiento.
Limpia
Sigue estos pasos para evitar que se apliquen cargos a tu Google Cloud cuenta de por los recursos que usaste en esta página.
- Para borrar el clúster, en la página Detalles del clúster de
example-cluster, haz clic en Borrar. - Para confirmar que deseas borrar el clúster, haz clic en Borrar.
¿Qué sigue?
Prueba esta guía de inicio rápido con otras herramientas:
Aprende a diseñar reglas de firewall sólidas cuando creas un proyecto