Entrena modelos de IA y AA

Obtén información para entrenar modelos de IA y AA en el kit de agente de datos de Google Cloud.

En esta guía de inicio rápido, usarás una plantilla de sesión y un notebook de Jupyter de muestra para predecir los importes de las propinas de los taxis de la ciudad de Nueva York. Con un kernel de Jupyter remoto con PySpark, probarás varios modelos, como la regresión lineal, el bosque aleatorio y XGBoost. Este proceso te permite realizar el entrenamiento y la inferencia distribuidos. Demuestra la escalabilidad en varias máquinas con Spark ML y la biblioteca XGBoost.

Aunque no se abordan en esta guía de inicio rápido, existen varias formas de entrenar modelos de IA y AA con el kit de agente de datos de Google Cloud:

  • Si tu conjunto de datos de entrenamiento es grande o deseas las capacidades de entrenamiento distribuido que ofrece Apache Spark, puedes usar notebooks de Spark con kernels remotos.
  • Si tu conjunto de datos está en BigQuery y BigQuery ML admite tu caso de uso, puedes usar un notebook de BigQuery DataFrames.
  • Si tu conjunto de datos es pequeño y deseas entrenar tu modelo de forma local, puedes usar un notebook de Python.

Antes de comenzar

Antes de comenzar, haz lo siguiente:

  1. Instala la extensión.
  2. Define la configuración de extensiones.
  3. Revisa la guía en Cómo encontrar y explorar datos.

Crea una plantilla de entorno de ejecución de Spark

Las plantillas de entorno de ejecución de Spark sin servidores te permiten iniciar una sesión de Apache Spark con un conjunto determinado de configuraciones. Para crear una plantilla de entorno de ejecución sin servidores nueva, completa los siguientes pasos:

  1. En la barra de actividades del IDE, haz clic en el ícono del kit de agente de datos de Google Cloud.
  2. En el menú del kit de agente de datos de Google Cloud, expande Apache Spark.
  3. Expande Sin servidores y, luego, haz clic en + Crear entornos de ejecución sin servidores. Aparecerá un formulario de creación de entorno de ejecución sin servidores.
  4. En el campo Nombre visible, ingresa ai-ml-tutorial.
  5. Ve a la sección Escalado automático.
  6. Establece spark.dynamicAllocation.enabled en falso en la lista desplegable. Este parámetro de configuración es necesario para que XGBoost funcione con Apache Spark.
  7. Deja todos los demás campos establecidos en el valor predeterminado.
  8. Haz clic en Enviar.

Crear un notebook nuevo

A continuación, crea un notebook de Spark nuevo:

  1. En Apache Spark, en la pestaña del kit de agente de datos de Google Cloud, haz clic en + Nuevo Spark Notebook.
  2. Elige Kernel remoto para el tipo de kernel.
  3. Haz clic en Comenzar con un notebook de muestra.
  4. En la lista de muestras, selecciona Ciencia de datos con PySpark y XGBoost distribuido. Aparecerá un notebook de Jupyter sin título.

Entrena tu modelo

  1. En la pestaña del notebook, haz clic en Ejecutar todo. El selector de kernel te pedirá que selecciones un kernel para ejecutar el notebook.
  2. Haz clic en Seleccionar otro kernel.
  3. Haz clic en Kernels de Spark remotos.
  4. Selecciona ai-ml-tutorial en Spark sin servidores, la plantilla de entorno de ejecución que creaste antes.

Verás la siguiente notificación mientras el sistema crea tu sesión de Spark sin servidores: Connecting to kernel: ai-ml-tutorial on Serverless Spark. Cuando el notebook se conecta al kernel de PySpark remoto, la ejecución comienza en la primera celda. Este proceso tarda aproximadamente de dos a tres minutos.

Inspecciona tu sesión de Spark

  1. En la pestaña del kit de agente de datos de Google Cloud, en Apache Spark, expande la plantilla de entorno de ejecución ai-ml-tutorial. El IDE muestra la lista de sesiones interactivas que creaste con esta plantilla de entorno de ejecución.
  2. Busca la sesión que creó el sistema ejecutando el notebook en la parte superior de la lista. Haz clic en la sesión para ver los detalles. Puedes revisar la configuración de la sesión y los recursos que consumió el sistema para ejecutar tu notebook.

Limpia

Después de ejecutar el notebook correctamente, realiza los siguientes pasos de limpieza.

  1. En la pestaña del kit de agente de datos de Google Cloud, en Apache Spark, haz clic con el botón derecho en Sin servidores y selecciona Mostrar entornos de ejecución sin servidores. Aparecerá la lista de entornos de ejecución sin servidores.
  2. Haz clic en el menú Acción para ai-ml-tutorial para enumerar todas las sesiones interactivas que creó el sistema a partir de tu plantilla.
  3. En Acciones, haz clic en Borrar.
  4. Regresa a la ventana Entornos de ejecución sin servidores.
  5. En Acciones para ai-ml-tutorial, haz clic en Borrar.
  6. Haz clic en Confirmar para borrar la plantilla que creaste para este instructivo.

¿Qué sigue?