Replicar datos de MySQL en BigQuery

En este tutorial se explica cómo crear e implementar un trabajo que replica continuamente los datos modificados de una base de datos MySQL en una tabla de BigQuery.

Objetivos

En este tutorial, aprenderás a hacer lo siguiente:

  1. Despliega tu base de datos MySQL en Compute Engine.
  2. Configura tu base de datos MySQL para habilitar la replicación.
  3. Crea y ejecuta una tarea de replicación de Cloud Data Fusion.
  4. Consulta los resultados en BigQuery.

Costes

En este documento, se utilizan los siguientes componentes facturables de Google Cloud:

Para generar una estimación de costes basada en el uso previsto, utiliza la calculadora de precios.

Los usuarios nuevos pueden disfrutar de una prueba sin coste económico. Google Cloud

Cuando se ejecuta la replicación, se te cobra por el clúster de Dataproc y se te aplican costes de procesamiento de BigQuery. Para optimizar estos costes, te recomendamos que uses los precios de tarifa plana de BigQuery.

Antes de empezar

  1. In the Google Cloud console, on the project selector page, select or create a Google Cloud project.

    Roles required to select or create a project

    • Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
    • Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.

    Go to project selector

  2. Verify that billing is enabled for your Google Cloud project.

  3. Enable the Cloud Data Fusion, BigQuery, and Cloud Storage APIs.

    Roles required to enable APIs

    To enable APIs, you need the Service Usage Admin IAM role (roles/serviceusage.serviceUsageAdmin), which contains the serviceusage.services.enable permission. Learn how to grant roles.

    Enable the APIs

  4. Crea una instancia pública de Cloud Data Fusion con la versión 6.3.0 o una posterior. Si crea una instancia privada, configure el emparejamiento de redes VPC.
    • Cuando crees la instancia, habilita la replicación haciendo clic en Añadir aceleradores y seleccionando la casilla Replicación.
    • Para habilitarla en una instancia, consulta Habilitar la replicación.
  5. Roles obligatorios

    Para obtener los permisos que necesitas para este tutorial, consulta Control de acceso con IAM y Conceder permiso de usuario a una cuenta de servicio.

    Instalar MySQL en Compute Engine

    1. Descarga una imagen de Docker del servidor MySQL.

    2. Sube tu imagen de Docker a Artifact Registry.

    3. Despliega tu imagen Docker en una nueva instancia de VM.

    4. En la página Discos de Compute Engine, cambia el tamaño del disco a 500 GB y reinicia la VM.

      Ir a Discos

    5. Crea un cortafuegos para la instancia de VM.

    6. Instala la base de datos de ejemplo Sakila.

    Habilitar la replicación en una base de datos MySQL

    Para habilitar la replicación, configura la captura de datos de cambios (CDC) en MySQL.

    Crear y ejecutar un trabajo de replicación de Cloud Data Fusion

    Subir el controlador JDBC

    1. Descarga el controlador JDBC de MySQL (versión 8 o posterior) en tu máquina local.

    2. En la interfaz web de Cloud Data Fusion, sube el controlador JDBC.

      Usa estos valores para configurar el controlador JDBC:

      • En el campo Name (Nombre), introduce mysql.
      • En el campo Versión, deja el valor predeterminado.
      • En el campo Nombre de clase, introduce com.mysql.jdbc.Driver.

    Crea la tarea.

    1. En la interfaz web de Cloud Data Fusion, haga clic en Replicación.

    2. Haz clic en Crear un trabajo de replicación.

    3. En la página Create new replication job (Crear trabajo de replicación), especifica un Name (Nombre) para el trabajo de replicación y haz clic en Next (Siguiente).

    4. Configura la fuente:

      1. Selecciona MySQL como origen.
      2. En Host, introduce el nombre de host del servidor MySQL desde el que se va a leer.
      3. En Puerto, introduce el puerto que quieras usar para conectarte al servidor MySQL: 3306.
      4. En JDBC Plugin Name (Nombre del complemento JDBC), selecciona mysql o el nombre que hayas especificado al configurar el controlador JDBC.
      5. En Nombre de la base de datos, escribe sakila.
      6. En la sección Credenciales, introduce tu nombre de usuario y tu contraseña para acceder al servidor MySQL.
    5. Haz clic en Siguiente.

    6. Configura el objetivo:

      1. Selecciona el destino de BigQuery.
      2. El ID de proyecto y la clave de cuenta de servicio se detectan automáticamente. No cambies los valores predeterminados.
      3. Opcional: En la sección Advanced (Avanzado), configure el nombre, la ubicación, el intervalo de carga, el prefijo de la tabla de almacenamiento temporal y el comportamiento del bucket de almacenamiento temporal cuando se eliminen tablas o bases de datos.
    7. Haz clic en Siguiente.

    8. Si la conexión se realiza correctamente, se muestra una lista de tablas de la base de datos de ejemplo Sakila. En este tutorial, selecciona algunas tablas y eventos para replicar, como los eventos Insert, Update y Delete.

    9. Opcional: Configura las propiedades avanzadas. En este tutorial, puedes usar la configuración predeterminada.

    10. Haz clic en Siguiente.

    11. En la página Revisar evaluación, haga clic en Ver asignaciones en cualquiera de las tablas para ver una evaluación de los problemas de esquema, las funciones que faltan o los problemas de conectividad que puedan producirse durante la replicación. Si se producen problemas, debes resolverlos para poder continuar. En este tutorial, si alguna de las tablas tiene problemas, vuelve al paso en el que seleccionaste las tablas y elige tablas o eventos (inserciones, actualizaciones o eliminaciones) que no tengan problemas.

      Para obtener más información sobre las conversiones de tipos de datos de la base de datos de origen a la de destino de BigQuery, consulta Tipos de datos de replicación.

    12. Haz clic en Siguiente.

    13. Revisa los detalles del trabajo de replicación del resumen y haz clic en Implementar trabajo de replicación.

    Empezar el trabajo

    • En la página Detalles del trabajo de replicación, haz clic en Iniciar.

    El trabajo de replicación pasa del estado Provisioning (Aprovisionando) al estado Starting (Iniciando) y, después, al estado Running (En ejecución). En el estado de ejecución, la tarea de replicación carga una instantánea inicial de los datos de la tabla que has seleccionado en BigQuery. En este estado, el estado de la tabla es Creando instantánea. Una vez que se haya cargado la primera copia en BigQuery, cualquier cambio que se haga en la tabla se replicará en BigQuery y el estado de la tabla será Replicando.

    Monitorizar la tarea

    Puedes iniciar y detener la tarea de replicación, revisar su configuración y sus registros, y monitorizarla.

    Puedes monitorizar las actividades de los trabajos de replicación desde la página Detalles del trabajo de replicación.

    1. En la página Replication (Replicación), haga clic en el Name (Nombre) del trabajo de replicación.

    2. Haz clic en Monitorización.

    Ver los resultados en BigQuery

    La tarea de replicación crea un conjunto de datos y una tabla replicados en BigQuery, con nombres heredados de los nombres de la base de datos y la tabla de MySQL correspondientes.

    1. En la Google Cloud consola, ve a la página BigQuery.

      Ir a BigQuery

    2. En el panel de la izquierda, selecciona el nombre de tu proyecto para desplegar una lista de conjuntos de datos.

    3. Para ver los resultados, selecciona el conjunto de datos sakila y, a continuación, una tabla.

    Para obtener más información, consulta la documentación de BigQuery.

    Limpieza

    Para evitar que los recursos utilizados en este tutorial se cobren en tu cuenta de Google Cloud, elimina el proyecto que contiene los recursos o conserva el proyecto y elimina los recursos.

    Cuando hayas terminado el tutorial, elimina los recursos que has creado enGoogle Cloud para que no ocupen cuota y no se te facturen en el futuro. En las siguientes secciones se explica cómo eliminar o desactivar dichos recursos.

    Eliminar la instancia de Cloud Data Fusion

    Sigue las instrucciones para eliminar tu instancia de Cloud Data Fusion.

    Eliminar el proyecto

    1. In the Google Cloud console, go to the Manage resources page.

      Go to Manage resources

    2. In the project list, select the project that you want to delete, and then click Delete.
    3. In the dialog, type the project ID, and then click Shut down to delete the project.

    Siguientes pasos