Google uses AI technology to translate content into your preferred language. AI translations can contain errors.

Replica datos de la base de datos de Oracle en BigQuery

En este instructivo, se muestra cómo implementar un trabajo que replica de forma continua los datos modificados de una base de datos de Oracle a un conjunto de datos de BigQuery con la replicación de Cloud Data Fusion. Esta función funciona con Datastream.

Objetivos

En este instructivo, harás lo siguiente:

Configurar tu base de datos de Oracle para habilitar el registro complementario
Crear y ejecutar un trabajo de replicación de Cloud Data Fusion
Observar los resultados en BigQuery

Costos

En este documento, usarás los siguientes componentes facturables de Google Cloud:

Para generar una estimación de costos en función del uso previsto, usa la calculadora de precios.

Es posible que los usuarios Google Cloud nuevos decumplan con los requisitos para acceder a una prueba gratuita.

Cuando se ejecuta la replicación, se te cobra por el clúster de Managed Service for Apache Spark y Cloud Storage, y se generan costos de procesamiento para Datastream y BigQuery. Para optimizar estos costos, te recomendamos usar los precios de tarifa plana de BigQuery.

Antes de comenzar

In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
- Create a project: To create a project, you need the Project Creator role (roles/resourcemanager.projectCreator), which contains the resourcemanager.projects.create permission. Learn how to grant roles.
Note: If you don't plan to keep the resources that you create in this procedure, create a project instead of selecting an existing project. After you finish these steps, you can delete the project, removing all resources associated with the project.

Go to project selector
Verify that billing is enabled for your Google Cloud project.
Enable the Cloud Data Fusion, Dataproc, Datastream, BigQuery, and Cloud Storage APIs.
Roles required to enable APIs
To enable APIs, you need the Service Usage Admin IAM role (roles/serviceusage.serviceUsageAdmin), which contains the serviceusage.services.enable permission. Learn how to grant roles.
Enable the APIs

Crea una instancia pública de Cloud Data Fusion en la versión 6.3.0 o posterior. Si creas una instancia privada, configura el intercambio de tráfico de la red de VPC.
- Cuando crees la instancia, habilita la replicación haciendo clic en Agregar aceleradores y seleccionando la casilla de verificación Replicación.
- Para habilitarla en una instancia existente, consulta Habilita la replicación.

Roles obligatorios

Para obtener los permisos que necesitas para conectarte a una base de datos de Oracle, pídele a tu administrador que te otorgue los siguientes roles de IAM:

Trabajador de Dataproc (roles/dataproc.worker) en la cuenta de servicio de Managed Service for Apache Spark en el proyecto que contiene el clúster
Ejecutor de Cloud Data Fusion en la cuenta de servicio de Managed Service for Apache Spark en el proyecto que contiene el clúster
Administrador de DataStream (roles/datastream.admin) en la cuenta de servicio de Cloud Data Fusion y la cuenta de servicio de Managed Service for Apache Spark

Si quieres obtener más información para otorgar roles, consulta Administra el acceso.

También puedes obtener los permisos necesarios mediante roles personalizados o cualquier otro rol predefinido.

Opcional: Instala Oracle en Compute Engine

En esta sección, se muestra cómo configurar una base de datos de ejemplo. Si ya tienes instalada una base de datos de Oracle, puedes omitir esta sección.

Descarga una imagen de Docker de Oracle Server.

Para conocer las limitaciones de esta imagen de Oracle Express Edition 11g, consulta Ediciones de Oracle Database.
Implementa tu imagen de Docker en una instancia de VM nueva.

Nota: Para implementar la imagen en la instancia de VM nueva, el servicio de Compute Engine debe tener el rol de lector de Artifact Registry (roles/artifactregistry.reader).
En la página Discos de Compute Engine, cambia el tamaño del disco a 500 GB y reinicia la VM.

Ir a Discos
Instala el esquema de muestra de HR.

Crea el intercambio de tráfico de la red de VPC o la regla de firewall para tu servidor de Oracle

Si tu base de datos de Oracle no permite el tráfico de entrada de direcciones IP públicas, configura el intercambio de tráfico de la red de VPC entre la VPC de Datastream y la VPC en la que se puede acceder a tu base de datos de Oracle. Para obtener más información, consulta Crea una configuración de conectividad privada.

Si tu base de datos de Oracle permite el tráfico de entrada de IP públicas, crea una regla de firewall para la instancia de VM a fin de permitir el tráfico de entrada desde las IP públicas de Datastream.

Configura tu servidor de Oracle para habilitar el registro complementario

Sigue los pasos para configurar tu base de datos de Oracle de origen.

Crea y ejecuta un trabajo de replicación de Cloud Data Fusion

Crea el trabajo

En la interfaz web de Cloud Data Fusion, haz clic en Replicación.
Haz clic en Crear un trabajo de replicación.
En la página Crear un trabajo de replicación nuevo, especifica un Nombre para el trabajo de replicación y haz clic en Siguiente.
Configura la fuente:
1. Selecciona Oracle (de Datastream) como fuente.
2. En Método de conectividad, si tu servidor de Oracle permite el tráfico de entrada de IPs públicas de Datastream, elige Lista de IPs permitidas. De lo contrario, en Nombre de la conexión privada, elige Conectividad privada (intercambio de tráfico de VPC) y, luego, ingresa el nombre del intercambio de tráfico de VPC que creaste en la sección Crea el intercambio de tráfico de la red de VPC o la regla de firewall para tu servidor de Oracle.
3. En Host, ingresa el nombre de host del servidor de Oracle que se leerá.
4. En Puerto, ingresa el puerto que se usará para conectarse al servidor de Oracle: 1521.
5. En Identidad del sistema, ingresa xe (el nombre de la base de datos de muestra del servidor de Oracle).
6. En la sección de credenciales, ingresa tu nombre de usuario y contraseña para acceder al servidor de Oracle.
7. Deja todas las demás propiedades como están.
Haz clic en Siguiente.
Configura el destino:
1. Selecciona el destino de BigQuery.
2. El ID del proyecto y la clave de la cuenta de servicio se detectan de forma automática. Mantén los valores predeterminados como están.
3. Opcional: En la sección Avanzado, puedes configurar lo siguiente:
  - Nombre y ubicación del bucket de etapa de pruebas
  - Intervalo de carga
  - Prefijo de la tabla de etapa de pruebas
  - Comportamiento cuando se quitan tablas o bases de datos
Haz clic en Siguiente.
Si la conexión se realiza correctamente, se mostrará una lista de tablas. Para este instructivo, selecciona algunas tablas.

Nota: Para continuar, se debe habilitar el registro complementario en las tablas seleccionadas.
Haz clic en Siguiente.
En la página Revisar evaluación, haz clic en Ver asignaciones en cualquiera de las tablas para obtener una evaluación de los problemas de esquema, las características faltantes o los problemas de conectividad que podrían ocurrir durante la replicación.

Si se produce algún problema, debes resolverlo antes de continuar. Para este instructivo, si alguna de las tablas tiene problemas, haz lo siguiente:
1. Regresa al paso en el que seleccionaste las tablas.
2. Selecciona una tabla o un evento (inserciones, actualizaciones o eliminaciones) sin problemas.
Para obtener más información sobre las conversiones de tipos de datos de la base de datos de origen a l destino de BigQuery, consulta Tipos de datos de replicación.
Haga clic en Atrás.
Haz clic en Siguiente.
Revisa los detalles del trabajo de replicación resumido y, luego, haz clic en Implementar trabajo de replicación.

Inicia el trabajo

En la interfaz web de Cloud Data Fusion, ve a la página detalles del trabajo de replicación.
Haz clic en Iniciar.

El trabajo de replicación pasa del estado Aprovisionamiento a Iniciando y, luego, a En ejecución. En el estado en ejecución, el trabajo de replicación carga una instantánea inicial de los datos de la tabla que seleccionaste en BigQuery. En este estado, el estado de la tabla aparece como Creando instantánea. Después de que se carga la instantánea inicial en BigQuery, cualquier cambio que se realice en la tabla se replica en BigQuery y el estado de la tabla aparece como Replicando.

Supervisa el trabajo

Puedes iniciar y detener el trabajo de replicación, revisar su configuración y sus registros, y supervisar tu trabajo de replicación.

Puedes supervisar las actividades del trabajo de replicación desde la página detalles del trabajo de replicación.

En la página Replicación, haz clic en el Nombre del trabajo de replicación elegido.
Haz clic en Monitoring.

Observar los resultados en BigQuery

El trabajo de replicación crea un conjunto de datos replicados y una tabla en BigQuery, con nombres heredados de la base de datos y los nombres de tabla correspondientes de Oracle.

En la Google Cloud consola de, ve a la BigQuery.
En el panel izquierdo, haz clic en el nombre de tu proyecto para expandir una lista de conjuntos de datos.
Selecciona el conjunto de datos xe y, luego, selecciona una tabla para verla.

Si deseas obtener más información, consulta la documentación de BigQuery.

Limpia

Para evitar que se apliquen cargos a tu cuenta de Google Cloud por los recursos usados en este instructivo, borra el proyecto que contiene los recursos o conserva el proyecto y borra los recursos individuales.

Una vez que terminaste el instructivo, limpia los recursos que creaste en Google Cloud para que no consuman tu cuota y no se facturen en el futuro. En las siguientes secciones, se describe cómo borrar o desactivar estos recursos.

Borra la instancia de VM

En la Google Cloud consola de, ve a la página Instancias de VM.

Ir a Instancias de VM
Selecciona la casilla de verificación de la instancia que deseas borrar.
Para borrar la instancia, haz clic en Borrar.

Borra la instancia de Cloud Data Fusion

Sigue las instrucciones para borrar tu instancia de Cloud Data Fusion.

Borra el proyecto

La manera más fácil de eliminar la facturación es borrar el proyecto que creaste para el instructivo.

Para borrar el proyecto, sigue estos pasos:

Precaución: Borrar un proyecto tiene estas consecuencias:

Se borra todo su contenido. Si usaste un proyecto existente para las tareas de este documento, cuando lo borres, también se borrará cualquier otro trabajo que hayas realizado en el proyecto.
Se pierden los IDs personalizados de los proyectos. Cuando creaste este proyecto, es posible que hayas creado un ID personalizado del proyecto que desees utilizar en el futuro. Para conservar las URLs que usan el ID del proyecto, como una URL appspot.com, borra los recursos seleccionados dentro del proyecto, en lugar de todo el proyecto.

Si planeas explorar varios instructivos, arquitecturas o guías de inicio rápido, reutilizar proyectos puede ser útil para no exceder los límites de cuota de los proyectos.

En la Google Cloud consola, ve a la página Administrar recursos.
Ir a Administrar recursos
En la lista de proyectos, elige el proyecto que tú quieres borrar y haz clic en Borrar.
En el diálogo, escribe el ID del proyecto y, luego, haz clic en Cerrar para borrar el proyecto.

¿Qué sigue?

Obtén más información sobre Datastream.
Obtén más información sobre la replicación en Cloud Data Fusion.
Consulta la referencia de la API de replicación .
Consulta la referencia de replicación de Oracle.
Trabaja con el instructivo para replicar datos de MySQL a BigQuery.
Trabaja con el instructivo para replicar datos de SQL Server a BigQuery.