Importa desde BigQuery

Puedes crear almacenes de datos a partir de tablas de BigQuery de dos maneras:

  • Transferencia única: Importas datos de una tabla de BigQuery a un almacén de datos. Los datos del almacén de datos no cambian a menos que los actualices de forma manual refresh the data.

  • Transferencia periódica: Importas datos de una o más tablas de BigQuery y estableces una frecuencia de sincronización que determina con qué frecuencia se actualizan los almacenes de datos con los datos más recientes del conjunto de datos de BigQuery.

En la siguiente tabla, se comparan las dos formas en que puedes importar datos de BigQuery a los almacenes de datos de Gemini Enterprise.

Transferencia única Transferencia periódica
Disponibilidad general (DG). Versión preliminar pública.
Los datos se deben actualizar de forma manual. Los datos se actualizan automáticamente cada 1, 3 o 5 días. Los datos no se pueden actualizar de forma manual.
Gemini Enterprise crea un solo almacén de datos a partir de una tabla en BigQuery. Gemini Enterprise crea un conector de datos para un conjunto de datos de BigQuery y un almacén de datos (llamado almacén de datos de entidad) para cada tabla especificada. Para cada conector de datos, las tablas deben tener el mismo tipo de datos (por ejemplo, estructurados ) y estar en el mismo conjunto de datos de BigQuery.
Los datos de varias tablas se pueden combinar en un almacén de datos. Para ello, primero se transfieren los datos de una tabla y, luego, más datos de otra fuente o tabla de BigQuery. Como no se admite la importación manual de datos, los datos de un almacén de datos de entidad solo se pueden obtener de una tabla de BigQuery.
Se admite el control de acceso a la fuente de datos. No se admite el control de acceso a la fuente de datos. Los datos importados pueden contener controles de acceso, pero estos controles no se respetarán.
Puedes crear un almacén de datos con la Google Cloud consola o la API. Debes usar la consola para crear conectores de datos y sus almacenes de datos de entidad.
Compatible con CMEK. Compatible con CMEK.

Antes de comenzar

Para importar datos de un proyecto Google Cloud de origen que sea diferente del Google Cloud proyecto con el almacén de datos de Gemini Enterprise, otorga las siguientes funciones de Identity and Access Management (IAM) a la service-PROJECT_NUMBER@gcp-sa-discoveryengine.iam.gserviceaccount.com cuenta de servicio en el proyecto que contiene el almacén de datos de Gemini Enterprise:

Importa una vez desde BigQuery

Para transferir datos de una tabla de BigQuery, sigue estos pasos para crear un almacén de datos y transferir datos con la Google Cloud consola o la API.

Antes de importar tus datos, revisa Prepara los datos para la transferencia.

Console

Para usar la Google Cloud consola de para transferir datos de BigQuery, sigue estos pasos:

  1. En la Google Cloud consola de, ve a la página Gemini Enterprise.

    Gemini Enterprise

  2. Ve a la página Almacenes de datos.

  3. Haz clic en Crear almacén de datos.

  4. En la página Selecciona una fuente de datos, selecciona BigQuery.

  5. Selecciona qué tipo de datos importarás.

  6. Haz clic en Una vez.

  7. En el campo Ruta de acceso de BigQuery , haz clic en Explorar , selecciona una tabla que hayas preparado para la transferencia y, luego, haz clic en Seleccionar. Como alternativa, ingresa la ubicación de la tabla directamente en el campo Ruta de acceso de BigQuery.

  8. Haz clic en Continuar.

  9. Si realizas una importación única de datos estructurados, haz lo siguiente:

    1. Asigna campos a propiedades clave.

    2. Si faltan campos importantes en el esquema, usa Agregar campo nuevo para agregarlos.

      Para obtener más información, consulta Acerca de la detección automática y la edición.

    3. Haz clic en Continuar.

  10. Elige una región para tu almacén de datos.

  11. Ingresa un nombre para tu almacén de datos.

  12. Haz clic en Crear.

  13. Para verificar el estado de la transferencia, ve a la página Almacenes de datos y haz clic en el nombre del conector para ver los detalles en la página Datos. Cuando la columna de estado de la pestaña Actividad cambie de En curso a Se completó la importación, se habrá completado la transferencia.

    Según el tamaño de tus datos, la transferencia puede tardar varios minutos o varias horas.

REST

Para usar la línea de comandos para crear un almacén de datos y transferir datos de BigQuery, sigue estos pasos.

  1. Crea un almacén de datos.

    curl -X POST \
    -H "Authorization: Bearer $(gcloud auth print-access-token)" \
    -H "Content-Type: application/json" \
    -H "X-Goog-User-Project: PROJECT_ID" \
    "https://discoveryengine.googleapis.com/v1/projects/PROJECT_ID/locations/global/collections/default_collection/dataStores?dataStoreId=DATA_STORE_ID" \
    -d '{
      "displayName": "DATA_STORE_DISPLAY_NAME",
      "industryVertical": "GENERIC",
      "solutionTypes": ["SOLUTION_TYPE_SEARCH"]
    }'
    

    Reemplaza lo siguiente:

    • PROJECT_ID: el ID de tu proyecto.
    • DATA_STORE_ID: el ID del almacén de datos que deseas crear. Este ID solo puede contener letras minúsculas, dígitos, guiones bajos y guiones.
    • DATA_STORE_DISPLAY_NAME: el nombre visible del almacén de datos que deseas crear.

    Opcional: Si subes datos no estructurados y deseas configurar el análisis de documentos o activar la división de documentos para RAG, especifica el documentProcessingConfig objeto y, luego, inclúyelo en tu solicitud de creación del almacén de datos. Se recomienda configurar un analizador de OCR para archivos PDF si transfieres archivos PDF escaneados. Para obtener información sobre cómo configurar las opciones de análisis o división, consulta Analiza y divide documentos.

  2. Importa datos de BigQuery.

    Si definiste un esquema, asegúrate de que los datos se ajusten a ese esquema.

    curl -X POST \
    -H "Authorization: Bearer $(gcloud auth print-access-token)" \
    -H "Content-Type: application/json" \
    "https://discoveryengine.googleapis.com/v1/projects/PROJECT_ID/locations/global/collections/default_collection/dataStores/DATA_STORE_ID/branches/0/documents:import" \
    -d '{
      "bigquerySource": {
        "projectId": "PROJECT_ID",
        "datasetId":"DATASET_ID",
        "tableId": "TABLE_ID",
        "dataSchema": "DATA_SCHEMA",
        "aclEnabled": "BOOLEAN"
      },
      "reconciliationMode": "RECONCILIATION_MODE",
      "autoGenerateIds": "AUTO_GENERATE_IDS",
      "idField": "ID_FIELD",
      "errorConfig": {
        "gcsPrefix": "ERROR_DIRECTORY"
      }
    }'
    

    Reemplaza lo siguiente:

    • PROJECT_ID: el ID de tu proyecto.
    • DATA_STORE_ID: el ID del almacén de datos.
    • DATASET_ID: el ID del conjunto de datos de BigQuery.
    • TABLE_ID: el ID de la tabla de BigQuery.
      • Si la tabla de BigQuery no está en PROJECT_ID, debes otorgar a la cuenta de servicio service-<project number>@gcp-sa-discoveryengine.iam.gserviceaccount.com "Lector de datos de BigQuery" permiso para la tabla de BigQuery. Por ejemplo, si importas una tabla de BigQuery del proyecto de origen "123" al proyecto de destino "456", otorga permisos a service-456@gcp-sa-discoveryengine.iam.gserviceaccount.com para la tabla de BigQuery en el proyecto "123".
    • DATA_SCHEMA: es opcional. Los valores son document y custom. El valor predeterminado es document.
      • document: La tabla de BigQuery que usas debe ajustarse al esquema predeterminado de BigQuery que se proporciona en Prepara los datos para la transferencia. Puedes definir el ID de cada documento, mientras encapsulas todos los datos en la cadena jsonData.
      • custom: Se acepta cualquier esquema de tabla de BigQuery, y Gemini Enterprise genera automáticamente los IDs de cada documento que se importa.
    • ERROR_DIRECTORY: es opcional. Un directorio de Cloud Storage para obtener información sobre los errores de la importación, por ejemplo, gs://<your-gcs-bucket>/directory/import_errors. Google recomienda dejar este campo vacío para permitir que Gemini Enterprise cree automáticamente un directorio temporal.
    • RECONCILIATION_MODE: es opcional. Los valores son FULL y INCREMENTAL. El valor predeterminado es INCREMENTAL. Si especificas INCREMENTAL, se produce una actualización incremental de los datos de BigQuery a tu almacén de datos. Esto realiza una operación de actualizar o insertar, que agrega documentos nuevos y reemplaza los existentes por documentos actualizados con el mismo ID. Si especificas FULL, se produce una nueva base completa de los documentos en tu almacén de datos. En otras palabras, los documentos nuevos y actualizados se agregan a tu almacén de datos, y los documentos que no están en BigQuery se quitan de tu almacén de datos. El modo FULL es útil si deseas borrar automáticamente los documentos que ya no necesitas.
    • AUTO_GENERATE_IDS: es opcional. Especifica si se deben generar automáticamente los IDs de documento. Si se establece en true, los IDs de documento se generan en función de un hash de la carga útil. Ten en cuenta que es posible que los IDs de documento generados no sigan siendo coherentes en varias importaciones. Si generas IDs automáticamente en varias importaciones, Google recomienda establecer reconciliationMode en FULL para mantener IDs de documento coherentes.

      Especifica autoGenerateIds solo cuando bigquerySource.dataSchema se establece en custom. De lo contrario, se muestra un error INVALID_ARGUMENT. Si no especificas autoGenerateIds o lo estableces en false, debes especificar idField. De lo contrario, los documentos no se importarán.

    • ID_FIELD: es opcional. Especifica qué campos son los IDs de documento. Para los archivos de origen de BigQuery, idField indica el nombre de la columna en la tabla de BigQuery que contiene los IDs de documento.

      Especifica idField solo cuando: (1) bigquerySource.dataSchema se establece en custom y (2) auto_generate_ids se establece en false o no se especifica. De lo contrario, se muestra un error INVALID_ARGUMENT.

      El valor del nombre de la columna de BigQuery debe ser de tipo cadena, debe tener entre 1 y 63 caracteres y debe cumplir con RFC-1034. De lo contrario, los documentos no se importarán.

Conéctate a BigQuery con sincronización periódica

Antes de importar tus datos, revisa Prepara los datos para la transferencia.

En el siguiente procedimiento, se describe cómo crear un almacén de datos de BigQuery que sincronice periódicamente los datos de un conjunto de datos de BigQuery. Si tu conjunto de datos tiene varias tablas, puedes agregarlas al almacén de datos de BigQuery que estás creando. Cada tabla que agregues se denomina entidad. Gemini Enterprise crea un almacén de datos independiente para cada entidad. Por lo tanto, cuando creas el almacén de datos con la Google Cloud consola de, obtienes una colección de almacenes de datos que representan estas entidades de datos transferidas.

Los datos del conjunto de datos se sincronizan periódicamente con los almacenes de datos de entidad. Puedes especificar la sincronización diaria, cada tres días o cada cinco días.

Console

Para crear un almacén de datos que sincronice periódicamente los datos de un conjunto de datos de BigQuery a Gemini Enterprise, sigue estos pasos:

  1. En la Google Cloud consola de, ve a la página Gemini Enterprise.

    Gemini Enterprise

  2. En el menú de navegación, haz clic en Almacenes de datos.

  3. Haz clic en Crear almacén de datos.

  4. En la página Fuente, selecciona BigQuery.

  5. Selecciona el tipo de datos que importarás.

  6. Haz clic en Periódica.

  7. Selecciona la Frecuencia de sincronización, es decir, con qué frecuencia deseas que el conector de Gemini Enterprise se sincronice con el conjunto de datos de BigQuery. Puedes cambiar la frecuencia más adelante.

  8. En el campo Ruta de acceso del conjunto de datos de BigQuery, haz clic en Explorar, selecciona el conjunto de datos que contiene las tablas que preparaste para la transferencia. Como alternativa, ingresa la ubicación de la tabla directamente en el campo Ruta de acceso de BigQuery. El formato de la ruta de acceso es projectname.datasetname.

  9. En el campo Tablas para sincronizar, haz clic en Explorar y, luego, selecciona una tabla que contenga los datos que deseas para tu almacén de datos.

  10. Si hay tablas adicionales en el conjunto de datos que deseas usar para los almacenes de datos, haz clic en Agregar tabla y especifica esas tablas también.

  11. Haz clic en Continuar.

  12. Elige una región para tu almacén de datos, ingresa un nombre para tu conector de datos y haz clic en Crear.

    Ahora creaste un conector de datos, que sincronizará periódicamente los datos con el conjunto de datos de BigQuery. Además, creaste uno o más almacenes de datos de entidad. Los almacenes de datos tienen los mismos nombres que las tablas de BigQuery.

  13. Para verificar el estado de la transferencia, ve a la página Almacenes de datos y haz clic en el nombre del conector de datos para ver los detalles en la página Datos > pestaña Actividad de transferencia de datos. Cuando la columna de estado de la pestaña Actividad cambie de En curso a Completado, se habrá completado la primera transferencia.

    Según el tamaño de tus datos, la transferencia puede tardar varios minutos o varias horas.

Después de configurar tu fuente de datos y de importar datos por primera vez, el almacén de datos sincroniza los datos de esa fuente con la frecuencia que selecciones durante la configuración. Aproximadamente una hora después de crear el conector de datos, se produce la primera sincronización. La siguiente sincronización se produce alrededor de 24 horas, 72 horas o 120 horas después.

Próximos pasos