Descripción general de la solución

Google Cloud Cortex Framework proporciona aceleradores de soluciones que te ayudan a compilar productos de datos confiables y de alta calidad listos para estadísticas avanzadas y casos de uso de agentes. El framework usa Google Cloudproductos como BigQuery, Dataform, Knowledge Catalog y Gemini Enterprise Agent Platform.

Los aceleradores de soluciones de Cortex Framework están disponibles como módulos personalizables de código abierto que implementas de forma segura en tu propio Google Cloud entorno para compilar, personalizar y extender rápidamente productos de datos de sistemas de origen empresariales.

Al optimizar la forma en que los equipos compilan, organizan e implementan, Cortex Framework acelera el tiempo de rentabilidad y proporciona una base de alta fidelidad de estadísticas empresariales confiables y casos de uso de agentes.

Fuentes de datos compatibles

Los aceleradores de soluciones de Cortex Framework están disponibles para las siguientes fuentes de datos:

Componentes clave

Cortex Framework consta de los siguientes componentes de solución de alto nivel:

Componentes clave de la solución de Google Cloud Cortex Framework

Figura 1. Componentes clave de la solución de Cortex Framework.

Framework de compilación e implementación

El framework de compilación e implementación organiza la transición de las configuraciones locales a las canalizaciones de Dataform, los conjuntos de datos activos de BigQuery y se ejecuta con secuencias de comandos de la interfaz de línea de comandos (CLI) (cortex-build, cortex-deploy, cortex-build-and-deploy) con tecnología de herramientas estándar de Python (uv).

Puedes ejecutar estas secuencias de comandos en varios entornos:

  • Máquinas de desarrollo locales: Para la configuración inicial, la personalización, las pruebas y la depuración.
  • Google Cloud **Cloud Shell o estaciones de trabajo virtuales**: Entornos de desarrolladores seguros alojados en la nube.
  • Canalizaciones de CI/CD: Automatización de compilaciones e implementaciones a través de sistemas como Cloud Build o GitHub Actions para garantizar la integración continua.

El framework compila archivos de configuración (como config.yaml y table_settings.yaml), analiza los esquemas de los recursos de datos de origen (incluidas las columnas personalizadas) y genera de forma dinámica código JavaScript y SQLX de Dataform. Luego, el código se envía a un repositorio de Dataform y está listo para la ejecución de la canalización. Google Cloud

Proceso de implementación de Cortex Framework

Figura 2. Proceso de implementación de Cortex Framework.

Módulos de datos

Los módulos de datos proporcionan al framework de compilación e implementación metadatos de soluciones empaquetados que definen la estructura y los componentes de las canalizaciones de datos de Dataform. Existen diferentes tipos de módulos:

  1. Módulos de base de datos: Definen los conjuntos de datos que representan el estado más reciente de las tablas operativas sin procesar. Estandarizan los tipos de datos, cambian el nombre de los campos de datos a términos empresariales legibles por humanos, controlan los cambios de datos y ejecutan alineaciones de zona horaria.
  2. Módulos de productos de datos: Definen los modelos analíticos compilados sobre el contenido del módulo de base de datos. Implementan reglas empresariales complejas, KPIs, agregaciones y uniones multifuncionales (por ejemplo, combinar registros de ventas con tipos de cambio) para exponer conjuntos de datos limpios y listos para el consumo.
  3. Módulos de Data Catalog: Definen los catálogos de lakehouse externos compatibles con las referencias de tablas externas sin manifiestos físicos.

Los módulos son de código abierto y personalizables, lo que te permite adaptarlos a tus requisitos empresariales únicos.

Catálogos de datos externos

Cortex Framework admite la integración directa con catálogos de datos externos mediante los módulos de Data Catalog. Con el uso del catálogo de tiempo de ejecución de Lakehouse, el framework puede consultar tablas administradas en data lakes externos o acciones de delta (como productos de datos obtenidos con SAP Business Data Cloud Connect for BigQuery) sin sobrecarga de copia.

Esto permite a las organizaciones combinar el contenido entregado por Cortex Framework con productos de datos externos, lo que crea estadísticas empresariales unificadas sin almacenamiento duplicado ni mantenimiento de canalizaciones.

Organización de Dataform

Cortex Framework usa Dataform para administrar el ciclo de vida de las transformaciones de datos. Dataform proporciona un entorno sin servidores para compilar, probar, controlar versiones y programar canalizaciones de SQL complejas dentro de BigQuery.

En lugar de escribir SQL estático, el framework genera de forma dinámica el código de Dataform durante la fase de compilación para reflejar tu configuración y personalizaciones específicas. Una vez que se transfiera al repositorio de Dataform de destino en Google Cloud, podrás ejecutar las canalizaciones generadas para materializar y propagar las tablas y vistas conformes.

Modelos de datos de BigQuery

Todos los datos procesados por Cortex Framework se organizan y almacenan en BigQuery. El framework admite lo siguiente:

  • Tablas y vistas estándar de BigQuery: Conjuntos de datos de BigQuery completamente materializados o virtuales optimizados con partición y agrupamiento en clústeres para mejorar el rendimiento de las consultas y controlar los costos.
  • Fuentes de datos federadas: Consultas que abarcan conjuntos de datos externos, lo que te permite unir el almacenamiento de BigQuery con tablas externas federadas.
  • Catálogo de tiempo de ejecución de Lakehouse: Consultas directas y sin copia de catálogos externos (como el uso compartido de delta) expuestas como tablas en BigQuery, lo que admite la compilación de productos de datos en todas las fuentes de datos.

Integración de Knowledge Catalog

Knowledge Catalog actúa como un catálogo unificado de administración y descubrimiento para todos los recursos de datos de tu empresa. Cortex Framework se integra de forma nativa con Knowledge Catalog mediante una herramienta de sincronización dedicada cortex-kc-sync.

Cuando se ejecuta, esta herramienta registra automáticamente los productos de datos implementados en el catálogo, lo que importa nombres legibles por humanos, descripciones empresariales detalladas y vínculos de documentación. Vincula las tablas físicas de BigQuery a dominios empresariales lógicos, lo que permite que los analistas de negocios, los administradores de datos y los agentes de IA descubran los recursos de datos y, al mismo tiempo, garantiza un seguimiento sólido del linaje. Para obtener más información, consulta Integración de Knowledge Catalog.

Arquitectura de datos

Cortex Framework estandariza el procesamiento de datos en BigQuery. La arquitectura se organiza en tres capas de datos estructuradas y distintas que se alinean con los principios de la malla de datos empresariales, lo que promueve una propiedad clara, una alta reutilización y una separación estricta de las capas de datos.

Arquitectura de datos de Cortex Framework

Figura 4. Arquitectura de datos de Cortex Framework y capas de ELT dentro de BigQuery.

Sistema de origen

Los sistemas de origen son los orígenes de tus datos empresariales. Pueden incluir varias aplicaciones, bases de datos o plataformas empresariales de las que se extraen datos. Para obtener una lista completa de las fuentes compatibles, consulta Fuentes de datos compatibles.

Capa sin procesar

La capa sin procesar representa un conjunto de datos de zona de destino inmutable en BigQuery para los datos de origen, ya sean registros de captura de datos modificados (CDC) o lotes procesados por CDC. Si bien suele almacenar registros de CDC (por ejemplo, de SAP ECC o S/4HANA con herramientas de replicación como BigQuery Connector para SAP o BigQuery Toolkit para SAP), está diseñado para representar cualquier formato sin procesar. Para las fuentes que no proporcionan registros de CDC, como Salesforce o feeds de API externos, esta capa representa las extracciones de lotes completos o las cargas útiles de eventos sin procesar tal como llegan. Esta capa alimenta la capa de base de datos.

Capa de base de datos

La capa de base de datos limpia, estandariza y conforma los datos de destino sin procesar en una representación única y confiable de los datos de origen más recientes. Asigna tablas sin procesar a estructuras conformes, estandariza los tipos de datos, optimiza el rendimiento con la partición y el agrupamiento en clústeres, consolida los esquemas para garantizar la coherencia y aumenta los recursos con anotaciones de metadatos. Para las fuentes de captura de datos modificados (CDC), esta capa combina los registros entrantes de forma incremental para optimizar el rendimiento y reducir los costos de las consultas. Para obtener más información, consulta Base de datos.

Capa de productos de datos

La capa de productos de datos contiene recursos de datos listos para el consumo diseñados para la toma de decisiones empresariales. Aplica lógica empresarial, cambia el nombre de los campos complejos del sistema a términos empresariales legibles por humanos, traduce códigos de estado, realiza ajustes de zona horaria y moneda, agrega métricas y une datos en varias tablas sin procesar. Las tablas y vistas resultantes se optimizan para el consumo directo de paneles de IE, herramientas de informes, canalizaciones de aprendizaje automático y plataformas de IA, como Gemini Enterprise Agent Platform y agentes de estadísticas conversacionales de BigQuery. Para obtener más información, consulta Productos de datos.

Extiende la solución

Cortex Framework combina la flexibilidad basada en la configuración con la automatización asistida por IA para simplificar la forma en que extiendes tu panorama de datos. Ya sea que uses asistentes de codificación de IA autónomos para compilar tablas personalizadas o escribir lógica de compilación personalizada para fuentes de datos nuevas, el framework proporciona las herramientas, el aislamiento y las puertas de seguridad necesarias para escalar tus productos de datos de forma segura.

Framework de extensibilidad

El framework de extensibilidad proporciona un método estructurado para personalizar la base de datos y compilar productos de datos nuevos. Las siguientes son algunas de las funciones clave:

  • Espacios de nombres personalizados: Aísla tus cambios en un directorio personalizado (por ejemplo, src/data_modules/custom_namespace/) para proteger tus personalizaciones de las anulaciones cuando se actualizan los paquetes del framework principal.
  • Configuración como código: Registra nuevas fuentes de datos, destinos y módulos personalizados directamente en el archivo de configuración global config/config.yaml.
  • Compiladores personalizados: Implementa clases de compiladores personalizadas de Python (builder.py) dentro de tus módulos para automatizar la generación dinámica de SQL, las reglas de limpieza personalizadas o las transformaciones específicas de la fuente durante la fase de compilación.

Para obtener más información, consulta la guía de extensibilidad.

Compilador de productos de datos de agentes

Para ayudar a los desarrolladores y analistas de negocios a extender el framework, Cortex Framework proporciona habilidades empaquetadas. Estas habilidades guían a los asistentes de codificación de IA (como Antigravity junto con Gemini) para lo siguiente:

  • Inspeccionar esquemas físicos: Recuperar nombres, tipos y descripciones de columnas precisos directamente de las tablas replicadas del Diccionario de datos de SAP (DDIC) sin alucinaciones.
  • Generar módulos de plantilla: Generar automáticamente espacios de nombres, manifiestos, configuración de tablas, modelos SQLX/JS y anotaciones.
  • Validar cambios: Ejecutar reglas de linting, auditorías de nombres y verificaciones de compilación para mejorar la calidad del código antes de la implementación.

Para obtener más información, consulta Capacidades de agentes.

Próximos pasos

¿Todo listo para compilar e implementar? Explora las siguientes guías para poner en funcionamiento tu entorno: