Présentation de la solution

Google Cloud Cortex Framework fournit des accélérateurs de solutions qui vous aident à créer des produits de données fiables et de haute qualité, prêts pour l'analyse avancée et les cas d'utilisation agentiques. Le framework utilise les produits de Google, y compris BigQuery, Dataform, Knowledge Catalog et Gemini Enterprise Agent Platform. Google Cloud

Les accélérateurs de solutions Cortex Framework sont disponibles sous forme de modules Open Source personnalisables que vous déployez en toute sécurité dans votre propre Google Cloud environnement pour créer, personnaliser et étendre rapidement des produits de données à partir de systèmes sources d'entreprise.

En rationalisant la façon dont les équipes créent, orchestrent et déploient, Cortex Framework accélère le délai de rentabilisation et fournit une base de haute fidélité pour l'analyse d'entreprise fiable et les cas d'utilisation agentiques.

Sources de données prises en charge

Les accélérateurs de solutions Cortex Framework sont disponibles pour les sources de données suivantes :

Composants clés

Cortex Framework se compose des composants de solution de haut niveau suivants :

Composants clés de la solution Google Cloud Cortex Framework

Figure 1. Composants clés de la solution Cortex Framework.

Framework de compilation et de déploiement

Le framework de compilation et de déploiement orchestre la transition des configurations locales vers les pipelines Dataform et les ensembles de données BigQuery actifs. Il est exécuté à l'aide de scripts d'interface de ligne de commande (cortex-build, cortex-deploy, cortex-build-and-deploy) basés sur des outils Python standards (uv).

Vous pouvez exécuter ces scripts dans différents environnements :

  • Machines de développement locales : pour la configuration initiale, la personnalisation, les tests et le débogage.
  • Google Cloud **Cloud Shell / postes de travail virtuels** : environnements de développement sécurisés hébergés dans le cloud.
  • Pipelines CI/CD : automatisation des compilations et des déploiements via des systèmes tels que Cloud Build ou GitHub Actions pour assurer une intégration continue.

Le framework compile les fichiers de configuration (tels que config.yaml et table_settings.yaml), analyse les schémas des assets de données sources (y compris les colonnes personnalisées) et génère dynamiquement du code Dataform JavaScript et SQLX. Le code est ensuite envoyé à un dépôt Dataform dans Google Cloud et est immédiatement prêt à être exécuté dans le pipeline.

Processus de déploiement de Cortex Framework

Figure 2. Processus de déploiement de Cortex Framework.

Modules de données

Les modules de données fournissent au framework de compilation et de déploiement des métadonnées de solution packagées qui définissent la structure et les composants des pipelines de données Dataform. Il existe différents types de modules :

  1. Modules de fondation de données : définissent les ensembles de données qui représentent l'état le plus récent des tables opérationnelles brutes. Ils standardisent les types de données, renomment les champs de données en termes commerciaux lisibles par l'homme, gèrent les modifications de données et exécutent les alignements de fuseaux horaires.
  2. Modules de produits de données : définissent les modèles analytiques basés sur le contenu du module de fondation de données. Ils implémentent des règles métier complexes, des KPI, des agrégations et des jointures interfonctionnelles (par exemple, en combinant les enregistrements de ventes avec les taux de change) pour exposer des ensembles de données propres et prêts à être consommés.
  3. Modules de catalogue de données : définissent les catalogues de lakehouse externes compatibles avec les références de tables externes sans manifestes physiques.

Les modules sont Open Source et personnalisables, ce qui vous permet de les adapter à vos besoins spécifiques.

Catalogues de données externes

Cortex Framework est compatible avec l'intégration directe aux catalogues de données externes à l'aide des modules de catalogue de données. En utilisant le catalogue d'exécution Lakehouse, le framework peut interroger les tables gérées dans des lacs de données externes ou des partages delta (tels que les produits de données provenant de SAP Business Data Cloud Connect pour BigQuery) sans frais de copie.

Les organisations peuvent ainsi combiner le contenu fourni par Cortex Framework avec des produits de données externes, ce qui permet de créer des insights commerciaux unifiés sans stockage ni maintenance de pipeline en double.

Orchestration Dataform

Cortex Framework utilise Dataform pour gérer le cycle de vie des transformations de données. Dataform fournit un environnement sans serveur pour créer, tester, contrôler les versions et planifier des pipelines SQL complexes dans BigQuery.

Au lieu d'écrire du code SQL statique, le framework génère dynamiquement le code Dataform lors de la phase de compilation pour refléter votre configuration et vos personnalisations spécifiques. Une fois que vous avez préparé votre dépôt Dataform cible dans Google Cloud, vous pouvez exécuter les pipelines générés pour matérialiser et remplir les tables et vues conformes.

Modèles de données BigQuery

Toutes les données traitées par Cortex Framework sont organisées et stockées dans BigQuery. Le framework est compatible avec les éléments suivants :

  • Tables et vues BigQuery standards : ensembles de données BigQuery entièrement matérialisés ou virtuels optimisés avec le partitionnement et le clustering pour améliorer les performances des requêtes et contrôler les coûts.
  • Sources de données fédérées : requêtes qui couvrent des ensembles de données externes, ce qui vous permet de joindre le stockage BigQuery à des tables externes fédérées.
  • Catalogue d'exécution Lakehouse : interrogation directe et sans copie des catalogues externes (tels que le partage delta) exposés sous forme de tables dans BigQuery, ce qui permet de créer des produits de données à partir de différentes sources de données.

Intégration de Knowledge Catalog

Knowledge Catalog fait office de catalogue unifié de gouvernance et de découverte pour tous les assets de données de votre entreprise. Cortex Framework s'intègre de manière native à Knowledge Catalog à l'aide d'un outil de synchronisation dédié cortex-kc-sync.

Lorsqu'il est exécuté, cet outil enregistre automatiquement les produits de données déployés dans le catalogue, en important des noms lisibles par l'homme, des descriptions commerciales détaillées et des liens vers la documentation. Il associe les tables BigQuery physiques aux domaines commerciaux logiques, ce qui permet aux analystes commerciaux, aux responsables des données et aux agents d'IA de découvrir les assets de données tout en assurant un suivi robuste de la traçabilité. Pour en savoir plus, consultez la section Intégration de Knowledge Catalog.

Architecture de données

Cortex Framework standardise le traitement des données dans BigQuery. L'architecture est organisée en trois couches de données distinctes et structurées qui s'alignent sur les principes du maillage de données d'entreprise, ce qui favorise une propriété claire, une réutilisation élevée et une séparation stricte des couches de données.

Architecture des données de Cortex Framework

Figure 4. Architecture de données Cortex Framework et superposition ELT dans BigQuery.

Système source

Les systèmes sources sont à l'origine de vos données commerciales. Il peut s'agir de diverses applications, bases de données ou plates-formes d'entreprise à partir desquelles les données sont extraites. Pour obtenir la liste complète des sources compatibles, consultez la section Sources de données compatibles.

Couche brute

La couche brute représente un ensemble de données de zone d'atterrissage immuable dans BigQuery pour les données sources, qu'il s'agisse de journaux de capture de données modifiées (CDC) ou de lots traités par CDC. Bien qu'elle stocke fréquemment les journaux CDC (par exemple, à partir de SAP ECC ou S/4HANA à l'aide d'outils de réplication tels que BigQuery Connector for SAP ou BigQuery Toolkit for SAP), elle est conçue pour représenter n'importe quel format brut. Pour les sources qui ne fournissent pas de journaux CDC, telles que Salesforce ou les flux d'API externes, cette couche représente les extraits de lot complets ou les charges utiles d'événements bruts exactement tels qu'ils arrivent. Cette couche alimente la couche de fondation de données.

Couche de fondation de données

La couche de fondation de données nettoie, standardise et conforme les données d'atterrissage brutes en une représentation unique et fiable des données sources les plus récentes. Elle mappe les tables brutes aux structures conformes, standardise les types de données, optimise les performances avec le partitionnement et le clustering, consolide les schémas pour garantir la cohérence et augmente les assets avec des annotations de métadonnées. Pour les sources de capture de données modifiées (CDC), cette couche fusionne les enregistrements entrants de manière incrémentielle afin d'optimiser les performances et de réduire les coûts des requêtes. Pour en savoir plus, consultez la section Fondations de données.

Couche de produits de données

La couche de produits de données héberge des assets de données prêts à être consommés et conçus pour la prise de décision commerciale. Elle applique une logique métier, renomme les champs système complexes en termes commerciaux lisibles par l'homme, traduit les codes d'état, effectue des ajustements de fuseaux horaires et de devises, agrège les métriques et joint les données dans plusieurs tables brutes. Les tables et vues résultantes sont optimisées pour une consommation directe par les tableaux de bord de BI, les outils de reporting, les pipelines de machine learning et les plates-formes d'IA telles que Gemini Enterprise Agent Platform et les agents d'analyse conversationnelle BigQuery. Pour en savoir plus, consultez la section Produits de données.

Étendre la solution

Cortex Framework combine la flexibilité basée sur la configuration avec l'automatisation assistée par l'IA pour simplifier l'extension de votre paysage de données. Que vous utilisiez des assistants de codage d'IA autonomes pour créer des tables personnalisées ou que vous écriviez une logique de compilation personnalisée pour de nouvelles sources de données, le framework fournit les outils, l'isolation et les barrières de sécurité nécessaires pour mettre à l'échelle vos produits de données en toute sécurité.

Framework d'extensibilité

Le framework d'extensibilité fournit une méthode structurée pour personnaliser la fondation de données et créer de nouveaux produits de données. Voici les principales fonctionnalités de cette solution :

  • Espaces de noms personnalisés : isolez vos modifications dans un répertoire personnalisé (par exemple, src/data_modules/custom_namespace/) pour protéger vos personnalisations contre les écrasements lorsque les packages de framework principaux sont mis à jour.
  • Configuration en tant que code : enregistrez de nouvelles sources de données, cibles et modules personnalisés directement dans le fichier de configuration global config/config.yaml.
  • Compilateurs personnalisés : implémentez des classes de compilateur Python personnalisées (builder.py) dans vos modules pour automatiser la génération SQL dynamique, les règles de nettoyage personnalisées ou les transformations spécifiques à la source lors de la phase de compilation.

Pour en savoir plus, consultez le guide d'extensibilité.

Créateur de produits de données agentiques

Pour aider les développeurs et les analystes commerciaux à étendre le framework, Cortex Framework fournit des compétences packagées. Ces compétences guident les assistants de codage d'IA (tels que Antigravity associé à Gemini) pour les actions suivantes :

  • Inspecter les schémas physiques : récupérer des noms, des types et des descriptions de colonnes précis directement à partir des tables SAP Data Dictionary (DDIC) répliquées sans hallucination.
  • Générer des modules de modèle : générer automatiquement des espaces de noms, des manifestes, des paramètres de table, des modèles SQLX/JS et des annotations.
  • Valider les modifications : exécuter des règles de linting, des audits de nommage et des vérifications de compilation pour améliorer la qualité du code avant le déploiement.

Pour en savoir plus, consultez la section Fonctionnalités agentiques.

Étapes suivantes

Prêt à créer et à déployer ? Consultez les guides suivants pour configurer votre environnement :