Créer des produits de données avec des compétences d'agent
Ce guide explique comment utiliser des compétences d'agent spécialisées de Cortex Framework, fournies directement dans le dépôt GitHub, avec un assistant de codage IA (tel que Gemini associé au framework de développement d'agent Antigravity) pour créer des produits de données personnalisés qui suivent les bonnes pratiques de Cortex Framework.
Grâce à ces fonctionnalités, vous pouvez utiliser le langage naturel pour demander un nouveau produit de données basé sur des exigences métier spécifiques. Par exemple, vous pouvez demander un produit de données de consommation des comptes fournisseurs pour obtenir des insights sur le montant total dû, les montants en retard et le chiffre d'affaires. Le résultat est un produit de données Cortex Framework entièrement intégré, basé sur les exigences et les données spécifiques de votre client, et prêt à être exécuté.
Présentation
Le créateur de produits de données d'agent automatise le cycle de vie de développement de bout en bout des produits de données dans Cortex Framework. En demandant à votre assistant IA d'exécuter des workflows de développement structurés, vous n'avez plus besoin d'échafauder manuellement des structures de fichiers, de parcourir des schémas SAP complexes, de configurer des couches de base, de gérer des espaces de noms personnalisés ni d'écrire du code Dataform SQLX standard.
L'assistant IA gère les tâches principales suivantes :
- Planification et mappage des exigences : traduit les exigences métier concrètes en un plan de modélisation et de développement de données exploitable.
- Recherche de schéma en direct : exécute des scripts qui interrogent les tables répliquées du dictionnaire de données SAP (DDIC) pour fournir des informations contextuelles spécifiques au client, telles que des champs Z personnalisés.
- Échafaudage standard : génère automatiquement tous les fichiers de configuration, métadonnées et artefacts de code SQLX ou JavaScript requis.
- Portes de qualité des données : valide les produits de données en exécutant des compilations locales, en compilant du code SQL, en exécutant des tests unitaires et d'intégration, et en vérifiant la conformité aux normes de nommage.
- Création de documentation : crée automatiquement des éléments de documentation, y compris la visualisation des diagrammes d'entités-relations et des clés primaires de votre module de produit de données.
Le développement de produits de données avec ces compétences d'agent est un processus itératif. Vous pouvez commencer par vos objectifs initiaux, examiner le plan d'implémentation proposé par l'agent, y compris les diagrammes et schémas d'entités-relations, et demander à l'assistant IA d'affiner la logique de manière conversationnelle au fur et à mesure. L'agent accélère le développement, mais vous gardez le contrôle total pour examiner et approuver tout le code généré avant de le valider dans votre dépôt. De plus, comme ces scripts d'agent s'exécutent localement à l'aide de vos identifiants authentifiés, ils respectent intrinsèquement vos limites d'accès Google Cloud et BigQuery existantes.
Prérequis
Avant d'utiliser les compétences d'agent, vérifiez que votre environnement de développement répond aux exigences suivantes pour activer les requêtes de schéma en direct, la compilation de données et la validation automatisée :
Google Cloud SDK (
gcloud) : installez et authentifiez l'CLI (gcloud) avec votre compte utilisateur. Pour en savoir plus, consultez la documentation sur le déploiement.Identifiants par défaut de l'application (ADC): Configurez vos ADC locaux et vos cibles de projet afin que les outils de compilation locaux et les suites pytest puissent communiquer avec BigQuery. Pour en savoir plus, consultez Préparer votre projet par défaut Google Cloud
Tables répliquées du dictionnaire de données SAP (DDIC): pour permettre à l'agent d'effectuer des vérifications de schéma ne respectant pas la casse et de vérifier avec précision la longueur des champs, répliquez les tables de métadonnées SAP suivantes dans votre ensemble de données BigQuery cible brut :
DD03L(Champs de table)DD04T(Textes des éléments de données)DD08L(Relations entre les tables)DD01L(Domaines)DD07L(Valeurs de domaine – facultatif)DD07T(Textes des valeurs de domaine – facultatif)
Environnement Python local : installez les dépendances locales et exécutez l’outil de synchronisation à l’aide de
uvpour vous assurer que les bibliothèques de validation et les tests unitaires fonctionnent correctement. Pour en savoir plus, consultez la documentation.
Configuration et configuration de l'IDE
Avant de commencer, consultez la documentation de l'assistant de codage IA de votre choix pour obtenir des instructions d'installation et de configuration (par exemple, Antigravity).
Collectez les artefacts d'installation requis et clonez le dépôt. Pour en savoir plus, consultez Artefacts d'installation.
Ouvrez l'empreinte du code source cloné de Google Cloud Cortex Framework dans l'assistant de codage IA de votre choix.
Google Cloud Cortex Framework expose ses capacités agentiques via un ensemble de compétences spécialisées situées dans le répertoire .agents/skills/ du dépôt. Vous pouvez utiliser ces compétences dans plusieurs environnements de développement :
Framework Antigravity: Antigravity détecte, indexe et active automatiquement toutes les compétences de l'espace de travail au démarrage. Aucune configuration supplémentaire n'est requise. Pour vérifier, demandez à l'assistant :
"Quelles compétences sont disponibles ?"
VSCode avec Gemini Code Assist :
- Installez l'extension Gemini Code Assist à partir de VS Code Marketplace.
- Ouvrez le dossier
cortex-framework-coreen tant qu'espace de travail. L'assistant analyse et charge automatiquement les compétences à partir du répertoire.agents/skills/.
**Autres outils d'interface de ligne de commande IA **: faites référence au répertoire de compétences de manière native dans vos invites d'instructions. Par exemple, > "Lisez la compétence create-data-product dans le répertoire .agents/skills/ et échafaudez..."
Créer un produit de données personnalisé
Les étapes suivantes décrivent le workflow de développement structuré pour utiliser les compétences d'agent afin de créer un produit de données personnalisé.
Étape 1 : Fournir les exigences et le contexte
À l'aide de l'interface de chat de votre assistant de codage IA, fournissez une invite décrivant vos exigences spécifiques en matière de données. Exemple :
Créez un produit de données Cortex Framework pour les insights sur les comptes fournisseurs ciblant SAP S/4HANA et ECC. Utilisez l'espace de noms : custom_finance. L'exigence métier principale consiste à suivre le montant total dû et les montants en retard pour nos fournisseurs, et à calculer notre taux de rotation des comptes fournisseurs par code de société.
Notez que vous pouvez également faire référence à des exigences ou des documents de spécification existants directement dans votre invite. Ces documents (qui peuvent être au format Markdown ou dans d'autres formats structurés) fournissent à l'agent un contexte essentiel, tel que :
- Contexte et domaine métier : objectifs détaillés, récits utilisateur et consommateurs cibles.
- Spécifications des données d'entrée : liste des tables sources (par exemple,
LFA1,BSIK,BSEG,Z...), détails sur la gestion des versions (ECC ou S/4HANA), règles d'exclusion, champs personnalisés, etc. - Logique de transformation et règles métier : contraintes de mappage de base, filtrage client (
mandt), suppressions logiques (loekz), gestion des mappages d'indicateurs de blocage de paiement (zlspr) et règles de rapprochement (par exemple, exclusion des transactions de fournisseurs interentreprises pour éviter des taux de rotation faussés). - Intégrité des données et assertions de test : scénarios de validation (par exemple, vérification de l'unicité des grains et vérification que la somme des montants des factures ouvertes dans la sortie finale correspond exactement aux tables sources brutes).
Étape 2 : Examiner le plan d'implémentation
Une fois que vous avez décrit les exigences, l'agent utilise plusieurs compétences, telles que la compétence query-sap-ddic, pour interroger vos tables de métadonnées DDIC BigQuery brutes. Cela permet à l'agent d'identifier et de valider les tables sources requises, en s'assurant que les types de champs et les relations sont exacts. L'agent peut également appeler d'autres compétences pour s'assurer que vos exigences sont parfaitement conformes aux bonnes pratiques de Cortex Framework.
Avant de commencer l'implémentation, l'agent fournit un bref plan d'implémentation pour examen. Ce plan inclut les tables sources identifiées, les mappages et la structure architecturale proposée du produit de données. Examinez ce plan et demandez les ajustements nécessaires avant de confirmer.
Étape 3 : Générer le produit de données
Une fois que vous avez confirmé le plan d'implémentation, l'agent utilise la compétence create-data-product pour échafauder la structure du répertoire. Cela isole vos nouveaux développements personnalisés des mises à jour de la plate-forme principale sous l'espace de noms personnalisé que vous avez désigné :
src/data_modules/<custom_namespace>/products/<dataproductname>/
├── manifest.yaml
├── table_settings.default.yaml
├── README.md
├── definitions/
│ └── [ecc|s4]/
│ └── <product_name>.js
└── annotations/
└── [ecc|s4]/
└── <product_name>.yaml
Pour en savoir plus sur la structure des dossiers et les fichiers individuels, consultez la documentation du guide d'extensibilité.
Au cours de cette phase, vous pouvez également demander à l'agent de visualiser automatiquement les relations à l'aide de la compétence generate-er-diagram ou d'échafauder des assertions à l'aide de la compétence create-python-tests.
Étape 4 : Exécuter les portes de qualité et valider les données
En fonction des autorisations accordées, l'agent exécute automatiquement les portes de validation obligatoires suivantes ou vous invite à les exécuter. Tout au long de ce processus, l'agent génère des rapports d'état précis afin que vous puissiez examiner les résultats :
- Validation de la compilation : exécute
uv run cortex-build --config config/config.yamlpour s'assurer que tous les modèles SQL générés sont compilés correctement, ce qui génère un résumé de la compilation. - Exécution de Pytest : exécute la suite complète de tests unitaires Python, ce qui génère un rapport d’exécution de test qui valide votre logique métier et vos assertions de base.
- Linter et audits : utilise la compétence
validate-data-productpour effectuer des vérifications strictes de la parité des champs et vérifier la conformité aux conventions de nommage, en concluant par un rapport de préparation détaillé.
Étape 5 : Déployer et exécuter
Une fois que vous avez examiné les rapports de validation et approuvé le code généré, vous êtes prêt à déployer les éléments de votre produit de données.
- Déployer des éléments : envoyez les définitions de produit de données compilées à votre espace de travail Dataform configuré en exécutant le script de déploiement localement (par exemple, uv run cortex-deploy --config config/config.yaml).
- Matérialiser les données : terminez le workflow final post-déploiement pour exécuter les pipelines Dataform générés, en matérialisant vos nouvelles tables et vues directement dans BigQuery.
- Fournir des insights : une fois matérialisé, votre produit de données personnalisé est entièrement prêt à être connecté à des applications analytiques en aval, telles que Gemini Enterprise, pour fournir des réponses intelligentes et exploitables à vos questions métier d'origine.
Mettre à jour un produit de données existant
Une fois votre produit de données personnalisé créé, vous n'avez pas besoin de repartir de zéro pour le modifier. Vous pouvez utiliser la compétence update-data-product pour ajouter de nouveaux champs de manière itérative, ajuster la logique métier ou intégrer des tables sources entièrement nouvelles. Exemple :
Mettez à jour mon produit de données AP custom_finance. Ajoutez le champ des conditions de paiement (ZTERM) à partir de la table source LFA1 et assurez-vous qu'il est correctement mappé à la vue de sortie finale. Exécutez la validation de la compilation lorsque vous avez terminé.
L'agent localise la configuration, interroge le DDIC BigQuery pour connaître les exigences exactes des champs, met à jour votre code Dataform et exécute les vérifications de compilation nécessaires pour valider la modification.
Bonnes pratiques et limites
- Échecs de requête de schéma : si l'agent ne parvient pas à récupérer les schémas de métadonnées SAP, vérifiez que vos identifiants par défaut de l'application (ADC) locaux sont actifs et qu'ils disposent du rôle IAM Lecteur de données BigQuery pour l'ensemble de données brut cible.
- Limites de contexte : si vous créez un produit de données exceptionnellement volumineux impliquant des dizaines de tables, l'agent risque de perdre le contexte. Augmentez votre taux de réussite en fournissant des instructions plus petites et atomiques (par exemple, demandez à l'agent de créer d'abord les dimensions au niveau de l'en-tête, puis d'ajouter des faits au niveau de l'élément dans une invite de suivi distincte).