Panoramica delle soluzioni
Google Cloud Cortex Framework fornisce acceleratori di soluzioni che ti aiutano a creare prodotti di dati affidabili e di alta qualità pronti per l'analisi avanzata e i casi d'uso agentici. Il framework utilizza Google Cloudi prodotti di Google, tra cui BigQuery, Dataform, Knowledge Catalog e Gemini Enterprise Agent Platform.
Gli acceleratori di soluzioni di Cortex Framework sono disponibili come moduli open source personalizzabili che puoi eseguire il deployment in modo sicuro nel tuo Google Cloud ambiente per creare, personalizzare ed estendere rapidamente i prodotti di dati dai sistemi di origine aziendali.
Semplificando il modo in cui i team creano, orchestrano ed eseguono il deployment, Cortex Framework accelera il time-to-value e fornisce una base di alta fedeltà per l'analisi aziendale affidabile e i casi d'uso agentici.
Origini dati supportate
Gli acceleratori di soluzioni di Cortex Framework sono disponibili per le seguenti origini dati:
Componenti chiave
Cortex Framework è costituito dai seguenti componenti di soluzioni di alto livello:
Framework di creazione e deployment
Il framework di creazione e deployment orchestra la transizione dalle configurazioni locali alle pipeline Dataform, ai set di dati BigQuery attivi e viene eseguito utilizzando script dell'interfaccia a riga di comando (CLI) (cortex-build, cortex-deploy, cortex-build-and-deploy) basati su strumenti Python standard (uv).
Puoi eseguire questi script in vari ambienti:
- Macchine di sviluppo locali: per la configurazione iniziale, la personalizzazione, i test e il debug.
- Google Cloud **Cloud Shell / workstation virtuali**: ambienti di sviluppo sicuri e ospitati nel cloud.
- Pipeline CI/CD: automatizzazione di build e deployment tramite sistemi come Cloud Build o GitHub Actions per garantire l'integrazione continua.
Il framework compila i file di configurazione (ad esempio config.yaml e table_settings.yaml), analizza gli schemi degli asset di dati di origine (incluse le colonne personalizzate) e genera dinamicamente il codice Dataform JavaScript e SQLX. Il codice viene quindi inviato a un repository Dataform in Google Cloud ed è immediatamente pronto per l'esecuzione della pipeline.
Moduli di dati
I moduli di dati forniscono al framework di creazione e deployment i metadati della soluzione in pacchetto che definiscono la struttura e i componenti delle pipeline di dati Dataform. Esistono diversi tipi di moduli:
- Moduli di base dati: definiscono i set di dati che rappresentano lo stato più recente delle tabelle operative non elaborate. Standardizzano i tipi di dati, rinominano i campi di dati in termini aziendali leggibili, gestiscono le modifiche dei dati ed eseguono gli allineamenti dei fusi orari.
- Moduli di prodotti di dati: definiscono i modelli analitici creati in base ai contenuti del modulo di base dati. Implementano regole aziendali complesse, KPI, aggregazioni e join interfunzionali (ad esempio, la combinazione di record di vendita con tassi di cambio) per esporre set di dati puliti e pronti per il consumo.
- Moduli del catalogo dati: definiscono i cataloghi lakehouse esterni supportati per i riferimenti a tabelle esterne senza manifest fisici.
I moduli sono open source e personalizzabili, il che ti consente di adattarli ai tuoi requisiti aziendali unici.
Cataloghi di dati esterni
Cortex Framework supporta l'integrazione diretta con i cataloghi di dati esterni utilizzando i moduli del catalogo dati. Utilizzando il catalogo di runtime di Lakehouse, il framework può eseguire query sulle tabelle gestite in data lake esterni o condivisioni Delta (ad esempio, prodotti di dati provenienti da SAP Business Data Cloud Connect per BigQuery) senza sovraccarico di copia.
In questo modo, le organizzazioni possono combinare i contenuti forniti da Cortex Framework con i prodotti di dati esterni, creando insight aziendali unificati senza archiviazione duplicata o manutenzione della pipeline.
Orchestrazione di Dataform
Cortex Framework utilizza Dataform per gestire il ciclo di vita delle trasformazioni dei dati. Dataform fornisce un ambiente serverless per creare, testare, controllare la versione e pianificare pipeline SQL complesse all'interno di BigQuery.
Anziché scrivere SQL statico, il framework genera dinamicamente il codice Dataform durante la fase di creazione per riflettere la configurazione e le personalizzazioni specifiche. Una volta eseguito lo staging nel repository Dataform di destinazione in Google Cloud, puoi eseguire le pipeline generate per materializzare e popolare le tabelle e le viste conformi.
Modelli di dati BigQuery
Tutti i dati elaborati da Cortex Framework sono organizzati e archiviati in BigQuery. Il framework supporta:
- Tabelle e viste BigQuery standard: set di dati BigQuery completamente materializzati o virtuali ottimizzati con partizionamento e clustering per migliorare le prestazioni delle query e controllare i costi.
- Origini dati federate: query che interessano set di dati esterni, che consentono di unire l'archiviazione BigQuery con tabelle esterne federate.
- Catalogo di runtime di Lakehouse: query dirette e senza copia di cataloghi esterni (ad esempio, condivisione Delta) esposti come tabelle in BigQuery, che supportano la creazione di prodotti di dati tra le origini dati.
Integrazione di Knowledge Catalog
Knowledge Catalog funge da catalogo di governance e rilevamento unificato per tutti gli asset di dati della tua azienda. Cortex Framework si integra in modo nativo con Knowledge Catalog utilizzando uno strumento di sincronizzazione dedicato cortex-kc-sync.
Quando viene eseguito, questo strumento registra automaticamente i prodotti di dati di cui è stato eseguito il deployment nel catalogo, importando nomi leggibili, descrizioni aziendali dettagliate e link alla documentazione. Collega le tabelle BigQuery fisiche ai domini aziendali logici, rendendo gli asset di dati rilevabili per analisti aziendali, amministratori dei dati e agenti AI, garantendo al contempo un solido monitoraggio della tracciabilità. Per ulteriori informazioni, consulta Integrazione di Knowledge Catalog.
Architettura dei dati
Cortex Framework standardizza l'elaborazione dei dati in BigQuery. L'architettura è organizzata in tre livelli di dati strutturati distinti che si allineano ai principi di mesh di dati aziendali, promuovendo una proprietà chiara, un riutilizzo elevato e una rigorosa separazione dei livelli di dati.
Sistema di origine
I sistemi di origine sono le origini dei dati aziendali. Questi possono includere varie applicazioni, database o piattaforme aziendali da cui vengono estratti i dati. Per un elenco completo delle origini supportate, consulta Origini dati supportate.
Livello non elaborato
Il livello non elaborato rappresenta un set di dati della zona di destinazione immutabile in BigQuery per i dati di origine, ovvero log di Change Data Capture (CDC) o batch elaborati da CDC. Sebbene spesso memorizzi i log CDC (ad esempio, da SAP ECC o S/4HANA utilizzando strumenti di replica come BigQuery Connector per SAP o BigQuery Toolkit per SAP), è progettato per rappresentare qualsiasi formato non elaborato. Per le origini che non forniscono log CDC, come Salesforce o feed API esterni, questo livello rappresenta le estrazioni batch complete o i payload di eventi non elaborati esattamente come arrivano. Questo livello alimenta il livello di base dati.
Livello di base dati
Il livello di base dati pulisce, standardizza e conforma i dati di destinazione non elaborati in una singola rappresentazione affidabile dei dati di origine più recenti. Mappa le tabelle non elaborate alle strutture conformi, standardizza i tipi di dati, ottimizza le prestazioni con il partizionamento e il clustering, consolida gli schemi per garantire la coerenza e aumenta gli asset con annotazioni di metadati. Per le origini di Change Data Capture (CDC), questo livello unisce i record in entrata in modo incrementale per ottimizzare le prestazioni e ridurre i costi delle query. Per ulteriori informazioni, consulta Base dati.
Livello del prodotto di dati
Il livello del prodotto di dati contiene asset di dati pronti per il consumo progettati per il processo decisionale aziendale. Applica la logica di business, rinomina i campi di sistema complessi in termini aziendali leggibili, traduce i codici di stato, esegue aggiustamenti di fuso orario e valuta, aggrega le metriche e unisce i dati in più tabelle non elaborate. Le tabelle e le viste risultanti sono ottimizzate per il consumo diretto da parte di dashboard di BI, strumenti di reporting, pipeline di machine learning e piattaforme AI come Gemini Enterprise Agent Platform e gli agenti di analisi conversazionale di BigQuery. Per ulteriori informazioni, consulta Prodotti di dati.
Estensione della soluzione
Cortex Framework combina la flessibilità basata sulla configurazione con l'automazione assistita dall'AI per semplificare l'estensione del panorama dei dati. Che tu stia utilizzando assistenti alla programmazione AI autonomi per creare tabelle personalizzate o scrivere logica di compilazione personalizzata per nuove origini dati, il framework fornisce gli strumenti, l'isolamento e le porte di sicurezza necessari per scalare i prodotti di dati in modo sicuro.
Framework di estensibilità
Il framework di estensibilità fornisce un metodo strutturato per personalizzare la base dati e creare nuovi prodotti di dati. Le sue funzionalità principali includono:
- Spazi dei nomi personalizzati: isola le modifiche in una directory personalizzata (ad esempio,
src/data_modules/custom_namespace/) per proteggere le personalizzazioni da sovrascritture quando vengono aggiornati i pacchetti del framework principale. - Configurazione come codice: registra nuove origini dati, destinazioni e moduli personalizzati direttamente nel file di configurazione globale
config/config.yaml. - Builder di compilazione personalizzati: implementa classi di builder Python personalizzate (
builder.py) all'interno dei moduli per automatizzare la generazione dinamica di SQL, le regole di pulizia personalizzate o le trasformazioni specifiche dell'origine durante la fase di compilazione.
Per ulteriori informazioni, consulta la Guida all'estensibilità.
Builder di prodotti di dati agentici
Per aiutare gli sviluppatori e gli analisti aziendali a estendere il framework, Cortex Framework fornisce competenze in pacchetto. Queste competenze guidano gli assistenti alla programmazione AI (come Antigravity abbinato a Gemini) a:
- Ispezionare gli schemi fisici: recuperare nomi, tipi e descrizioni delle colonne accurati direttamente dalle tabelle del dizionario dei dati SAP (DDIC) replicate senza allucinazioni.
- Generare moduli di modelli: generare automaticamente spazi dei nomi, manifest, impostazioni delle tabelle, modelli SQLX/JS e annotazioni.
- Convalidare le modifiche: eseguire regole di linting, audit dei nomi e controlli di compilazione per migliorare la qualità del codice prima del deployment.
Per ulteriori informazioni, consulta capacità agentiche.
Passaggi successivi
È tutto pronto per la creazione e il deployment? Esplora le seguenti guide per avviare il tuo ambiente:
- Prodotti di dati: esplora il catalogo dei prodotti di dati disponibili.
- Base dati: scopri le tabelle e i campi di base sottostanti.
- Deployment demo: esegui il deployment dei contenuti della soluzione con i dati demo in pochi minuti per vedere rapidamente Cortex Framework in azione.
- Deployment di produzione: segui le istruzioni passo passo per configurare ed eseguire il deployment di Cortex Framework per i dati aziendali.