Ti consigliamo di progettare il data mesh in modo che supporti un'ampia varietà di casi d'uso per il consumo di dati. In questo documento vengono descritti i casi d'uso più comuni per il consumo di dati in un'organizzazione. Il documento illustra anche le informazioni che i consumatori di dati devono considerare quando determinano il prodotto dati giusto per il loro caso d'uso e come scoprono e utilizzano i prodotti dati. La comprensione di questi fattori può aiutare le organizzazioni a garantire di disporre delle indicazioni e degli strumenti giusti per supportare i consumatori di dati.
Questo documento fa parte di una serie che descrive come implementare un data mesh su Google Cloud. Si presuppone che tu abbia letto e conosca i concetti descritti in Architettura e funzioni in un data mesh e Crea un data mesh moderno e distribuito con Google Cloud.
La serie è composta dalle seguenti parti:
- Architettura e funzioni in un data mesh
- Progettare una piattaforma dati self-service per un data mesh
- Creare prodotti dati in un data mesh
- Scoprire e utilizzare i prodotti dati in un data mesh (questo documento)
La progettazione di un livello di consumo di dati, in particolare il modo in cui i consumatori basati sul dominio di dati utilizzano i prodotti dati, dipende dai requisiti dei consumatori di dati. Come prerequisito, si presuppone che i consumatori abbiano in mente un caso d'uso. Si presuppone che abbiano identificato i dati di cui hanno bisogno e che possano cercarli nel catalogo centrale dei prodotti dati. Se i dati non sono presenti nel catalogo o non sono nello stato preferito (ad esempio, se l'interfaccia non è appropriata o gli SLA sono insufficienti), il consumatore deve contattare il produttore di dati.
In alternativa, il consumatore può contattare il centro di eccellenza (COE) per il data mesh per ricevere consigli su quale dominio è il più adatto a produrre quel prodotto dati. I consumatori di dati possono anche chiedere come effettuare la richiesta. Se la tua organizzazione è di grandi dimensioni, dovrebbe esistere una procedura per effettuare le richieste di prodotti dati in modo self-service.
I consumatori di dati utilizzano i prodotti dati tramite le applicazioni che eseguono. Il tipo di insight richiesti determina la scelta della progettazione dell'applicazione che utilizza i dati. Quando sviluppa la progettazione dell'applicazione, il consumatore di dati identifica anche l'utilizzo preferito dei prodotti dati nell'applicazione. Stabilisce la fiducia che deve avere nell'affidabilità dei dati. I consumatori di dati possono quindi stabilire una visualizzazione delle interfacce e degli SLA dei prodotti dati richiesti dall'applicazione.
Casi d'uso del consumo di dati
Affinché i consumatori di dati possano creare applicazioni dati, le origini potrebbero essere uno o più prodotti dati e, forse, i dati del dominio del consumatore di dati. Come descritto in Creare prodotti dati in un data mesh, i prodotti dati analitici potrebbero essere creati da prodotti dati basati su vari repository di dati fisici.
Sebbene il consumo di dati possa avvenire all'interno dello stesso dominio, i pattern di consumo più comuni sono quelli che cercano il prodotto dati giusto, indipendentemente dal dominio, come origine dell'applicazione. Quando il prodotto dati giusto esiste in un altro dominio, il pattern di consumo richiede di configurare il meccanismo successivo per l'accesso e l'utilizzo dei dati tra i domini. Il consumo di prodotti dati creati in domini diversi dal dominio di consumo è descritto in Passaggi per il consumo di dati.
Architettura
Il seguente diagramma mostra uno scenario di esempio in cui i consumatori utilizzano i prodotti dati tramite una serie di interfacce, tra cui set di dati autorizzati e API.
Come mostrato nel diagramma precedente, il produttore di dati ha esposto quattro interfacce di prodotti dati: due set di dati BigQuery autorizzati, un set di dati BigQuery esposto dall'API di lettura dell'archiviazione BigQuery e API di accesso ai dati ospitate su Google Kubernetes Engine. Quando utilizzano i prodotti dati, i consumatori di dati utilizzano una serie di applicazioni che eseguono query o accedono direttamente alle risorse dati all'interno dei prodotti dati. Per questo scenario, i consumatori di dati accedono alle risorse dati in uno dei due modi diversi in base ai loro requisiti specifici di accesso ai dati. Nel primo modo, Looker utilizza BigQuery SQL per eseguire query su un set di dati autorizzato. Nel secondo modo, Managed Service for Apache Spark accede direttamente a un set di dati tramite l'API BigQuery e poi elabora i dati importati per addestrare un modello di machine learning (ML).
L'utilizzo di un'applicazione per il consumo di dati potrebbe non sempre generare un report di business intelligence (BI) o una dashboard di BI. Il consumo di dati da un dominio può anche generare modelli ML che arricchiscono ulteriormente i prodotti analitici, vengono utilizzati nell'analisi dei dati o fanno parte di processi operativi, ad esempio il rilevamento delle frodi.
Di seguito sono riportati alcuni casi d'uso tipici del consumo di prodotti dati:
- Report di BI e analisi dei dati: in questo caso, le applicazioni dati vengono create per utilizzare i dati di più prodotti dati. Ad esempio, i consumatori di dati del team di gestione dei rapporti con i clienti (CRM) hanno bisogno di accedere ai dati di più domini, come vendite, clienti e finanza. L'applicazione CRM sviluppata da questi consumatori di dati potrebbe dover eseguire query su una vista autorizzata di BigQuery in un dominio ed estrarre dati da un'API di lettura di Cloud Storage in un altro dominio. Per i consumatori di dati, i fattori di ottimizzazione che influenzano l'interfaccia di consumo preferita sono i costi di calcolo e qualsiasi elaborazione di dati aggiuntiva richiesta dopo l'esecuzione di query sul prodotto dati. Nei casi d'uso di BI e analisi dei dati, è probabile che le visualizzazioni autorizzate di BigQuery siano di uso comune.
- Casi d'uso di data science e addestramento dei modelli: in questo caso, il team che utilizza i dati utilizza i prodotti dati di altri domini per arricchire il proprio prodotto dati analitici, ad esempio un modello ML. Utilizzando Managed Service for Apache Spark per Spark, Google Cloud fornisce funzionalità di pre-elaborazione dei dati e di feature engineering per consentire l' arricchimento dei dati prima di eseguire le attività di ML. Le considerazioni chiave sono la disponibilità di quantità sufficienti di dati di addestramento a un costo ragionevole e la certezza che i dati di addestramento siano i dati appropriati. Per ridurre i costi, è probabile che le interfacce di consumo preferite siano le API di lettura diretta. È possibile che un team che utilizza i dati crei un modello ML come prodotto dati e, a sua volta, questo team diventi anche un nuovo team di produzione di dati.
- Processi operativi: il consumo fa parte del processo operativo all'interno del dominio di consumo dei dati. Ad esempio, un consumatore di dati in un team che si occupa di frodi potrebbe utilizzare i dati sulle transazioni provenienti da origini dati operative nel dominio del commerciante. Utilizzando un metodo di integrazione dei dati come Change Data Capture, questi dati sulle transazioni vengono intercettati quasi in tempo reale. Puoi quindi utilizzare Pub/Sub per definire uno schema per questi dati ed esporre le informazioni come eventi. In questo caso, le interfacce appropriate sarebbero i dati esposti come argomenti Pub/Sub.
Passaggi per il consumo di dati
I produttori di dati documentano il loro prodotto dati nel catalogo centrale, incluse le indicazioni su come utilizzare i dati. Per un'organizzazione con più domini, questo approccio alla documentazione crea un'architettura diversa dalla pipeline ELT/ETL tradizionale creata centralmente, in cui i processori creano output senza il limite dei domini aziendali. I consumatori di dati in un data mesh devono disporre di un livello di rilevamento e consumo ben progettato per creare un ciclo di vita del consumo di dati. Il livello deve includere quanto segue:
Passaggio 1: scoprire i prodotti dati tramite la ricerca dichiarativa e l'esplorazione delle specifiche dei prodotti dati: i consumatori di dati sono liberi di cercare qualsiasi prodotto dati registrato dai produttori di dati nel catalogo centrale. Per tutti i prodotti dati, il tag del prodotto dati specifica come effettuare le richieste di accesso ai dati e la modalità di consumo dei dati dall'interfaccia del prodotto dati richiesta. I campi nei tag dei prodotti dati sono ricercabili utilizzando un'applicazione di ricerca. Le interfacce dei prodotti dati implementano gli URI dei dati, il che significa che i dati non devono essere spostati in una zona di consumo separata per servire i consumatori. Nelle situazioni in cui non sono necessari dati in tempo reale, i consumatori eseguono query sui prodotti dati e creano report con i risultati generati.
Passaggio 2: esplorare i dati tramite l'accesso interattivo ai dati e la prototipazione: i consumatori di dati utilizzano strumenti interattivi come BigQuery Studio e Jupyter Notebooks per interpretare e sperimentare i dati al fine di perfezionare le query necessarie per l'utilizzo in produzione. L'esecuzione di query interattive consente ai consumatori di dati di esplorare nuove dimensioni dei dati e migliorare la correttezza degli insight generati negli scenari di produzione.
Passaggio 3: utilizzare il prodotto dati tramite un'applicazione, con accesso programmatico e produzione:
- Report di BI. I report e le dashboard in batch e quasi in tempo reale sono il gruppo più comune di casi d'uso analitici richiesti dai consumatori di dati. I report potrebbero richiedere l'accesso a più prodotti dati per facilitare il processo decisionale. Ad esempio, una Customer Data Platform richiede l'esecuzione di query programmatiche sui prodotti dati relativi agli ordini e al CRM in modo pianificato. I risultati di questo approccio forniscono una visione olistica dei clienti agli utenti aziendali che utilizzano i dati.
- Modello AI/ML per la previsione in batch e in tempo reale. I data scientist utilizzano i principi MLOps comuni per creare e gestire modelli ML che utilizzano i prodotti dati resi disponibili dai team di prodotti dati. I modelli ML forniscono funzionalità di inferenza in tempo reale per i casi d'uso transazionali come il rilevamento delle frodi. Allo stesso modo, con l'analisi esplorativa dei dati, i consumatori di dati possono arricchire i dati di origine. Ad esempio, l'analisi esplorativa dei dati sulle vendite e sulle campagne di marketing mostra i segmenti di clienti demografici in cui si prevede che le vendite siano più elevate e, di conseguenza, dove devono essere eseguite le campagne.
Passaggi successivi
- Consulta un'implementazione di riferimento dell'architettura del data mesh.
- Scopri di più su BigQuery.
- Scopri di più su Gemini Enterprise Agent Platform.
- Scopri di più su data science in Managed Service for Apache Spark.
- Per ulteriori architetture di riferimento, diagrammi e best practice, esplora il Cloud Architecture Center.