Puoi utilizzare questa origine generica ogni volta che devi leggere da un database. Ad esempio, potresti utilizzarla per creare snapshot giornalieri di una tabella di database generica e scrivere l'output in BigQuery.
Configurare il plug-in
- Vai all'interfaccia web di Cloud Data Fusion e fai clic su Studio.
- Verifica che sia selezionata l'opzione Pipeline di dati - Batch (non In tempo reale).
- Nel menu Origine, fai clic su Database.
- Per configurare il plug-in, tieni il puntatore sul nodo del plug-in e fai clic su Proprietà.
Inserisci le seguenti proprietà. Per saperne di più su ogni proprietà, consulta Proprietà.
- Inserisci un'etichetta per il nodo del database, ad esempio
database tables. Inserisci i dettagli della connessione. Puoi configurare una nuova connessione una tantum o una connessione esistente e riutilizzabile.
Nuova connessione
Per aggiungere una connessione una tantum al database:
- Mantieni disattivata l'opzione Usa connessione.
- Inserisci le seguenti proprietà di connessione:
- Nel campo Nome driver JDBC, inserisci il nome del driver, se presente. In caso contrario, mantieni selezionata l'opzione Nessun plug-in JDBC.
- Nel campo Stringa di connessione, inserisci la stringa di connessione JDBC, incluso il nome del database.
- (Facoltativo) Se il database richiede l'autenticazione, inserisci le credenziali del nome utente e della password del database.
- (Facoltativo) Se il driver JDBC richiede configurazioni aggiuntive, nel campo Argomenti di connessione, inserisci gli argomenti coppia chiave-valore per la connessione.
Connessione riutilizzabile
Per riutilizzare una connessione esistente:
- Attiva l'opzione Usa connessione.
- Fai clic su Sfoglia connessioni.
Seleziona la connessione.
(Facoltativo) Se non esiste una connessione e vuoi crearne una nuova e riutilizzabile, fai clic su Aggiungi connessione e segui i passaggi nella scheda Nuova connessione di questa pagina.
(Facoltativo) Per testare la connettività, fai clic su Ottieni schema. Questo schema viene utilizzato al posto di qualsiasi schema restituito dalla query. Deve corrispondere allo schema restituito dalla query, tranne per il fatto che puoi contrassegnare i campi come nullable e può contenere un sottoinsieme dei campi.
Nel campo Importa query, inserisci una query
SELECTper importare i dati dalla tabella specificata, ad esempioselect id, name, email, phone from users;.(Facoltativo) Nel campo Query di delimitazione, inserisci i valori minimo e massimo da leggere, ad esempio
SELECT * FROM table WHERE $CONDITIONS.(Facoltativo) Nel campo Nome campo di suddivisione, inserisci il nome del campo che genera le suddivisioni.
(Facoltativo) Nel campo Numero di suddivisioni da generare, inserisci un numero, ad esempio
2.(Facoltativo) Nel campo Dimensioni recupero, inserisci un numero, ad esempio
1000.(Facoltativo) Inserisci le proprietà avanzate, ad esempio modificando le maiuscole/minuscole di i nomi delle colonne.
- Inserisci un'etichetta per il nodo del database, ad esempio
(Facoltativo) Fai clic su Convalida e correggi eventuali errori riscontrati.
Fai clic su Chiudi. Le proprietà vengono salvate e puoi continuare a creare la pipeline di dati in Cloud Data Fusion Studio.
Proprietà
| Proprietà | Con macro | Obbligatorio | Descrizione |
|---|---|---|---|
| Etichetta | No | Sì | Il nome del nodo nella pipeline di dati. |
| Usa connessione | No | No | Sfoglia una connessione all'origine. Se Usa connessione è selezionata, non devi fornire le credenziali. |
| Connessione | Sì | Sì | Il nome della connessione da utilizzare. Se è selezionata l'opzione Usa connessione, questo campo viene visualizzato. Le informazioni sul database e sulla tabella vengono fornite dalla connessione. |
| Nome driver JDBC | Sì | Sì | Il driver JDBC da utilizzare. Il valore predefinito è Nessun plug-in JDBC. |
| Stringa di connessione | Sì | Sì | Stringa di connessione JDBC, incluso il nome del database. |
| Nome utente | Sì | No | L'identità utente per la connessione al database. Obbligatorio per i database che richiedono l'autenticazione. Facoltativo per i database che non richiedono l'autenticazione. |
| Password | Sì | No | La password da utilizzare per connettersi al database specificato. Obbligatorio per i database che richiedono l'autenticazione. Facoltativo per i database che non richiedono l'autenticazione. |
| Argomenti di connessione | Sì | No | Un elenco di coppie tag/valore di stringhe arbitrarie come argomenti di connessione.
Per i driver JDBC che richiedono una configurazione aggiuntiva, questi argomenti vengono
passati al driver JDBC come argomenti di connessione nel seguente
formato: key1=value1;key2=value. |
| Nome di riferimento | No | Sì | Un nome che identifica in modo univoco questa origine per la derivazione e l'annotazione metadata. Di solito è il nome della tabella o della visualizzazione. |
| Ottieni schema | No | No | Lo schema dei record di output dell'origine. Viene utilizzato al posto dello schema restituito dalla query. Deve corrispondere allo schema restituito dalla query, tranne per il fatto che puoi contrassegnare i campi come nullable e può contenere un sottoinsieme dei campi. |
| Importa query | Sì | Sì | La query SELECT per importare i dati dalla tabella specificata. Puoi specificare un numero arbitrario di colonne da importare o
importare tutte le colonne utilizzando *. La query deve contenere la
$CONDITIONS stringa. Ad esempio,
SELECT * FROM table WHERE $CONDITIONS. La
$CONDITIONS stringa viene sostituita dal limite del campo splitBy specificato nel campo Query di delimitazione. La stringa
$CONDITIONS non è obbligatoria se il campo Numero di
suddivisioni è impostato su 1. |
| Query di delimitazione | Sì | No | La query di delimitazione che restituisce il valore minimo e massimo dei valori
dalla colonna di suddivisione. Ad esempio,
SELECT MIN(id),MAX(id) FROM table. Non è obbligatorio se il
numero di suddivisioni è impostato su 1. |
| Nome campo di suddivisione | Sì | No | Il nome del campo utilizzato per generare le suddivisioni. Non è obbligatorio se il numero di suddivisioni da generare è impostato su 1. |
| Numero di suddivisioni da generare | Sì | No | Il numero di suddivisioni da generare. Il valore predefinito è 1. |
| Dimensioni recupero | Sì | No | Il numero di righe da recuperare alla volta per suddivisione. Una dimensione di recupero maggiore può causare un'importazione più rapida, con il compromesso di una maggiore memoria utilizzata. Il valore predefinito è 1000. |
| Attiva commit automatico | No | No | Indica se attivare il commit automatico per le query eseguite da questa origine. Mantieni
questa impostazione su False a meno che non utilizzi un driver JDBC che
causa un errore quando viene eseguita l'operazione di commit. Il valore predefinito è False. |
| Maiuscole/minuscole del nome della colonna | Sì | No | Imposta le maiuscole/minuscole dei nomi delle colonne restituiti dalla query. Puoi
scegliere maiuscolo o minuscolo. Per impostazione predefinita o per qualsiasi altro input,
i nomi delle colonne non vengono modificati e vengono utilizzate le maiuscole/minuscole restituite dal
database. L'impostazione di questa proprietà garantisce la prevedibilità delle maiuscole/minuscole dei nomi delle colonne in database diversi, ma potrebbe causare conflitti tra i nomi delle colonne se più nomi di colonne sono uguali quando le maiuscole/minuscole vengono ignorate. Il valore predefinito è Nessuna modifica. |
| Livello di isolamento delle transazioni | Sì | No | Il livello di isolamento delle transazioni per le query eseguite da questo sink. Per saperne di più, consulta setTransactionIsolation().
Il driver JDBC di Phoenix genera un'eccezione se il database Phoenix
non ha le transazioni attivate e questo campo è impostato su
true. Per i driver di questo tipo, imposta questo campo su
TRANSACTION_NONE.Il valore predefinito è TRANSACTION_SERIALIZABLE. |
| Pattern da sostituire | No | No | Il pattern da sostituire nel nome del campo nella tabella (in genere utilizzato con la Sostituisci con proprietà). Se la Sostituisci con proprietà non è impostata, il pattern viene rimosso dal nome del campo. |
| Sostituisci con | No | No | La stringa sostituita nel nome del campo nella tabella. Devi anche configurare il campo Pattern da sostituire. |
| Schema di output | No | No | Specifica lo schema di output. Nel record di output sono incluse solo le colonne definite nello schema sono incluse nel record di output. |
Best practice
Verifica se è disponibile un plug-in più specifico per il tuo database. Ad esempio, se hai un'origine database Oracle, utilizza invece il plug-in dell'origine batch di database Oracle perché è progettato per funzionare con lo schema Oracle.
Note di rilascio
Passaggi successivi
- Scopri di più sui plug-in in Cloud Data Fusion.