La creazione di una tabella Apache Iceberg inizializza nuovi metadati e spazio di archiviazione della tabella all'interno di uno spazio dei nomi nel catalogo runtime lakehouse.
Se vuoi rendere disponibile una tabella Apache Iceberg esistente nel catalogo, consulta Registrare una tabella.
Se non specifichi una posizione di archiviazione esplicita a livello di spazio dei nomi o tabella durante la creazione della tabella, il sistema crea automaticamente le directory di metadati e dati della tabella nella posizione predefinita del catalogo (derivata dal bucket Cloud Storage di base del catalogo) aggiungendo gli identificatori dello spazio dei nomi e della tabella.
Prima di iniziare
-
Verifica che la fatturazione sia attivata per il tuo progetto Google Cloud .
-
Abilita l'API BigLake, se non è già abilitata.
Ruoli richiesti per abilitare le API
Per abilitare le API, devi disporre dell'autorizzazione
serviceusage.services.enable. Se hai creato il progetto, probabilmente disponi già di questa autorizzazione tramite il ruolo Proprietario (roles/owner). In caso contrario, puoi ottenere questa autorizzazione tramite il ruolo Amministratore utilizzo dei servizi (roles/serviceusage.serviceUsageAdmin). Scopri come concedere i ruoli. - Configura il catalogo runtime Lakehouse con l'endpoint del catalogo REST Apache Iceberg.
Ruoli obbligatori
Per ottenere le autorizzazioni necessarie per creare una tabella, chiedi all'amministratore di concederti i seguenti ruoli IAM per il progetto e il bucket di archiviazione:
-
Crea una tabella:
- BigLake Admin (
roles/biglake.admin) - il tuo progetto - Amministratore Storage (
roles/storage.admin): il bucket Cloud Storage di destinazione
- BigLake Admin (
Per saperne di più sulla concessione dei ruoli, consulta Gestisci l'accesso a progetti, cartelle e organizzazioni.
Potresti anche riuscire a ottenere le autorizzazioni richieste tramite i ruoli personalizzati o altri ruoli predefiniti.
Funzionalità e supporto delle tabelle
Quando utilizzi le tabelle nel catalogo del runtime Lakehouse, è utile comprendere i diversi tipi di tabelle e le relative funzionalità di attivazione. Per saperne di più sull'utilizzo delle tabelle Apache Iceberg in particolare, consulta Panoramica delle tabelle Apache Iceberg.
Tabelle Iceberg supportate
Sono supportate solo le tabelle Apache Iceberg V2 (GA) e V3 (anteprima). Le tabelle Iceberg V1 non sono supportate. Per eseguire l'upgrade delle tabelle V1 esistenti, consulta Eseguire l'upgrade delle tabelle Iceberg V1 alla versione V2.
Utilizzare le opzioni della tabella (anteprima)
Puoi attivare l'utilizzo delle funzionalità gestite di BigQuery, come il DML (Data Manipulation Language) di BigQuery e la gestione automatica delle tabelle, configurando proprietà specifiche delle tabelle. Queste funzionalità vengono attivate in modi diversi a seconda di dove viene creata la tabella:
- Da BigQuery:BigQuery DML e la gestione automatica delle tabelle sono abilitati per impostazione predefinita.
- Dai motori open source:per attivare la funzionalità, devi configurare esplicitamente le proprietà della tabella. Per saperne di più, consulta Configurare le opzioni della tabella.
Creare una tabella
Crea una tabella Iceberg.
Console
Nella console Google Cloud , vai a Lakehouse.
Seleziona un catalogo esistente o creane uno se non ne hai.
Seleziona uno spazio dei nomi esistente o creane uno se non ne hai.
Nella barra dei menu, fai clic su + Crea tabella.
Per Formato tabella, seleziona Iceberg.
In Nome tabella, inserisci un nome tabella univoco.
(Facoltativo) Nella sezione Proprietà, configura le proprietà della tabella. Sono elencate proprietà predefinite come
gcp.biglake.bigquery-dml.enabledegcp.biglake.table-management.enabled.Ad esempio, puoi modificare questi valori in
trueper abilitare BigQuery DML o la gestione automatica delle tabelle. Per saperne di più, consulta Configurare le opzioni della tabella.Fai clic su Crea.
La tabella viene visualizzata nella pagina Dettagli spazio dei nomi.
Spark
spark.sql("CREATE TABLE NAMESPACE_NAME.TABLE_NAME (id int, data string) USING ICEBERG;")
Sostituisci i seguenti valori:
NAMESPACE_NAME: il nome del tuo spazio dei nomi.TABLE_NAME: un nome per la tabella.
Per attivare l'interoperabilità in lettura/scrittura e la gestione delle tabelle (anteprima), aggiungi le proprietà alla clausola TBLPROPERTIES:
TBLPROPERTIES (
'gcp.biglake.bigquery-dml.enabled' = true,
'gcp.biglake.table-management.enabled' = true
)
Trino
CREATE TABLE SCHEMA_NAME.TABLE_NAME (id int, data varchar);
Sostituisci i seguenti valori:
SCHEMA_NAME: il nome dello schema.TABLE_NAME: un nome per la tabella.
Per attivare l'interoperabilità in lettura/scrittura e la gestione delle tabelle (anteprima), aggiungi queste proprietà alla clausola WITH:
WITH (
"gcp.biglake.bigquery-dml.enabled" = 'true',
"gcp.biglake.table-management.enabled" = 'true'
)
gcloud
Per creare una tabella utilizzando gcloud, esegui il comando gcloud biglake iceberg tables create.
gcloud biglake iceberg tables create \ --project="PROJECT_ID" \ --catalog="CATALOG_ID" \ --namespace="NAMESPACE_NAME" \ --create-from-file="TABLE_DEFINITION_FILE"
Sostituisci quanto segue:
PROJECT_ID: il tuo ID progetto Google Cloud .CATALOG_ID: l'ID del catalogo.NAMESPACE_NAME: il nome dello spazio dei nomi del catalogo.TABLE_DEFINITION_FILE: il percorso di un file JSON contenente la definizione della tabella Iceberg.
BigQuery
Per creare una tabella Apache Iceberg nel catalogo del runtime Lakehouse da BigQuery, utilizza la seguente istruzione CREATE TABLE GoogleSQL. Quando crei una tabella da BigQuery, BigQuery DML e la gestione automatica delle tabelle sono abilitati per impostazione predefinita.
CREATE TABLE `PROJECT_ID.CATALOG_ID.NAMESPACE.TABLE_NAME` (id int, data string);
Sostituisci quanto segue:
PROJECT_ID: il tuo Google Cloud ID progettoCATALOG_ID: l'ID del catalogo runtime LakehouseNAMESPACE: il nome dello spazio dei nomi IcebergTABLE_NAME: un nome per la tabella Iceberg
REST
Per creare una tabella Iceberg utilizzando l'API REST, invia una richiesta POST all'endpoint
CreateIcebergTable:
POST /iceberg/v1/restcatalog/v1/projects/PROJECT_ID/catalogs/CATALOG_ID/namespaces/NAMESPACE_NAME/tables
Il corpo della richiesta deve contenere un payload JSON Iceberg CreateTableRequest valido che definisce lo schema della tabella, la specifica della partizione e le proprietà iniziali.
Sostituisci quanto segue:
PROJECT_ID: il tuo ID progetto Google Cloud .CATALOG_ID: l'ID del catalogo.NAMESPACE_NAME: il nome dello spazio dei nomi del catalogo.
Passaggi successivi
- Scopri come elencare le tabelle.
- Scopri come inserire i dati in una tabella.
- Scopri come gestire gli elenchi di controllo degli accessi delle tabelle.