Descripción general de las tablas de Apache Iceberg

Las tablas de Apache Iceberg, administradas por el catálogo de tiempo de ejecución de Lakehouse y el extremo del catálogo REST de Iceberg, son tablas de Iceberg abiertas e interoperables que cumplen con la especificación de la tabla de Apache Iceberg de código abierto, que se puede leer y escribir con cualquier motor de procesamiento compatible con Iceberg o BigQuery.

En este documento, se hace referencia a estas tablas como "tablas de Iceberg de Lakehouse" o "tablas de Iceberg".

Puedes habilitar las siguientes capacidades y participar en ellas configurando las opciones de la tabla: :

  1. Interoperabilidad de lectura y escritura (versión preliminar): Compatibilidad de lectura y escritura sin problemas para varios motores, incluidos BigQuery, Managed Service para Apache Spark, motores compatibles con Iceberg, como motores de código abierto (Apache Spark, Apache Flink y Trino) y motores externos (como Snowflake).
  2. Administración automática de tablas (versión preliminar): Administración automática de tablas (optimización del almacenamiento), como la compactación y la recolección de elementos no utilizados.

Además de las capacidades anteriores, las siguientes capacidades también son compatibles de forma predeterminada con las tablas de Iceberg de Lakehouse (versión preliminar).

  1. Lenguaje de definición de datos (DDL) de BigQuery (versión preliminar): También puedes crear o actualizar tablas de Iceberg con sentencias DDL de BigQuery (por ejemplo, CREATE TABLE, ALTER TABLE, y DROP TABLE), además de crear o actualizar tablas con motores compatibles con Iceberg, como Spark, Flink, y Trino. Una vez que se crean las tablas, están disponibles para lectura y escritura en esos motores y en BigQuery, y forman parte de la misma estructura de catálogo y espacio de nombres, administrada por el catálogo de tiempo de ejecución de Lakehouse.
  2. Compatibilidad con la venta de credenciales para BigQuery (versión preliminar): BigQuery admite el uso de la venta de credenciales para la autenticación cuando se leen o escriben tablas de Iceberg en el catálogo de tiempo de ejecución de Lakehouse. Puedes configurar la venta de credenciales a nivel del catálogo.

Acciones de administración

Puedes realizar las siguientes acciones de administración en tus tablas de Apache Iceberg:

  • Crea una tabla: Crea una tabla de Apache Iceberg dentro de un espacio de nombres del catálogo con la Google Cloud consola, Spark, Trino, gcloud, BigQuery (versión preliminar) o la API del catálogo REST de Iceberg (CreateIcebergTable).
  • Registra una tabla: Registra una tabla de Apache Iceberg existente dentro de un espacio de nombres del catálogo con gcloud o la API del catálogo REST de Iceberg (RegisterIcebergTable).
  • Enumera las tablas: Visualiza los identificadores de tabla dentro de un espacio de nombres con la Google Cloud consola, Spark, Trino, gcloud, BigQuery (versión preliminar) o la API del catálogo REST de Iceberg (ListIcebergTableIdentifiers).
  • Obtén detalles de la tabla: Inspecciona el esquema, las propiedades y las credenciales de la tabla con la Google Cloud consola, Spark, Trino, gcloud, BigQuery (versión preliminar) o la API del catálogo REST de Iceberg (GetIcebergTable, LoadIcebergTableCredentials).
  • Inserta datos: Agrega filas de datos a tus tablas de Iceberg con Spark, Trino o BigQuery (versión preliminar).
  • Consulta una tabla: Ejecuta consultas en tus tablas de Iceberg desde Spark, Trino o BigQuery (versión preliminar) con nombres de tabla de cuatro partes.
  • Modifica datos con DML: Actualiza, borra o combina filas de datos en tus tablas de Iceberg con sentencias DML de BigQuery (versión preliminar), Spark o Trino.
  • Modifica una tabla: Desarrolla el esquema de la tabla y actualiza las propiedades de los metadatos con la Google Cloud consola, Spark, Trino, gcloud, BigQuery (versión preliminar) o la API del catálogo REST de Iceberg (UpdateIcebergTable).
  • Configura las opciones de la tabla: Configura las propiedades para habilitar DML de BigQuery (versión preliminar) y la administración automática de tablas.
  • Administra las LCA de la tabla: Visualiza y actualiza las políticas de IAM en tus tablas de Iceberg para controlar el acceso de principales específicos (get-iam-policy, set-iam-policy).
  • Actualiza las tablas de Iceberg V1 a V2: Actualiza tus tablas de Iceberg V1 existentes al formato V2 compatible.
  • Usa vectores de borrado binario en tablas de Iceberg V3: Habilita vectores de borrado binario para un rendimiento de borrado optimizado en tablas de Iceberg V3.
  • Borra una tabla: Quita el registro de una tabla del catálogo sin borrar los archivos de almacenamiento subyacentes con la Google Cloud consola, Spark, Trino, gcloud, BigQuery (versión preliminar) o la API del catálogo REST de Iceberg (DeleteIcebergTable).

¿Qué sigue?