Comparar tipos de tablas

Elegir la arquitectura de tablas adecuada es fundamental para maximizar el rendimiento, reducir los costos y garantizar el acceso a los datos en todas tus herramientas de estadísticas. En esta página, se explican los diferentes tipos de tablas y extremos de servicio disponibles en Lakehouse sin bordes, lo que te ayuda a elegir la mejor opción según tus motores de escritura, requisitos de lectura y necesidades de control de administración.

Formatos de tabla por catálogo o motor

Selecciona un catálogo o un motor para obtener información sobre los formatos de tabla compatibles, la configuración del metastore, las capacidades de optimización del almacenamiento y la interoperabilidad del motor.

Catálogo de entorno de ejecución de Lakehouse

El catálogo del entorno de ejecución de Lakehouse administra las tablas de Apache Iceberg a través del extremo del catálogo de REST de Iceberg y proporciona interoperabilidad de lectura y escritura sin interrupciones en los motores compatibles con Iceberg (Spark, Flink, Trino) y BigQuery, al mismo tiempo que está respaldado por la interfaz del catálogo de REST de Iceberg estándar de la industria.

Formatos de tabla compatibles

Se admiten las tablas de Apache Iceberg V2 (DG) y V3 (versión preliminar). No se admiten las tablas de Iceberg V1. Antes de usar tablas de la versión 1 existentes con Lakehouse, debes actualizarlas a una versión compatible. Para obtener más información, consulta Actualiza las tablas de Iceberg V1 a V2.

Las funciones clave incluyen las siguientes:

  • Metastore: Catálogo de entorno de ejecución de Lakehouse.
  • Almacenamiento: Cloud Storage.
  • Optimización del almacenamiento: La administras tú o, de forma opcional, Google (versión preliminar).
  • Acceso de lectura y escritura:
    • Motores de código abierto: lectura y escritura (GA)
    • BigQuery: lectura y escritura (vista previa)
  • Casos de uso: Lakehouse abierto con almacenamiento de alto rendimiento y nivel empresarial para estadísticas avanzadas, transmisión y IA.

Hive Metastore

El catálogo de entorno de ejecución de Lakehouse administra las tablas de Apache Hive a través de un extremo de metastore de Apache Hive (HMS) optimizado para la compatibilidad con Apache SparkExternalCatalog, lo que te permite compartir datos sin problemas en Apache Spark, Apache Hive y BigQuery. Creas estas tablas a partir de motores de código abierto y las almacenas en Cloud Storage. Esta opción es la mejor si deseas que los motores de código abierto administren tu flujo de trabajo de ETL sin necesidad de un metastore de Hive autohospedado independiente y solo requieres acceso de lectura desde BigQuery.

Las tablas administradas por el extremo de Hive metastore son tablas estándar de Apache Hive y Spark (que usan Hive SerDes o fuentes de datos de Spark), no tablas de Apache Iceberg. Para crear y administrar tablas de Apache Iceberg en el catálogo del entorno de ejecución de Lakehouse, usa el extremo del catálogo de REST de Iceberg.

Las funciones clave incluyen las siguientes:

  • Metastore: Catálogo de entorno de ejecución de Lakehouse (a través de IMetastoreClient personalizado).
  • Almacenamiento: Cloud Storage (compatible con formatos como Parquet, ORC y Avro)
  • Optimización del almacenamiento: La administras tú o un tercero.
  • Acceso de lectura y escritura:
    • Motores de código abierto (Spark y Hive): Lectura y escritura
    • BigQuery: Solo lectura.
  • Casos de uso: Migrar cargas de trabajo existentes de Spark y Hive a un metastore sin servidores completamente administrado en Google Cloud.

Formatos de tabla por producto

Usa el siguiente gráfico para comparar los tipos de tablas en el catálogo del entorno de ejecución de Lakehouse.

Lakehouse

Apache Iceberg (GA) Acceso a los datos multinube (versión preliminar) Apache Hive (vista previa)
Metastore Catálogo de entorno de ejecución de Lakehouse Catálogo de entorno de ejecución de Lakehouse Catálogo de entorno de ejecución de Lakehouse
Almacenamiento Cloud Storage Cloud Storage o Amazon S3 Cloud Storage
Optimización del almacenamiento Administrado por el cliente, por terceros o por Google (vista previa) Administrado por el cliente o por terceros Administrado por el cliente o por terceros
Lectura y escritura Motores de código abierto (lectura y escritura)

BigQuery (lectura y escritura [versión preliminar])
Motores de código abierto (lectura)

BigQuery (lectura)
Motores de código abierto (lectura y escritura)

BigQuery (solo lectura)
Operaciones avanzadas Ninguno Ninguna Ninguno
Control de acceso Seguridad a nivel de la tabla con IAM Seguridad a nivel de la tabla con IAM Seguridad a nivel de la tabla con IAM
Casos de uso Lakehouse abierto Consulta datos en otros proveedores de servicios en la nube sin migrar archivos ni crear canalizaciones de ETL complejas. Migra las cargas de trabajo existentes de Spark y Hive a un metastore sin servidores completamente administrado

Funciones de las tablas de Iceberg

Usa la siguiente tabla para obtener más información sobre las capacidades que ofrecen las tablas de Apache Iceberg en el catálogo del entorno de ejecución de Lakehouse.

Función Asistencia
Catalog Catálogo de entorno de ejecución de Lakehouse (compatible con el catálogo de REST de Iceberg)
Almacenamiento Cloud Storage
Se puede acceder a través del extremo del catálogo de REST de Iceberg Sí
Interoperabilidad de lectura y escritura
Consultas de lectura de BigQuery (SELECT, BQML, funciones de IA) Compatible (DG)
DML de BigQuery (INSERT, UPDATE, DELETE, MERGE) Compatible (versión preliminar)
Lecturas del motor de OSS Compatible (DG)
Escrituras del motor de OSS Compatible (DG)
Escrituras de transmisión del motor de OSS (Kafka, Spark, Dataflow con receptor de E/S de Iceberg) Compatible (DG)
Funciones administradas y avanzadas
Administración de tablas (compactación y recolección de elementos no utilizados) Compatible (versión preliminar)
Captura de datos modificados (CDC) de BigQuery Compatible (versión preliminar)
Viaje en el tiempo
Acceder a datos históricos (con motores de OSS) Flexible (se configura a través de las propiedades de la tabla)
Viaje en el tiempo (con BigQuery) Límite de 7 días
Historial de instantáneas y reversión a una instantánea anterior Compatible (DG)
Funciones de Knowledge Catalog
Categorización, búsqueda y descubrimiento de metadatos Compatible (DG)
Linaje Compatible (DG)
Calidad de los datos y creación de perfiles Compatible (DG)
Estadísticas Compatible (DG)
Generación de descripciones de columnas y tablas basadas en IA Compatible (DG)

¿Qué sigue?