Comparar tipos de tablas

Elegir la arquitectura de tabla adecuada es fundamental para maximizar el rendimiento, reducir los costos y garantizar el acceso a los datos en tus herramientas de estadísticas. En esta página, se explican los diferentes tipos de tablas y los extremos de servicio disponibles en Lakehouse sin bordes, lo que te ayuda a elegir la mejor opción según tus motores de escritura, requisitos de lectura y necesidades de control de administración.

Formatos de tabla por catálogo o motor

Selecciona un catálogo o motor para obtener información sobre sus formatos de tabla admitidos, la configuración del metastore, las capacidades de optimización del almacenamiento y la interoperabilidad del motor.

Catálogo de entorno de ejecución de Lakehouse

El catálogo de entorno de ejecución de Lakehouse administra las tablas de Apache Iceberg a través de el extremo de catálogo de REST de Iceberg y proporciona una interoperabilidad de lectura y escritura sin interrupciones en los motores compatibles con Iceberg (Spark, Flink, Trino) y BigQuery, mientras que está respaldado por la interfaz de catálogo de REST de Iceberg estándar de la industria.

Formatos de tabla admitidos

Se admiten las tablas de Apache Iceberg V2 (DG) y V3 (vista previa). No se admiten las tablas de Iceberg V1. Antes de usar las tablas V1 existentes con Lakehouse, debes actualizarlas a una versión compatible. Para obtener más información, consulta Actualiza las tablas de Iceberg V1 a V2.

Las funciones clave incluyen las siguientes:

  • Metastore: Catálogo de entorno de ejecución de Lakehouse
  • Almacenamiento: Cloud Storage
  • Optimización del almacenamiento: Administrada por ti o, de manera opcional, por Google (vista previa).
  • Acceso de lectura y escritura:
    • Motores de código abierto: lectura y escritura (DG)
    • BigQuery: lectura/escritura (vista previa)
  • Casos de uso: Lakehouse abierto con almacenamiento de alto rendimiento y de nivel empresarial para estadísticas avanzadas, transmisión y IA

Hive Metastore

El catálogo de entorno de ejecución de Lakehouse administra las tablas de Apache Hive a través de un extremo de Hive Metastore (HMS) de Apache optimizado para la compatibilidad con ExternalCatalog de Apache Spark, lo que te permite compartir datos sin problemas en Apache Spark, Apache Hive y BigQuery. Puedes crear estas tablas desde motores de código abierto y almacenarlas en Cloud Storage. Esta opción es la mejor si deseas que tu flujo de trabajo de ETL sea administrado por motores de código abierto sin necesidad de un Hive Metastore autoalojado independiente y solo requieres acceso de lectura desde BigQuery.

Las tablas administradas por el extremo de Hive Metastore son tablas estándar de Apache Hive y Spark (con Hive SerDes o fuentes de datos de Spark), no tablas de Apache Iceberg. Para crear y administrar tablas de Apache Iceberg en el catálogo de entorno de ejecución de Lakehouse, usa el extremo de catálogo de REST de Iceberg.

Las funciones clave incluyen las siguientes:

  • Metastore: Catálogo de entorno de ejecución de Lakehouse (a través de IMetastoreClient personalizado)
  • Almacenamiento: Cloud Storage (admite formatos como Parquet, ORC y Avro)
  • Optimización del almacenamiento: Administrada por ti o por un tercero
  • Acceso de lectura y escritura:
    • Motores de código abierto (Spark y Hive): Lectura y escritura
    • BigQuery: Solo lectura
  • Casos de uso: Migración de cargas de trabajo existentes de Spark y Hive a un metastore completamente administrado y sin servidores en Google Cloud.

Formatos de tabla por producto

Usa el siguiente gráfico para comparar los tipos de tablas en el catálogo de entorno de ejecución de Lakehouse.

Lakehouse

Apache Iceberg (DG) Acceso a los datos entre nubes (vista previa) Apache Hive (vista previa)
Metastore Catálogo de entorno de ejecución de Lakehouse Catálogo de entorno de ejecución de Lakehouse Catálogo de entorno de ejecución de Lakehouse
Almacenamiento Cloud Storage Cloud Storage / Amazon S3 Cloud Storage
Optimización del almacenamiento Administrado por el cliente, por terceros o por Google (vista previa) Administrado por el cliente o por terceros Administrado por el cliente o por terceros
Lectura/escritura Motores de código abierto (lectura/escritura)

BigQuery (lectura/escritura [vista previa])
Motores de código abierto (lectura)

BigQuery (lectura)
Motores de código abierto (lectura/escritura)

BigQuery (solo lectura)
Operaciones avanzadas Ninguna Ninguna Ninguna
Control de acceso Seguridad a nivel de la tabla con IAM Seguridad a nivel de la tabla con IAM Seguridad a nivel de la tabla con IAM
Casos de uso Lakehouse abierto Consulta datos en otros proveedores de servicios en la nube sin migrar archivos ni compilar canalizaciones de ETL complejas. Migra cargas de trabajo existentes de Spark y Hive a un metastore completamente administrado, sin servidores

Capacidades de la tabla de Iceberg

Usa la siguiente tabla para obtener más información sobre las capacidades que se ofrecen en las tablas de Apache Iceberg en el catálogo de entorno de ejecución de Lakehouse.

Función Asistencia
Catálogo Catálogo de entorno de ejecución de Lakehouse (compatible con el catálogo de REST de Iceberg)
Almacenamiento Cloud Storage
Accesible a través del extremo de catálogo de REST de Iceberg
Interoperabilidad de lectura/escritura
Consultas de lectura de BigQuery (SELECT, BQML, funciones de IA) Admitido (DG)
DML de BigQuery (INSERT, UPDATE, DELETE, MERGE) Admitido (vista previa)
Lecturas del motor de OSS Admitido (DG)
Escrituras del motor de OSS Admitido (DG)
Escrituras de transmisión del motor de OSS (Kafka, Spark, Dataflow con receptor de E/S de Iceberg) Admitido (DG)
Capacidades administradas y avanzadas
Administración de tablas (compactación, recolección de elementos no utilizados) Admitido (vista previa)
Viaje en el tiempo
Viaje en el tiempo (con motores de OSS) Flexible (configurado a través de las propiedades de la tabla)
Viaje en el tiempo (con BigQuery) Límite de 7 días
Historial de instantáneas y reversión a la instantánea anterior Admitido (DG)
Capacidades de Knowledge Catalog
Catalogación, búsqueda y descubrimiento de metadatos Admitido (DG)
Linaje Admitido (DG)
Calidad de los datos/creación de perfiles Admitido (DG)
Estadísticas Admitido (DG)
Generación de descripciones de columnas y tablas basadas en IA Admitido (DG)

¿Qué sigue?