Elegir la arquitectura de tabla adecuada es fundamental para maximizar el rendimiento, reducir los costos y garantizar el acceso a los datos en tus herramientas de estadísticas. En esta página, se explican los diferentes tipos de tablas y los extremos de servicio disponibles en Lakehouse sin bordes, lo que te ayuda a elegir la mejor opción según tus motores de escritura, requisitos de lectura y necesidades de control de administración.
Formatos de tabla por catálogo o motor
Selecciona un catálogo o motor para obtener información sobre sus formatos de tabla admitidos, la configuración del metastore, las capacidades de optimización del almacenamiento y la interoperabilidad del motor.
Catálogo de entorno de ejecución de Lakehouse
El catálogo de entorno de ejecución de Lakehouse administra las tablas de Apache Iceberg a través de el extremo de catálogo de REST de Iceberg y proporciona una interoperabilidad de lectura y escritura sin interrupciones en los motores compatibles con Iceberg (Spark, Flink, Trino) y BigQuery, mientras que está respaldado por la interfaz de catálogo de REST de Iceberg estándar de la industria.
Formatos de tabla admitidos
Se admiten las tablas de Apache Iceberg V2 (DG) y V3 (vista previa). No se admiten las tablas de Iceberg V1. Antes de usar las tablas V1 existentes con Lakehouse, debes actualizarlas a una versión compatible. Para obtener más información, consulta Actualiza las tablas de Iceberg V1 a V2.
Las funciones clave incluyen las siguientes:
- Metastore: Catálogo de entorno de ejecución de Lakehouse
- Almacenamiento: Cloud Storage
- Optimización del almacenamiento: Administrada por ti o, de manera opcional, por Google (vista previa).
- Acceso de lectura y escritura:
- Motores de código abierto: lectura y escritura (DG)
- BigQuery: lectura/escritura (vista previa)
- Casos de uso: Lakehouse abierto con almacenamiento de alto rendimiento y de nivel empresarial para estadísticas avanzadas, transmisión y IA
Hive Metastore
El catálogo de entorno de ejecución de Lakehouse administra las tablas de Apache Hive a través de un extremo de Hive Metastore (HMS) de Apache optimizado para la compatibilidad con ExternalCatalog de Apache Spark, lo que te permite compartir datos sin problemas en Apache Spark, Apache Hive y BigQuery. Puedes crear estas tablas desde motores de código abierto y almacenarlas en Cloud Storage. Esta opción es la mejor si deseas que tu flujo de trabajo de ETL sea administrado por motores de código abierto sin necesidad de un Hive Metastore autoalojado independiente y solo requieres acceso de lectura desde BigQuery.
Las tablas administradas por el extremo de Hive Metastore son tablas estándar de Apache Hive y Spark (con Hive SerDes o fuentes de datos de Spark), no tablas de Apache Iceberg. Para crear y administrar tablas de Apache Iceberg en el catálogo de entorno de ejecución de Lakehouse, usa el extremo de catálogo de REST de Iceberg.
Las funciones clave incluyen las siguientes:
- Metastore: Catálogo de entorno de ejecución de Lakehouse (a través de
IMetastoreClientpersonalizado) - Almacenamiento: Cloud Storage (admite formatos como Parquet, ORC y Avro)
- Optimización del almacenamiento: Administrada por ti o por un tercero
- Acceso de lectura y escritura:
- Motores de código abierto (Spark y Hive): Lectura y escritura
- BigQuery: Solo lectura
- Casos de uso: Migración de cargas de trabajo existentes de Spark y Hive a un metastore completamente administrado y sin servidores en Google Cloud.
Formatos de tabla por producto
Usa el siguiente gráfico para comparar los tipos de tablas en el catálogo de entorno de ejecución de Lakehouse.
Lakehouse
| Apache Iceberg (DG) | Acceso a los datos entre nubes (vista previa) | Apache Hive (vista previa) | |
|---|---|---|---|
| Metastore | Catálogo de entorno de ejecución de Lakehouse | Catálogo de entorno de ejecución de Lakehouse | Catálogo de entorno de ejecución de Lakehouse |
| Almacenamiento | Cloud Storage | Cloud Storage / Amazon S3 | Cloud Storage |
| Optimización del almacenamiento | Administrado por el cliente, por terceros o por Google (vista previa) | Administrado por el cliente o por terceros | Administrado por el cliente o por terceros |
| Lectura/escritura |
Motores de código abierto (lectura/escritura) BigQuery (lectura/escritura [vista previa]) |
Motores de código abierto (lectura) BigQuery (lectura) |
Motores de código abierto (lectura/escritura) BigQuery (solo lectura) |
| Operaciones avanzadas | Ninguna | Ninguna | Ninguna |
| Control de acceso | Seguridad a nivel de la tabla con IAM | Seguridad a nivel de la tabla con IAM | Seguridad a nivel de la tabla con IAM |
| Casos de uso | Lakehouse abierto | Consulta datos en otros proveedores de servicios en la nube sin migrar archivos ni compilar canalizaciones de ETL complejas. | Migra cargas de trabajo existentes de Spark y Hive a un metastore completamente administrado, sin servidores |
Capacidades de la tabla de Iceberg
Usa la siguiente tabla para obtener más información sobre las capacidades que se ofrecen en las tablas de Apache Iceberg en el catálogo de entorno de ejecución de Lakehouse.
| Función | Asistencia |
|---|---|
| Catálogo | Catálogo de entorno de ejecución de Lakehouse (compatible con el catálogo de REST de Iceberg) |
| Almacenamiento | Cloud Storage |
| Accesible a través del extremo de catálogo de REST de Iceberg | Sí |
| Interoperabilidad de lectura/escritura | |
| Consultas de lectura de BigQuery (SELECT, BQML, funciones de IA) | Admitido (DG) |
| DML de BigQuery (INSERT, UPDATE, DELETE, MERGE) | Admitido (vista previa) |
| Lecturas del motor de OSS | Admitido (DG) |
| Escrituras del motor de OSS | Admitido (DG) |
| Escrituras de transmisión del motor de OSS (Kafka, Spark, Dataflow con receptor de E/S de Iceberg) | Admitido (DG) |
| Capacidades administradas y avanzadas | |
| Administración de tablas (compactación, recolección de elementos no utilizados) | Admitido (vista previa) |
| Viaje en el tiempo | |
| Viaje en el tiempo (con motores de OSS) | Flexible (configurado a través de las propiedades de la tabla) |
| Viaje en el tiempo (con BigQuery) | Límite de 7 días |
| Historial de instantáneas y reversión a la instantánea anterior | Admitido (DG) |
| Capacidades de Knowledge Catalog | |
| Catalogación, búsqueda y descubrimiento de metadatos | Admitido (DG) |
| Linaje | Admitido (DG) |
| Calidad de los datos/creación de perfiles | Admitido (DG) |
| Estadísticas | Admitido (DG) |
| Generación de descripciones de columnas y tablas basadas en IA | Admitido (DG) |
¿Qué sigue?
Obtén información para administrar tablas de Apache Iceberg.
Obtén información para importar tablas externas de Iceberg con Dataflow.