표 유형 비교

올바른 테이블 아키텍처를 선택하는 것은 성능을 극대화하고 비용을 절감하며 분석 도구 전반에서 데이터 액세스를 보장하는 데 매우 중요합니다. 이 페이지에서는 테두리 없는 Lakehouse에서 사용할 수 있는 다양한 테이블 유형과 서비스 엔드포인트를 설명하여 쓰기 엔진, 읽기 요구사항, 관리 제어 요구사항에 따라 최적의 옵션을 선택할 수 있도록 지원합니다.

카탈로그 또는 엔진별 표 형식

지원되는 테이블 형식, 메타 스토어 구성, 스토리지 최적화 기능, 엔진 상호 운용성에 대해 알아보려면 카탈로그 또는 엔진을 선택하세요.

Lakehouse 런타임 카탈로그

Lakehouse 런타임 카탈로그는 Iceberg REST 카탈로그 엔드포인트를 통해 Apache Iceberg 테이블을 관리하고, 업계 표준인 Iceberg REST 카탈로그 인터페이스를 기반으로 하면서 Iceberg 호환 엔진 (Spark, Flink, Trino)과 BigQuery 간에 원활한 읽기-쓰기 상호 운용성을 제공합니다.

지원되는 표 형식

Apache Iceberg V2 테이블 (정식 버전) 및 V3 테이블 (미리보기)이 지원됩니다. Iceberg V1 테이블은 지원되지 않습니다. 레이크하우스에서 기존 V1 테이블을 사용하려면 지원되는 버전으로 업그레이드해야 합니다. 자세한 내용은 Iceberg V1 테이블을 V2로 업그레이드를 참고하세요.

주요 기능은 다음과 같습니다.

  • Metastore: Lakehouse 런타임 카탈로그입니다.
  • 스토리지: Cloud Storage
  • 스토리지 최적화: 사용자가 관리하거나 선택적으로 Google에서 관리(미리보기)
  • 읽기 및 쓰기 액세스:
    • 오픈소스 엔진: 읽기 및 쓰기 (GA)
    • BigQuery: 읽기/쓰기 (미리보기)
  • 사용 사례: 고급 분석, 스트리밍, AI를 위한 고성능 엔터프라이즈급 스토리지가 있는 개방형 레이크하우스

Hive metastore

Lakehouse 런타임 카탈로그는 Apache Spark ExternalCatalog 호환성에 최적화된 Apache Hive 메타스토어 (HMS) 엔드포인트를 통해 Apache Hive 테이블을 관리하므로 Apache Spark, Apache Hive, BigQuery 간에 데이터를 원활하게 공유할 수 있습니다. 오픈소스 엔진에서 이러한 테이블을 만들고 Cloud Storage에 저장합니다. 이 옵션은 별도의 자체 호스팅 Hive metastore가 필요하지 않고 BigQuery의 읽기 액세스만 필요한 경우 ETL 워크플로를 오픈소스 엔진으로 관리하려는 경우에 가장 적합합니다.

Hive Metastore 엔드포인트에서 관리하는 테이블은 Apache Iceberg 테이블이 아닌 표준 Apache Hive 및 Spark 테이블 (Hive SerDes 또는 Spark 데이터 소스 사용)입니다. Lakehouse 런타임 카탈로그에서 Apache Iceberg 테이블을 만들고 관리하려면 대신 Iceberg REST 카탈로그 엔드포인트를 사용하세요.

주요 기능은 다음과 같습니다.

  • Metastore: Lakehouse 런타임 카탈로그 (맞춤 IMetastoreClient 사용).
  • 스토리지: Cloud Storage (Parquet, ORC, Avro와 같은 형식 지원)
  • 스토리지 최적화: 사용자가 관리하거나 서드 파티가 관리합니다.
  • 읽기 및 쓰기 액세스:
    • 오픈소스 엔진 (Spark 및 Hive): 읽기 및 쓰기
    • BigQuery: 읽기 전용
  • 사용 사례: 기존 Spark 및 Hive 워크로드를 Google Cloud의 완전 관리형 서버리스 metastore로 이전합니다.

제품별 표 형식

다음 차트를 사용하여 Lakehouse 런타임 카탈로그의 표 유형을 비교하세요.

레이크하우스

Apache Iceberg (GA) 크로스 클라우드 데이터 액세스 (미리보기) Apache Hive (미리보기)
metastore Lakehouse 런타임 카탈로그 Lakehouse 런타임 카탈로그 Lakehouse 런타임 카탈로그
스토리지 Cloud Storage Cloud Storage / Amazon S3 Cloud Storage
스토리지 최적화 고객, 서드 파티 관리 또는 Google 관리 (미리보기) 고객 또는 서드 파티 관리 고객 또는 서드 파티 관리
읽기/쓰기 오픈소스 엔진 (읽기/쓰기)

BigQuery (읽기/쓰기[프리뷰])
오픈소스 엔진 (읽기)

BigQuery (읽기)
오픈소스 엔진 (읽기/쓰기)

BigQuery (읽기 전용)
고급 작업 없음 없음 없음
액세스 제어 IAM을 사용한 테이블 수준 보안 IAM을 사용한 테이블 수준 보안 IAM을 사용한 테이블 수준 보안
사용 사례 개방형 레이크하우스 파일을 마이그레이션하거나 복잡한 ETL 파이프라인을 빌드하지 않고 다른 클라우드 제공업체의 데이터를 쿼리합니다. 기존 Spark 및 Hive 워크로드를 완전 관리형 서버리스 metastore로 이전

Iceberg 테이블 기능

다음 표를 사용하여 Lakehouse 런타임 카탈로그의 Apache Iceberg 테이블에서 제공하는 기능에 대해 자세히 알아보세요.

기능 지원
카탈로그 Lakehouse 런타임 카탈로그 (Iceberg REST 카탈로그와 호환)
스토리지 Cloud Storage
Iceberg REST 카탈로그 엔드포인트를 통해 액세스 가능
읽기/쓰기 상호 운용성
BigQuery 읽기 쿼리 (SELECT, BQML, AI 함수) 지원됨 (GA)
BigQuery DML (INSERT, UPDATE, DELETE, MERGE) 지원됨 (미리보기)
OSS 엔진 읽기 지원됨 (GA)
OSS 엔진 쓰기 지원됨 (GA)
OSS 엔진 스트리밍 쓰기 (Kafka, Spark, Dataflow with Iceberg I/O 싱크) 지원됨 (GA)
관리 및 고급 기능
테이블 관리 (압축, 가비지 컬렉션) 지원됨 (미리보기)
시간 여행
시간 이동 (OSS 엔진 사용) 유연함 (표 속성을 통해 구성)
시간 이동 (BigQuery 사용) 7일로 제한
스냅샷 기록 및 이전 스냅샷으로 롤백 지원됨 (GA)
Knowledge Catalog 기능
메타데이터 카탈로그화, 검색 및 탐색 지원됨 (GA)
계보 지원됨 (GA)
데이터 품질/프로파일링 지원됨 (GA)
통계 지원됨 (GA)
AI 기반 열 및 테이블 설명 생성 지원됨 (GA)

다음 단계