BigQuery에서 경계 없는 Lakehouse 데이터와 상호작용
경계 없는 Lakehouse는 고급 분석 및 AI를 위한 통합 인터페이스를 만들기 위해 Google Cloud 및 오픈소스 서비스를 통합하는 스토리지 엔진입니다. Apache Iceberg를 사용하여 자동화된 데이터 관리 및 기본 제공 거버넌스를 통해 개방형 관리형 고성능 레이크하우스를 빌드할 수 있는 기반을 제공합니다.
Lakehouse에서 테이블을 만들면 BigQuery에서 자동으로 쿼리할 수 있으며 콘솔의 BigQuery 페이지에 표시됩니다. Google Cloud Lakehouse 네임스페이스와 스키마도 BigQuery 데이터 세트에 자동으로 매핑됩니다.
Lakehouse 리소스와 다른 BigQuery 리소스의 차이점
다음은 Lakehouse와 표준 BigQuery 리소스 간의 주요 차이점입니다.
- Lakehouse 데이터 세트는 콘솔의 Google Cloud BigQuery 페이지에 물 아이콘 옆에 표시됩니다.
- BigQuery에서 Lakehouse 리소스를 수정할 수 없습니다.
- Lakehouse 리소스에는 각 세부정보 섹션에 추가 메타데이터가 있습니다.
Iceberg 테이블 기능 비교
다음 표를 사용하여 Lakehouse 런타임 카탈로그에서 관리하는 Apache Iceberg 테이블과 BigQuery에서 관리하는 Apache Iceberg 테이블 간의 기능을 비교합니다.
| 기능 | Lakehouse 런타임 카탈로그에서 관리하는 Apache Iceberg 테이블 | BigQuery에서 관리하는 Apache Iceberg 테이블 |
|---|---|---|
| 카탈로그 | Lakehouse 런타임 카탈로그 (Iceberg REST 카탈로그 호환) | BigQuery |
| 스토리지 | Cloud Storage | Cloud Storage |
| Iceberg REST 카탈로그 엔드포인트를 통해 액세스 가능 | 예 | 예(BigQuery 카탈로그 통합 사용) |
| 읽기/쓰기 상호 운용성 | ||
| BigQuery 읽기 쿼리 (SELECT, BQML, AI 함수) | 지원됨 | 지원됨 |
| BigQuery DML (INSERT, UPDATE, DELETE, MERGE) | 지원됨 (미리보기) | 지원됨 (GA) |
| OSS 엔진 읽기 | 지원됨 (GA) | 지원됨 (GA) (BigQuery 카탈로그 통합 사용) |
| OSS 엔진 쓰기 | 지원됨 (GA) | 지원되지 않음 |
| OSS 엔진 스트리밍 쓰기 (Kafka, Spark, Iceberg I/O 싱크가 있는 Dataflow) | 지원됨 (GA) | 지원되지 않음 |
| 관리형 및 고급 기능 | ||
| 테이블 관리 (압축, 가비지 컬렉션) | 지원됨 (미리보기) | 지원됨 (GA) |
| BigQuery 스트리밍 쓰기 (스토리지 쓰기 API) | 지원되지 않음 | 지원됨 (GA) |
| Pub/Sub 스트리밍/구독, BigQuery I/O 싱크가 있는 Dataflow 스트리밍 | 지원되지 않음 | 지원됨 (GA) |
| BigQuery 변경 데이터 캡처 (CDC) | 지원되지 않음 | 지원됨 (비공개 미리보기) |
| BigQuery 멀티 문 트랜잭션 | 지원되지 않음 | 지원됨 (미리보기) |
| 관리형 재해 복구 | 지원되지 않음 | 지원되지 않음 |
| 검색 색인 | 지원되지 않음 | 지원되지 않음 |
| 벡터 색인 (자동 임베딩 생성 포함) | 지원되지 않음 | 지원되지 않음 |
| 시간 이동 | ||
| 시간 이동 (OSS 엔진 사용) | 유연함 (테이블 속성을 통해 구성) | 지원되지 않음 |
| 시간 이동 (BigQuery 사용) | 7일로 제한됨 | 7일로 제한됨 |
| 스냅샷 기록 및 이전 스냅샷으로 롤백 | 지원됨 | 지원되지 않음 |
| 거버넌스, 보안, 공유 | ||
| BigQuery 승인 뷰 | 지원되지 않음 | 지원되지 않음 |
| BigQuery 열 수준 보안 | 지원되지 않음 | 지원됨 (GA) |
| BigQuery 데이터 마스킹 및 정책 태그 | 지원되지 않음 | 지원됨 (GA) |
| BigQuery 행 수준 보안 | 지원되지 않음 | 지원되지 않음 |
| Analytics Hub 통합 | 지원되지 않음 | 지원됨 |
| Knowledge Catalog 기능 | ||
| 메타데이터 카탈로그 처리, 검색, 탐색 | 지원됨 | 지원됨 |
| 계보 | 지원됨 | 지원됨 |
| 데이터 품질/프로파일링 | 지원됨 | 지원됨 |
| 통계 | 지원됨 | 지원됨 |
| AI 기반 열 및 테이블 설명 생성 | 지원됨 | 지원됨 |
교차 클라우드 데이터 액세스
Lakehouse의 교차 클라우드 데이터 액세스 기능 을 사용하면 파일을 마이그레이션하거나 복잡한 ETL 파이프라인을 빌드하지 않고도 BigQuery에서 다른 클라우드 제공업체에 저장된 데이터를 직접 쿼리할 수 있습니다. 구성 정보는 원격 데이터 쿼리를 참고하세요.