Google Cloud 콘솔을 사용하여 Lakehouse에서 Iceberg 테이블 만들기 및 쿼리
이 빠른 시작에서는 Google Cloud 콘솔을 사용하여 경계 없는 Lakehouse에서 스키마, 스냅샷, 스토리지 위치를 비롯한 테이블 메타데이터를 Lakehouse 런타임 카탈로그에 저장하여 Google Cloud 및 오픈소스 엔진 전반에서 Apache Iceberg 테이블을 관리하고 공유하는 방법을 알아봅니다.
이 빠른 시작을 완료하려면Google Cloud 콘솔에서 다음 단계를 수행합니다.
- Cloud Storage 버킷 만들기: Cloud Storage에 버킷을 만들어 Iceberg 테이블 데이터와 메타데이터 파일을 저장합니다.
- 카탈로그 만들기: 사용자 인증 정보 판매가 사용 설정된 버킷으로 지원되는 Lakehouse 런타임 카탈로그에 다중 버킷 카탈로그를 만듭니다.
- 네임스페이스 및 Iceberg 테이블 만들기: Google Cloud 콘솔의 Lakehouse 페이지를 사용하여 BigQuery 데이터 조작 언어 (DML)가 사용 설정된 네임스페이스와 Iceberg 테이블을 만듭니다.
- BigQuery에서 데이터를 수정하고 테이블을 쿼리: BigQuery DML 문 (
INSERT,UPDATE,DELETE)을 사용하여 Iceberg 테이블의 행을 수정하고 4부분 P.C.N.T (Project.Catalog.Namespace.Table) 구문을 사용하여 결과를 쿼리합니다. ETL이나 수동 테이블 등록이 필요하지 않습니다.
시작하기 전에
- Google Cloud 계정에 로그인합니다. Google Cloud를 처음 사용하는 경우 계정을 만들고 Google 제품의 실제 성능을 평가해 보세요. 신규 고객에게는 워크로드를 실행, 테스트, 배포하는 데 사용할 수 있는 $300의 무료 크레딧이 제공됩니다.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
Enable the BigLake, Cloud Storage, and BigQuery APIs, if any are not already enabled.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.-
Make sure that you have the following role or roles on the project: BigLake Admin (
roles/biglake.admin), Storage Admin (roles/storage.admin), and BigQuery Job User (roles/bigquery.jobUser)Check for the roles
-
In the Google Cloud console, go to the IAM page.
Go to IAM - Select the project.
-
In the Principal column, find all rows that identify you or a group that you're included in. To learn which groups you're included in, contact your administrator.
- For all rows that specify or include you, check the Role column to see whether the list of roles includes the required roles.
Grant the roles
-
In the Google Cloud console, go to the IAM page.
Go to IAM - Select the project.
- Click Grant access.
-
In the New principals field, enter your user identifier. This is typically the email address for a Google Account.
- Click Select a role, then search for the role.
- To grant additional roles, click Add another role and add each additional role.
- Click Save.
-
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
Enable the BigLake, Cloud Storage, and BigQuery APIs, if any are not already enabled.
Roles required to enable APIs
To enable APIs, you need the
serviceusage.services.enablepermission. If you created the project, then you likely already have this permission through the Owner role (roles/owner). Otherwise, you can get this permission through the Service Usage Admin role (roles/serviceusage.serviceUsageAdmin). Learn how to grant roles.-
Make sure that you have the following role or roles on the project: BigLake Admin (
roles/biglake.admin), Storage Admin (roles/storage.admin), and BigQuery Job User (roles/bigquery.jobUser)Check for the roles
-
In the Google Cloud console, go to the IAM page.
Go to IAM - Select the project.
-
In the Principal column, find all rows that identify you or a group that you're included in. To learn which groups you're included in, contact your administrator.
- For all rows that specify or include you, check the Role column to see whether the list of roles includes the required roles.
Grant the roles
-
In the Google Cloud console, go to the IAM page.
Go to IAM - Select the project.
- Click Grant access.
-
In the New principals field, enter your user identifier. This is typically the email address for a Google Account.
- Click Select a role, then search for the role.
- To grant additional roles, click Add another role and add each additional role.
- Click Save.
-
Cloud Storage 버킷 만들기
Google Cloud 콘솔에서 Iceberg 테이블 데이터 및 메타데이터 파일을 저장할 Cloud Storage 버킷을 만듭니다.
Google Cloud 콘솔에서 Cloud Storage 버킷 페이지로 이동합니다.
만들기를 클릭합니다.
시작하기 섹션에서 전역적으로 고유한 버킷 이름 (예:
lakehouse-quickstart-UNIQUE_ID또는PROJECT_ID-lakehouse)을 입력한 후 계속을 클릭합니다.데이터 저장 위치 선택 섹션에서 위치 유형을 멀티 리전 (미국 (미국 내 여러 리전))으로 설정한 상태로 두고 만들기를 클릭합니다.
공개 액세스가 차단됨 대화상자가 표시되면 확인을 클릭합니다.
Lakehouse 런타임 카탈로그에서 카탈로그 만들기
Apache Iceberg 테이블의 Lakehouse 런타임 카탈로그에 다중 버킷 카탈로그를 만듭니다. 다중 버킷 카탈로그를 사용하면 버킷 이름과 관계없이 카탈로그 이름을 지정하고 여러 Cloud Storage 버킷을 단일 카탈로그와 연결할 수 있습니다. 이러한 버킷에 대한 액세스를 보호하려면 카탈로그가 클라이언트 엔진에 직접 임시 스토리지 사용자 인증 정보를 자동으로 발급할 수 있도록 사용자 인증 정보 제공 모드를 사용 설정하세요.
Google Cloud 콘솔에서 Lakehouse 페이지로 이동합니다.
카탈로그 만들기를 클릭하고 레이크하우스 런타임 카탈로그를 선택합니다.
카탈로그 세부정보 섹션에서 다음 설정을 구성합니다.
- 카탈로그 유형: Iceberg Rest Catalog를 선택합니다.
- 레이크하우스 카탈로그 버킷 옵션: 여러 버킷 카탈로그를 선택합니다.
- 기본 카탈로그 Cloud Storage 경로: 찾아보기를 클릭하고 만든 버킷을 선택한 후 선택을 클릭합니다.
- 카탈로그 ID:
quickstart_catalog를 입력합니다. - 기본 위치: 멀티 리전을 선택한 다음 US (미국 내 여러 리전)를 선택합니다.
계속을 클릭한 다음 데이터 경로 섹션에서 계속을 클릭합니다.
인증 방법 섹션에서 인증서 판매 모드를 선택합니다.
인증 정보 제공을 사용하면 카탈로그에서 클라이언트 엔진과 BigQuery에 임시 테이블 범위 스토리지 토큰을 안전하게 발급하므로 외부 엔진이 버킷에 대한 직접 IAM 권한을 가질 필요가 없습니다.
만들기를 클릭합니다.
카탈로그가 생성되고 카탈로그 세부정보 페이지가 열립니다.
인증 방법에서 버킷 권한 설정을 클릭한 다음 대화상자에서 확인을 클릭합니다.
이 단계에서는 임시 사용자 인증 정보를 판매하기 위해 카탈로그의 서비스 계정에 Cloud Storage 버킷에 대한 필수 권한을 부여합니다.
네임스페이스 및 Iceberg 테이블 만들기
이제 카탈로그가 있으므로Google Cloud 콘솔의 Lakehouse 페이지를 사용하여 네임스페이스와 Iceberg 테이블을 만듭니다.
네임스페이스 만들기
quickstart_catalog의 카탈로그 세부정보 페이지에서 네임스페이스 만들기를 클릭합니다.네임스페이스 이름 필드에
quickstart_namespace를 입력합니다.위치는 필드에 자동으로 입력되는 기본 Cloud Storage 경로로 설정된 상태로 둡니다.
만들기를 클릭합니다.
Iceberg 테이블 만들기
카탈로그 세부정보 페이지에서
quickstart_namespace를 클릭합니다.네임스페이스 세부정보 페이지가 열립니다.
테이블 만들기를 클릭합니다.
테이블 만들기 창에서 다음 설정을 구성합니다.
- 표 형식: Iceberg가 선택되어 있는지 확인합니다.
- 테이블 이름:
quickstart_table를 입력합니다. - 위치: 기본 Cloud Storage 경로를 그대로 둡니다.
스키마에서 필드 추가를 두 번 클릭하여 테이블에 두 개의 열을 추가합니다.
- 첫 번째 필드의 경우 필드 이름 필드에
id를 입력하고 유형 메뉴에서 INTEGER를 선택합니다. - 두 번째 필드의 경우 필드 이름 필드에
name를 입력하고 유형 메뉴에서 STRING을 선택합니다.
- 첫 번째 필드의 경우 필드 이름 필드에
속성에서 사전 정의된
gcp.biglake.bigquery-dml.enabled속성을 찾아 값을false에서true로 변경합니다.gcp.biglake.table-management.enabled을false로 설정된 상태로 둡니다.gcp.biglake.bigquery-dml.enabled을true로 설정하면INSERT,UPDATE,DELETE,MERGE과 같은 BigQuery DML 문을 사용하여 Iceberg 테이블의 데이터를 수정할 수 있습니다. 자세한 내용은 표 옵션 구성을 참고하세요.만들기를 클릭합니다.
새 Iceberg 테이블 (
quickstart_table)이 네임스페이스 세부정보 페이지에 표시되고 Lakehouse 런타임 카탈로그가 초기 Iceberg 메타데이터 파일을 Cloud Storage 버킷에 씁니다.
BigQuery에서 데이터 수정 및 테이블 쿼리
quickstart_table를 만들고 BigQuery DML을 사용 설정하면 4부분 P.C.N.T (Project.Catalog.Namespace.Table) 구문을 사용하여 BigQuery에서 직접 행을 삽입, 업데이트, 삭제, 쿼리할 수 있습니다. 각 문에서 PROJECT_ID를Google Cloud 프로젝트 ID로 바꿉니다.
Google Cloud 콘솔에서 BigQuery 페이지로 이동합니다.
쿼리 편집기에서 SQL 쿼리를 클릭합니다.
샘플 데이터 행 3개를 삽입합니다.
INSERT INTO `PROJECT_ID.quickstart_catalog.quickstart_namespace.quickstart_table` (id, name) VALUES (1, 'one'), (2, 'two'), (3, 'three');
실행을 클릭합니다.
INSERT문이 완료되면 BigQuery는 Parquet 데이터 파일을 Cloud Storage 버킷에 쓰고 새 Iceberg 스냅샷을 Lakehouse 런타임 카탈로그에 커밋합니다.표에서 행을 수정합니다.
UPDATE `PROJECT_ID.quickstart_catalog.quickstart_namespace.quickstart_table` SET name = 'updated' WHERE id = 1;
실행을 클릭합니다.
표에서 행을 삭제합니다.
DELETE FROM `PROJECT_ID.quickstart_catalog.quickstart_namespace.quickstart_table` WHERE id = 3;
실행을 클릭합니다.
테이블을 쿼리하여 변경사항을 확인합니다.
SELECT * FROM `PROJECT_ID.quickstart_catalog.quickstart_namespace.quickstart_table` ORDER BY id;
실행을 클릭합니다. 쿼리 결과 창에 업데이트된
id = 1값을 포함하여 나머지 두 행이 표시됩니다.+----+---------+ | id | name | +----+---------+ | 1 | updated | | 2 | two | +----+---------+
Lakehouse 런타임 카탈로그가 Iceberg 메타데이터를 관리하고 사용자 인증 정보 판매가 사용 설정되어 있으므로 버킷에 대한 직접 IAM 액세스 권한을 부여하지 않고도 Apache Spark, Trino, Apache Flink와 같은 Iceberg 호환 오픈소스 엔진을 사용하여 quickstart_table에서 읽거나 쓸 수 있습니다.
삭제
Google Cloud 계정에 불필요한 비용이 청구되지 않도록 하려면 이 빠른 시작에서 만든 리소스를 삭제합니다. 테이블, 네임스페이스, 카탈로그를 삭제하면 Lakehouse 런타임 카탈로그에서 메타데이터 등록이 삭제되고, 버킷을 삭제하면 Cloud Storage에 저장된 기본 Parquet 데이터와 Iceberg 메타데이터 파일이 삭제됩니다.
Google Cloud 콘솔에서 Lakehouse 페이지로 이동합니다.
카탈로그에서 테이블을 삭제합니다.
quickstart_catalog을 클릭한 다음quickstart_namespace을 클릭합니다.- 네임스페이스 세부정보 표의
quickstart_table행에서 더보기 > 삭제를 클릭합니다. DELETE를 입력하여 확인하고 삭제를 클릭합니다.
카탈로그에서 네임스페이스를 삭제합니다.
quickstart_catalog의 카탈로그 세부정보 페이지로 돌아갑니다.quickstart_namespace행에서 네임스페이스 작업 더보기 > 삭제를 클릭합니다.DELETE를 입력하여 확인하고 삭제를 클릭합니다.
카탈로그를 삭제합니다.
- Lakehouse 페이지로 돌아갑니다.
quickstart_catalog행에서 카탈로그 작업 더보기 > 삭제를 클릭합니다.DELETE를 입력하여 확인하고 삭제를 클릭합니다.
Cloud Storage 버킷과 모든 콘텐츠를 삭제합니다.
Cloud Storage 버킷 페이지로 이동합니다.
이 빠른 시작을 위해 만든 버킷 옆에 있는 체크박스를 선택하고 삭제를 클릭합니다.
DELETE를 입력하여 확인하고 삭제를 클릭합니다.
다음 단계
- Google Cloud CLI를 사용하여 Iceberg 테이블 만들기 및 쿼리 빠른 시작을 사용해 보세요.
- BigQuery DML 문으로 데이터를 수정하고 테이블 옵션을 구성하는 방법을 알아봅니다.
- 교차 클라우드 데이터 액세스 설정 Codelab을 통해 ETL 없이 Amazon Web Services (AWS), PostgreSQL용 AlloyDB, Cloud Storage 전반에서 데이터를 쿼리해 보세요.
- 다중 버킷 카탈로그 및 Apache Iceberg REST 카탈로그 엔드포인트에 대해 알아봅니다.
- Lakehouse 런타임 카탈로그에서 카탈로그를 관리하는 방법을 알아봅니다.
- Lakehouse에서 관리하는 Apache Iceberg 테이블에 대해 알아봅니다.