데이터 내보내기 소개
이 문서에서는 BigQuery에서 데이터를 내보내는 다양한 방법을 설명합니다.
데이터 통합에 관한 자세한 내용은 데이터 로드, 변환, 내보내기 소개를 참조하세요.
쿼리 결과 내보내기
쿼리 결과를 로컬 파일(CSV 또는 JSON 파일), Google Drive 또는 Google Sheets로 내보낼 수 있습니다. 자세한 내용은 쿼리 결과를 파일로 내보내기를 참조하세요.
테이블 내보내기
다음 데이터 형식으로 BigQuery 테이블을 내보낼 수 있습니다.
| 데이터 형식 | 지원되는 압축 유형 | 지원되는 내보내기 방법 |
|---|---|---|
| CSV | GZIP | Cloud Storage로 내보내기 |
| JSON | GZIP | Cloud Storage로 내보내기
Dataflow를 사용하여 BigQuery에서 읽기 |
| Avro | DEFLATE, SNAPPY | Cloud Storage로 내보내기
Dataflow를 사용하여 BigQuery에서 읽기 |
| Parquet | GZIP, SNAPPY, ZSTD | Cloud Storage로 내보내기 |
객체 유형 안전성이 필요한 중첩된 데이터 구조를 사용하거나 더욱 광범위한 언어 지원이 필요한 경우 BigQuery 테이블을 Protobuf 열로 내보낼 수도 있습니다.
대규모 테이블 내보내기 고려사항
BigQuery에서 상당한 양의 데이터를 내보낼 때는 다음을 고려하세요.
- 데이터 볼륨 및 형식:
- 내보낼 데이터의 양을 계산합니다. 데이터 크기, 형식, 방법, 지리적 위치에 따라 내보내기에 상당한 비용이 발생할 수 있습니다. 일부 리소스는 GiB당 요금이 청구되고 다른 리소스는 TiB당 요금이 청구됩니다.
- 분석 도구 및 데이터 구조와 호환되는 형식을 선택합니다. 예를 들어 CSV는 중첩되거나 반복되는 필드를 처리하지 않습니다. 데이터 유형 호환성을 확인합니다.
- 크기와 비용을 줄이려면 압축 형식을 고려하세요.
- 내보내기 비용:
- 일부 내보내기 방법은 한도까지 무료이지만 다른 방법은 항상 비용이 발생합니다. 자세한 내용은 데이터 추출 가격 책정을 참고하세요.
- BigQuery 테이블과 대상(예: Cloud Storage 버킷)이 다른 위치에 있으면 비용이 청구될 수 있습니다.
- 할당량: 일부 내보내기 방법에는 일일 한도가 있습니다. 자세한 내용은 작업 추출을 참고하세요.
- 여러 파일: 대용량 내보내기가 여러 파일로 분할됩니다. 다운스트림에서 이러한 파일을 관리하는 방법을 고려하세요.
- 자동화: 반복되는 내보내기의 경우 BigQuery 예약 쿼리 또는 Dataflow를 사용합니다.
- 보관 정책: 대상 데이터 세트의 보관 기간을 결정하고 수명 주기 규칙을 구현하여 스토리지 비용을 최적화합니다.
- 보안 및 액세스 제어: 적절한 IAM 권한 및 암호화를 구현합니다.
이러한 요소를 고려할 때 데이터 하위 집합에 대한 테스트 내보내기를 실행하여 비용, 파일 크기, 개수, 시간을 평가하는 것이 좋습니다. EXPORT DATA SQL 문에서 WHERE 절을 사용하여 테스트 내보내기를 제한할 수 있습니다.
BigQuery 코드 애셋 내보내기
저장된 쿼리 또는 노트북과 같은 BigQuery Studio 코드 애셋을 다운로드하여 애셋 로컬 사본을 유지할 수 있습니다. BigQuery 코드 애셋을 다운로드하는 방법에 대한 자세한 내용은 다음을 참조하세요.
역방향 ETL을 사용하여 내보내기
역방향 ETL (RETL) 워크플로를 설정하여 BigQuery의 데이터를 다음 데이터베이스로 이동할 수 있습니다.
다음 단계
- 추출 작업의 할당량 알아보기
- BigQuery 스토리지 가격 책정 알아보기