솔루션 개요
Google Cloud Cortex Framework는 고급 분석 및 에이전트 사용 사례에 적합한 신뢰할 수 있는 고품질 데이터 제품을 빌드하는 데 도움이 되는 솔루션 가속기를 제공합니다. 이 프레임워크는 Google CloudBigQuery, Dataform, Knowledge Catalog, Gemini Enterprise Agent Platform을 비롯한 Google Cloud 제품을 사용합니다.
Cortex Framework 솔루션 가속기는 자체 환경 Google Cloud 내에서 안전하게 배포하여 엔터프라이즈 소스 시스템의 데이터 제품을 빠르게 빌드, 맞춤설정, 확장할 수 있는 맞춤설정 가능한 오픈소스 모듈로 제공됩니다.
Cortex Framework는 팀이 빌드, 조정, 배포하는 방식을 간소화하여 가치 창출 시간을 단축하고 신뢰할 수 있는 엔터프라이즈 분석 및 에이전트 사용 사례의 충실도 높은 기반을 제공합니다.
지원되는 데이터 소스
Cortex Framework 솔루션 가속기는 다음 데이터 소스에 사용할 수 있습니다.
주요 구성요소
Cortex Framework는 다음과 같은 상위 수준 솔루션 구성요소로 구성됩니다.
빌드 및 배포 프레임워크
빌드 및 배포 프레임워크는 로컬 구성에서 Dataform 파이프라인, 활성 BigQuery 데이터 세트로의 전환을 조정하고 표준 Python 도구 (uv)로 구동되는 명령줄 인터페이스 (CLI) 스크립트 (cortex-build, cortex-deploy, cortex-build-and-deploy)를 사용하여 실행됩니다.
다양한 환경에서 이러한 스크립트를 실행할 수 있습니다.
- 로컬 개발 머신: 초기 설정, 맞춤설정, 테스트, 디버깅
- Google Cloud **Cloud Shell / 가상 워크스테이션**: 안전한 클라우드 호스팅 개발자 환경
- CI/CD 파이프라인: Cloud Build 또는 GitHub Actions와 같은 시스템을 통해 빌드 및 배포를 자동화하여 지속적 통합을 보장합니다.
이 프레임워크는 구성 파일(config.yaml, table_settings.yaml 등)을 컴파일하고 커스텀 열을 포함한 소스 데이터 애셋의 스키마를 분석하며 Dataform JavaScript 및 SQLX 코드를 동적으로 생성합니다. 그런 다음 코드가 Dataform 저장소의 Google Cloud 로 푸시되고 즉시 파이프라인 실행을 위한 준비가 완료됩니다.
데이터 모듈
데이터 모듈은 Dataform 데이터 파이프라인의 구조와 구성요소를 정의하는 패키지된 솔루션 메타데이터를 빌드 및 배포 프레임워크에 제공합니다. 모듈에는 여러 유형이 있습니다.
- 데이터 기반 모듈: 원시 운영 테이블의 최신 상태를 나타내는 데이터 세트를 정의합니다. 데이터 유형을 표준화하고, 데이터 필드의 이름을 사람이 읽을 수 있는 비즈니스 용어로 바꾸고, 데이터 변경사항을 처리하고, 시간대 정렬을 실행합니다.
- 데이터 제품 모듈: 데이터 기반 모듈 콘텐츠를 기반으로 빌드된 분석 모델을 정의합니다. 복잡한 비즈니스 규칙, KPI, 집계, 교차 기능 조인 (예: 판매 기록과 환율 결합)을 구현하여 사용 준비가 완료된 정제된 데이터 세트를 노출합니다.
- 데이터 카탈로그 모듈: 실제 매니페스트 없이 외부 테이블 참조에 지원되는 외부 레이크하우스 카탈로그를 정의합니다.
모듈은 오픈소스이며 맞춤설정할 수 있으므로 고유한 비즈니스 요구사항에 맞게 조정할 수 있습니다.
외부 데이터 카탈로그
Cortex Framework는 데이터 카탈로그 모듈 을 사용하여 외부 데이터 카탈로그와의 직접 통합을 지원합니다. 레이크하우스 런타임 카탈로그를 사용하면 프레임워크에서 복사 오버헤드 없이 외부 데이터 레이크 또는 델타 공유 (예: BigQuery용 SAP Business 데이터 클라우드 Connect를 사용하여 소싱된 데이터 제품)에서 관리되는 테이블을 쿼리할 수 있습니다.
이를 통해 조직은 Cortex Framework에서 제공하는 콘텐츠를 외부 데이터 제품과 결합하여 중복된 스토리지 또는 파이프라인 유지보수 없이 통합된 비즈니스 통계를 만들 수 있습니다.
Dataform 조정
Cortex Framework는 Dataform을 사용하여 데이터 변환의 수명 주기를 관리합니다. Dataform은 BigQuery 내에서 복잡한 SQL 파이프라인을 빌드, 테스트, 버전 제어, 예약할 수 있는 서버리스 환경을 제공합니다.
프레임워크는 정적 SQL을 작성하는 대신 빌드 단계에서 Dataform 코드를 동적으로 생성하여 특정 구성 및 맞춤설정을 반영합니다. 에 있는 대상 Dataform 저장소에 스테이징되면 생성된 파이프라인을 실행하여 규격 테이블과 뷰를 구체화하고 채울 수 있습니다. Google Cloud
BigQuery 데이터 모델
Cortex Framework에서 처리하는 모든 데이터는 BigQuery에 정리되고 저장됩니다. 이 프레임워크는 다음을 지원합니다.
- 표준 BigQuery 테이블 및 뷰: 쿼리 성능을 개선하고 비용을 제어하기 위해 파티셔닝 및 클러스터링으로 최적화된 완전 구체화 또는 가상 BigQuery 데이터 세트
- 제휴 데이터 소스: 외부 데이터 세트에 걸쳐 있는 쿼리로, BigQuery 스토리지를 제휴 외부 테이블과 조인할 수 있습니다.
- 레이크하우스 런타임 카탈로그: 데이터 소스 전반에서 데이터 제품 빌드를 지원하는 BigQuery에서 테이블로 노출된 외부 카탈로그 (예: 델타 공유)의 직접적인 복사 없는 쿼리
Knowledge Catalog 통합
Knowledge Catalog는 엔터프라이즈 전반의 모든 데이터 애셋에 대한 통합 거버넌스 및 검색 카탈로그 역할을 합니다. Cortex Framework는 전용 동기화 도구 cortex-kc-sync를 사용하여 Knowledge Catalog와 기본적으로 통합됩니다.
이 도구는 실행되면 배포된 데이터 제품을 카탈로그에 자동으로 등록하고 사람이 읽을 수 있는 이름, 자세한 비즈니스 설명, 문서 링크를 가져옵니다. 실제 BigQuery 테이블을 논리적 비즈니스 도메인에 연결하여 강력한 계보 추적을 보장하면서 비즈니스 분석가, 데이터 관리자, AI 에이전트가 데이터 애셋을 검색할 수 있도록 합니다. 자세한 내용은 Knowledge Catalog 통합을 참고하세요.
데이터 아키텍처
Cortex Framework는 BigQuery 내에서 데이터 처리를 표준화합니다. 이 아키텍처는 엔터프라이즈 데이터 메시 원칙에 부합하는 세 가지 고유한 구조화된 데이터 레이어로 구성되어 있으며, 명확한 소유권, 높은 재사용률, 데이터 레이어의 엄격한 분리를 촉진합니다.
소스 시스템
소스 시스템은 비즈니스 데이터의 원본입니다. 여기에는 데이터가 추출되는 다양한 엔터프라이즈 애플리케이션, 데이터베이스, 플랫폼이 포함될 수 있습니다. 지원되는 소스의 전체 목록은 지원되는 데이터 소스를 참고하세요.
원시 레이어
원시 레이어는 변경 데이터 캡처 (CDC) 로그 또는 CDC 처리된 일괄 처리와 같은 소스 데이터에 대한 BigQuery의 변경 불가능한 랜딩 영역 데이터 세트를 나타냅니다. CDC 로그 (예: SAP용 BigQuery 커넥터 또는 SAP용 BigQuery 툴킷과 같은 복제 도구를 사용하여 SAP ECC 또는 S/4HANA에서)를 자주 저장하지만 모든 원시 형식을 나타내도록 설계되었습니다. Salesforce 또는 외부 API 피드와 같이 CDC 로그를 제공하지 않는 소스의 경우 이 레이어는 전체 일괄 추출 또는 원시 이벤트 페이로드를 도착하는 그대로 나타냅니다. 이 레이어는 데이터 기반 레이어를 공급합니다.
데이터 기반 레이어
데이터 기반 레이어는 원시 랜딩 데이터를 정리, 표준화, 규격화하여 최신 소스 데이터의 단일하고 신뢰할 수 있는 표현으로 만듭니다. 원시 테이블을 규격 구조에 매핑하고, 데이터 유형을 표준화하고, 파티셔닝 및 클러스터링으로 성능을 최적화하고, 스키마를 통합하여 일관성을 보장하고, 메타데이터 주석으로 애셋을 보강합니다. 변경 데이터 캡처 (CDC) 소스의 경우 이 레이어는 수신 기록을 점진적으로 병합하여 성능을 최적화하고 쿼리 비용을 줄입니다. 자세한 내용은 데이터 기반을 참고하세요.
데이터 제품 레이어
데이터 제품 레이어는 비즈니스 의사 결정을 위해 설계된 사용 준비가 완료된 데이터 애셋을 보관합니다. 비즈니스 로직을 적용하고, 복잡한 시스템 필드의 이름을 사람이 읽을 수 있는 비즈니스 용어로 바꾸고, 상태 코드를 변환하고, 시간대 및 통화 조정을 실행하고, 측정항목을 집계하고, 여러 원시 테이블에서 데이터를 조인합니다. 결과 테이블과 뷰는 BI 대시보드, 보고 도구, 머신러닝 파이프라인, Gemini Enterprise Agent Platform 및 BigQuery 대화형 분석 에이전트와 같은 AI 플랫폼에서 직접 사용할 수 있도록 최적화됩니다. 자세한 내용은 데이터 제품을 참고하세요.
솔루션 확장
Cortex Framework는 구성 기반 유연성과 AI 지원 자동화를 결합하여 데이터 환경을 확장하는 방법을 간소화합니다. 자율 AI 코딩 어시스턴트를 사용하여 커스텀 테이블을 빌드하든 새 데이터 소스에 대한 커스텀 컴파일 로직을 작성하든 이 프레임워크는 데이터 제품을 안전하게 확장하는 데 필요한 도구, 격리, 안전 게이트를 제공합니다.
확장성 프레임워크
확장성 프레임워크는 데이터 기반을 맞춤설정하고 새 데이터 제품을 빌드하는 구조화된 방법을 제공합니다. 주요 기능은 다음과 같습니다.
- 커스텀 네임스페이스: 핵심 프레임워크 패키지가 업데이트될 때 맞춤설정이 덮어쓰이지 않도록 커스텀 디렉터리 (예:
src/data_modules/custom_namespace/)에서 변경사항을 격리합니다. - 코드로서의 구성: 전역
config/config.yaml구성 파일에서 새 데이터 소스, 대상, 커스텀 모듈을 직접 등록합니다. - 커스텀 컴파일 빌더: 컴파일 단계에서 동적 SQL 생성, 커스텀 정리 규칙 또는 소스별 변환을 자동화하기 위해 모듈 내에서 커스텀 Python 빌더 클래스 (
builder.py)를 구현합니다.
자세한 내용은 확장성 가이드를 참고하세요.
에이전트 데이터 제품 빌더
개발자와 비즈니스 분석가가 프레임워크를 확장할 수 있도록 Cortex Framework는 패키지된 기술을 제공합니다. 이러한 기술은 AI 코딩 어시스턴트 (예: Antigravity와 페어링된 Gemini)를 다음과 같이 안내합니다.
- 실제 스키마 검사: 환각 없이 복제된 SAP 데이터 딕셔너리 (DDIC) 테이블에서 정확한 열 이름, 유형, 설명을 직접 가져옵니다.
- 템플릿 모듈 생성: 네임스페이스, 매니페스트, 테이블 설정, SQLX/JS 모델, 주석을 자동으로 생성합니다.
- 변경사항 검증: 배포 전에 린팅 규칙, 이름 지정 감사, 컴파일 검사를 실행하여 코드 품질을 개선합니다.
자세한 내용은 에이전트 기능을 참고하세요.
다음 단계
빌드 및 배포할 준비가 되셨나요? 다음 가이드를 살펴보고 환경을 설정하고 실행하세요.
- 데이터 제품: 사용 가능한 데이터 제품 카탈로그를 살펴봅니다.
- 데이터 기반: 기본 기반 테이블과 필드를 이해합니다.
- 데모 배포: 데모 데이터로 솔루션 콘텐츠를 몇 분 안에 배포하여 Cortex Framework가 작동하는 모습을 빠르게 확인합니다.
- 프로덕션 배포: 단계별 안내에 따라 엔터프라이즈 데이터에 맞게 Cortex Framework를 구성하고 배포합니다.