이 문서에서는 Document AI Warehouse에서 Document AI Workbench의 커스텀 문서 추출기 (CDE) 데이터 세트로 문서를 내보내는 방법을 설명합니다.
CDE를 사용하면 사용자가 문서 추출기를 만들 수 있습니다. 문서를 프로세서 데이터 세트로 가져온 다음 모델을 학습시키기 전에 라벨을 지정합니다. 사용자가 선택한 문서를 CDE의 데이터 세트로 내보낼 때 Document AI Warehouse에서 문서를 관리하거나 검색하여 데이터 세트를 빌드할 수 있습니다.
Document AI Workbench에서 CDE 만들기
CDE를 만드는 방법에 관한 전체 안내는 이 공식 가이드에서 확인할 수 있습니다. 이 가이드에서는 몇 가지 주요 단계를 강조합니다.
프로세서 목록에서 CDE 만들기
내 프로세서 페이지로 이동하고 커스텀 프로세서 만들기를 클릭합니다.

커스텀 문서 추출기 카드에서 프로세서 만들기 를 선택합니다.

표시 이름을 입력하고 만들기 를 클릭합니다.

CDE가 빠르게 생성됩니다.
CDE의 데이터 세트 설정
프로세서 세부정보 페이지에서 데이터 세트 위치 설정 을 클릭합니다.

데이터 세트에 문서를 저장하는 데 사용할 버킷 경로를 지정합니다.

구성을 완료하는 데 몇 분 정도 걸립니다. 그런 다음 세부정보 페이지에서 버킷 경로와 개수를 확인할 수 있습니다.

Workbench로 내보내기 파이프라인을 트리거하려면 위의 프로세서 ID가 필요합니다.
Workbench로 내보내기 파이프라인 트리거
내보낼 문서를 선택하고 작업 표시줄에서 Document AI Workbench로 내보내기 를 클릭합니다.

입력 매개변수를 입력하고 CDE에서 프로세서 ID를 복사하여 대화상자에 붙여넣어 파이프라인을 트리거합니다.
문서를 내보내기 전에 임시로 저장할 스테이징 버킷 경로가 필요합니다. 데이터 분할 을 사용하면 사용자가 문서를 학습 또는 테스트 세트에 무작위로 배치할 수 있습니다. 분할 비율은 이 값을 기반으로 합니다.

내보내기를 클릭하면 파이프라인 작업이 트리거됩니다.
상태를 추적합니다.
파이프라인을 트리거하면 상태 추적 페이지가 표시됩니다. 현재 페이지에는 진행 중인 추적이 없습니다. 작업이 완료될 때까지 상태 페이지에 대기 중이 표시됩니다.

결과를 살펴봅니다.
작업이 완료되면 성공한 문서와 실패한 문서를 확인할 수 있습니다.

문서가 올바르게 내보내졌는지 확인하려면 CDE의 세부정보 페이지로 돌아갑니다.

파이프라인 실행 전에 페이지를 열어 둔 경우 새로고침하여 업데이트된 통계를 확인합니다. 학습 및 테스트 세트 분포는 데이터 분할 비율을 기반으로 합니다.
문서를 자세히 보려면 학습 탭으로 이동합니다.

다음 단계
runPipeline API에 관한 자세한 내용을 확인하세요.