문서 이해 watsonx.ai
문서 이해 라이브러리의 여러 텍스트 처리 API를 통해 고품질 비즈니스 문서를 AI 모델이 사용할 수 있는 더 간단한 파일 형식으로 변환하세요. 문서의 텍스트를 처리하여 계약서와 같은 문서에서 핵심 정보를 찾아 분리하세요.
비즈니스 문서를 텍스트 기반 형식으로 변환하여 단순화하는 것은 사용자 쿼리와 관련된 정보를 찾아 기초 모델에 입력할 때 포함하려는 검색 증강 생성 작업에 특히 유용합니다. 모델 입력에 정확한 컨텍스트 정보를 포함하면 기초 모델이 모델 출력에 사실에 입각한 최신 정보를 통합하는 데 도움이 됩니다.
기능
문서 이해 라이브러리의 여러 API를 조합하여 문서를 분석할 수 있습니다. 긴 추출 작업을 실행하지 않고도 분류 API를 사용하여 문서를 지원되는 여러 공통 문서 유형 중 하나로 분류할 수 있습니다. 그런 다음 전처리 단계의 결과를 사용하여 추출 API를 통해 분류된 문서 유형으로 제한된 정형 데이터뿐만 아니라 비정형 데이터도 효율적으로 추출할 수 있습니다.
다음과 같이 다양한 특성을 가진 문서에 텍스트 처리 API를 사용할 수 있습니다:
- 여러 언어로 된 콘텐츠가 포함된 문서. 지원되는 언어를 참조하세요.
- 다양한 파일 형식의 문서가 다양한 저장소 유형에 저장되어 있습니다. 자세한 내용은 다음을 참조하십시오:
문서 이해 기술은 다음 기능을 사용하여 문서를 스캔하고 처리합니다:
- 광학 문자 인식
- 광학 문자 인식(OCR)은 이미지, 스캔한 문서, 표에서 텍스트를 감지하며 이미지, 다이어그램 또는 스캔한 PDF와 같은 파일에 포함된 텍스트에 묘사된 정보를 보존하는 데 유용합니다. OCR은 노이즈가 있는 이미지에서 텍스트를 추출할 수 있지만 이미지 파일의 품질이 최소 요구 사항인 80DPI(인치당 도트 수)를 충족해야 합니다.
- 문서 구조 식별
- API는 표, 섹션 제목, 글머리 기호 목록, 단락, 각주 등 다양한 데이터 구조의 문서 콘텐츠를 처리합니다. 또한 API는 머리글 및 바닥글과 같이 일반적으로 사용되는 콘텐츠를 식별하고 제거합니다.
- 키-값 쌍 분류 및 추출
- 키-값 쌍 추출을 사용하여 송장, 공과금 청구서 등과 같은 일반 또는 도메인별 구조화된 데이터가 포함된 문서를 처리하세요. 추출 모드는 문서 유형에 따라 문서를 분류합니다. 추출된 텍스트는 스키마라는 데이터 구조에 저장되며, 각 데이터 조각(값)은 고유 식별자(키)와 연관되어 있습니다. 이 모드는 미리 정의된 스키마 또는 사용자가 정의하는 사용자 지정 스키마를 사용합니다. 대규모 언어 모델(LLM)과 고급 비전 언어 처리로 키-값 쌍을 추출합니다.
텍스트 분류 및 추출 API 모두에 공통으로 적용되는 설정을 사용하여 다양한 문서 이해 기능을 구성할 수 있습니다. 자세한 내용은 일반적인 텍스트 처리 매개변수를 참조하세요.
제한사항
- 텍스트 분류 API는 영어 문서에만 사용할 수 있습니다.
- 키-값 쌍 추출은 영어 문서에 대해서만 지원됩니다.
업무 방식
watsonx.ai 프로젝트에 저장된 문서를 다음과 같은 텍스트 처리 REST API 메서드를 사용하여 프로그래밍 방식으로 처리할 수 있습니다:
워크플로우
문서 이해 라이브러리로 문서를 처리하는 데는 다음과 같은 높은 수준의 단계를 사용할 수 있습니다:
입력 문서를 지원되는 저장소 유형에 저장하고 watsonx.ai 프로젝트에서 문서에 액세스할 수 있도록 저장소 유형에 대한 연결을 정의합니다.
선택 사항입니다: watsonx.ai 텍스트 분류 API를 사용하여 문서를 지원되는 일반 문서 유형 중 하나 또는 사용자 지정 문서 유형으로 분류합니다. 문서에서 텍스트 분류하기 참조
watsonx.ai 텍스트 추출 API를 사용하여 문서에서 다양한 유형의 정보를 추출하세요. 텍스트 추출 요청에서 추출된 결과를 저장할 프로젝트의 저장소 유형을 지정합니다. 문서에서 텍스트 추출하기를 참조하세요.
해당되는 경우, 분류 결과를 사용하여 문서에서 구조화된 데이터를 효율적으로 추출할 수 있도록 텍스트 추출 요청을 정확하게 구성하세요.
텍스트 추출 프로세스의 결과를 RAG 솔루션에서 사용하세요. RAG 솔루션에 추출된 텍스트 추가하기를 참조하세요.