Axis Lab
제품 목록으로
제작중문서 분석 도구

문서 OCR & 데이터 자동 추출

Doc Optimizer

비정형 문서·PDF·Excel에서 원하는 데이터와 품목 정보를 자동 추출 및 정형화

도면 PDF, 스캔 문서, Excel 시트 등 다양한 비정형 파일에서 셀 위치 및 키워드 규칙을 저장해 다량의 파편화된 문서 데이터를 한 번에 추출하고 표준 폼으로 취합합니다.

PDF OCRExcel 데이터 추출LLM 파싱자동 정형화

입력 파일

PDF · Excel · 이미지 · ZIP

핵심 기술

OCR · Cell Parser · LLM Mapping

출력 형태

정형 DB · 표준 Excel 리포트

Screen to Technology

스크린샷으로 보는 핵심 기술

화면에 드러난 업무 흐름을 실제 데이터 처리와 운영 기술에 연결해 설명합니다.

Doc Optimizer 문서 데이터 분석 화면
01

정밀 데이터 추출

셀 주소 및 헤더 파싱 엔진

선택한 셀과 규칙을 적용해 비정형 문서의 핵심 데이터만 추출합니다.

02

프리셋 관리 및 동기화

추출 규칙 템플릿화

반복 사용하는 분석 규칙을 저장해 다른 문서 작업에서도 재사용합니다.

03

통합 데이터 리포트

자동 DB 적재 및 Excel 내보내기

추출 결과를 검토하고 정밀하게 정돈된 Excel/DB 형태로 변환합니다.

첫 화면 기준 구성

실제 링크에서 가장 먼저 보이는 화면을 기준으로 제품 진입 경험과 주요 정보를 함께 검토할 수 있도록 구성했습니다.

구간 01
규칙 & 프리셋 기반 셀 추출
문서별 셀 위치, 헤더 규칙, 키워드를 프리셋으로 저장하여 여러 파일에 일괄 적용합니다.
구간 02
PDF · 도면 OCR 판독
PyMuPDF와 Tesseract OCR을 연동하여 스캔 이미지 및 PDF 내 텍스트와 도면 품목 정보를 판독합니다.
구간 03
다중 파일 통합 & DB 표준화
여러 Excel, PDF, ZIP 폴더의 데이터를 단일 통합 DB 시트로 자동 적재 및 정형화합니다.

운영 검토 포인트

현장 및 수작업 문서 복사/붙여넣기 업무를 습관적 수작업에서 자동화로 전환합니다.

담당자별 작성 차이를 없애고 일관된 데이터 표준화와 검토 속도를 제공합니다.

도입 준비도

현재

초기 구상

목표

운영 가능한 MVP

화면 명확성

현재

설명 중심

목표

흐름 중심 화면

다음 단계

현재

개별 협의

목표

표준 도입 안내