PDF OCR 텍스트 인식
이미지로 된 스캔 페이지를 브라우저에서 인식해 검색 가능한 PDF를 만듭니다. 이미 텍스트가 포함된 페이지는 다시 인식하지 않습니다.
사용 방법
사용 방법
- 30MB 및 25페이지 이하의 로컬 PDF를 선택하세요.
- 스캔에 사용된 언어를 선택하고 OCR을 시작하세요.
- 검색 가능한 PDF를 다운로드하세요. 파일은 이 기기에서 처리되며 업로드되지 않습니다.
스캔 페이지와 기존 텍스트
PDF.js가 각 페이지의 포함된 텍스트를 확인합니다. 공백이 아닌 문자가 12자 이상인 페이지는 기존 페이지 내용을 유지하고, 텍스트 레이어가 없는 페이지만 로컬에서 렌더링해 OCR합니다. 일반 디지털 문서에 중복 텍스트가 추가되는 것을 방지합니다.
로컬 OCR 및 언어 모델
Tesseract.js는 브라우저 WebAssembly worker에서 실행됩니다. 영어, 중국어 간체, 일본어, 한국어 모델은 필요한 경우 이 사이트에서 다운로드됩니다. PDF와 인식 결과는 서버로 전송되지 않습니다. 인식 결과는 근사치이므로 확인이 필요합니다.
제한 및 출력 방식
PDF 한 개, 30MB 및 25페이지 이하를 지원합니다. 스캔 페이지는 144 DPI로 렌더링되며 페이지당 1,200만 픽셀, 총 8,000만 픽셀까지 처리합니다. OCR 페이지는 이미지 기반 검색 가능한 페이지가 됩니다. 기존 텍스트 페이지는 페이지 내용으로 복사합니다. 텍스트가 조금 있으면서 스캔 이미지도 포함된 페이지는 기존 텍스트 페이지로 처리됩니다. 양식, 주석, 서명, 책갈피, 첨부 파일 및 문서 메타데이터 보존은 보장하지 않습니다.
자주 묻는 질문
더 알아보기
PDF가 업로드되나요?
아니요. PDF 파싱, 렌더링, OCR 및 PDF 생성은 브라우저에서 실행됩니다. 선택한 언어 모델만 이 사이트에서 다운로드합니다.
선택 가능한 텍스트가 이미 있는 페이지도 OCR하나요?
아니요. 텍스트 중복을 방지하기 위해 기존 텍스트 페이지는 복사하고, 포함된 텍스트가 없는 페이지에만 OCR을 수행합니다.
여러 언어를 동시에 인식할 수 있나요?
스캔 페이지의 주 언어를 선택하세요. 현재 버전은 PDF 하나당 OCR 언어 한 개를 처리하며 혼합 언어와 오인식이 발생할 수 있습니다.
원본 PDF를 완전히 보존하나요?
아니요. OCR이 필요한 페이지가 있으면 새 PDF를 조립합니다. OCR 페이지는 이미지 기반이며 양식, 서명, 책갈피, 첨부 파일 및 메타데이터 보존은 보장되지 않습니다. 원본을 보관하세요.