스캔 PDF 글자 인식 (검색·복사되는 PDF)
스캔기나 휴대폰으로 만든 PDF는 글자가 그림이라 검색도 복사도 안 돼요. 여기에 올리면 쪽마다 글자를 인식해서, 원본 화면은 그대로 둔 채 보이지 않는 글자층을 덧입힌 PDF를 만들어 드려요. 받은 PDF에서 Ctrl+F로 찾고, 드래그해서 복사할 수 있어요. 파일은 서버로 전송되지 않아요.
도구를 불러오는 중이에요...
사용 방법
- 글자를 고를 수 없는 스캔·사진 PDF를 끌어다 놓거나 눌러서 선택해요. 암호가 걸린 PDF는 먼저 PDF 암호 해제로 풀어 주세요.
- 문서 언어(한국어+영어, 한국어, 영어)와 인식 정밀도(보통 200dpi, 정확하게 300dpi)를 고르고, 긴 문서는 페이지 범위를 정해요. 이미 글자가 있는 쪽은 기본으로 건너뛰어요.
- '글자 인식 시작'을 누르면 쪽마다 글자를 읽고 남은 시간을 보여줘요. 중간에 취소할 수 있어요.
- 끝나면 검색·복사되는 PDF가 저장돼요. 인식한 글자만 텍스트(.txt)로 받을 수도 있고, 결과를 바로 PDF 용량 줄이기 같은 다음 도구로 넘길 수 있어요.
어떻게 검색·복사가 되나요
각 쪽을 그림으로 그려서 글자 인식(OCR)을 하면, 낱말마다 글자와 위치(네모 칸)가 나와요. 다고침은 원래 쪽은 그대로 두고, 그 낱말을 같은 위치에 보이지 않는 글자(PDF의 투명 글자층, 렌더링 모드 3)로 써 넣어요. 그래서 화면에는 원본 스캔이 보이고, 검색하거나 드래그하면 그 아래 숨은 글자가 잡혀요. 낱말 너비에 맞춰 글자 크기를 정하기 때문에 선택 영역이 원래 글자와 거의 겹쳐요.
알아 두면 좋은 한계
- 인식이 틀린 낱말은 검색되지 않아요. 흐린 스캔, 기울어진 쪽, 아주 작은 글씨, 손글씨, 표 안의 글자, 세로쓰기는 정확도가 떨어져요.
- 한글과 영어 글자를 넣기 위해 나눔고딕 글꼴이 통째로 들어가 파일이 약 2MB 커져요. 필요하면 결과를 PDF 용량 줄이기(가볍게)로 다시 줄일 수 있어요.
- 쪽 하나에 몇 초에서 수십 초 걸려요. 처음 한 번은 글자 인식 데이터(한국어+영어 약 6MB)를 내려받아요.
- 휴대폰으로 찍은 사진을 바로 PDF로 만들고 싶다면 스캔 PDF 만들기가 더 편해요(모서리 보정·흑백 문서 모드).
사용한 오픈소스 / Open-source credits
- tesseract.js (Apache License 2.0)와 tessdata_fast 한국어·영어 데이터(Apache License 2.0) — 그림 속 글자를 인식해요.
- PDF.js (Mozilla, Apache License 2.0) — PDF 쪽을 그림으로 그려요.
- pdf-lib (MIT License)와 fontkit (MIT License) — 보이지 않는 글자층을 PDF에 써 넣어요.
- 나눔고딕 (Nanum Gothic) (네이버, SIL Open Font License 1.1) — 숨은 한글·영문 글자에 쓰는 글꼴이에요.
자주 묻는 질문
스캔 PDF를 왜 검색할 수 없나요?
스캔기나 휴대폰 카메라로 만든 PDF는 쪽마다 사진 한 장이 들어 있는 것과 같아서, 사람 눈에는 글자로 보여도 컴퓨터에는 그림일 뿐이에요. 글자 인식(OCR)으로 그림 속 글자를 읽어 PDF 안에 글자 정보를 넣어 주면 검색과 복사가 돼요.
원본 PDF 모양이 바뀌나요?
바뀌지 않아요. 원래 쪽의 그림과 내용은 손대지 않고, 인식한 낱말을 같은 자리에 보이지 않는 글자로만 덧입혀요. 그래서 화면과 인쇄 모양은 원본과 같고, 글꼴(나눔고딕)이 함께 들어가 파일 용량이 약 2MB 늘어나요.
인식 정확도는 어느 정도인가요?
깨끗하게 스캔한 인쇄 문서는 대부분 맞게 읽지만, 흐리거나 기울어진 스캔, 작은 글씨, 손글씨, 표 안의 글자, 세로쓰기는 틀리거나 빠질 수 있어요. 틀리게 인식한 낱말은 검색되지 않으니 중요한 문서는 결과를 확인해 주세요. 작은 글씨가 많으면 정밀도를 300dpi로 올려 보세요.
시간은 얼마나 걸리나요?
컴퓨터 성능과 글자 양에 따라 다르지만 보통 한 쪽에 몇 초에서 수십 초 걸려요. 처음 한 번은 글자 인식 데이터(한국어+영어 약 6MB)를 내려받아요. 긴 문서는 페이지 범위를 나눠서 처리하면 편해요.
파일이 서버로 전송되나요?
아니요. PDF 읽기, 글자 인식, 새 PDF 만들기가 모두 이 브라우저 안에서 처리돼요. 글자 인식 데이터와 글꼴 파일을 내려받을 뿐, 내 PDF나 인식한 글자는 어디로도 보내지 않아요.