본문 바로가기

↑ ↓ 이동 · Enter 열기 · Esc 닫기

스캔한 PDF에 OCR을 적용해 검색 가능하게 만들기

스캔한 PDF에 실제 텍스트로 된 숨은 레이어를 더해 단어를 검색하고 선택하고 복사할 수 있게 합니다. 인식은 내 기기에서 실행되며, 모든 페이지는 보이는 모습이 그대로 유지됩니다.

기기 안에서 처리되며 파일은 업로드되지 않습니다. 확인 방법

PDF를 여기에 끌어다 놓으세요 또는 파일 선택 한 번에 PDF 1개
텍스트 언어(최대 3개)

핵심 요약

OCR은 스캔본 속 글자 그림을 실제 텍스트로 바꿉니다. 미국 의회도서관은 보존하는 PDF에 검색 가능한 텍스트가 들어 있기를 선호합니다. pd00은 모든 페이지를 300 DPI로 렌더링한 뒤 pd00이 제공하는 10개 언어 중 최대 3개를 골라 Tesseract의 LSTM 엔진으로 읽고, 인식한 단어를 바뀌지 않은 페이지 위에 보이지 않게 얹으며 .txt 사본도 함께 만듭니다.

PDF OCR 사용 방법

  1. 스캔한 PDF 고르기파일을 고르거나 도구 위에 끌어다 놓으세요. 비밀번호가 걸린 스캔본은 미리 ‘PDF 비밀번호 해제’를 거쳐야 하며, 이 단계에는 그 비밀번호가 필요합니다.
  2. 읽을 언어 정하기‘텍스트 언어(최대 3개)’에서 한국어를 그대로 두거나 문서에 쓰인 언어를 고르세요. 여러 언어가 섞인 페이지라면 최대 3개까지 고를 수 있습니다.
  3. 인식한 뒤 다운로드하기‘검색 가능하게 만들기’를 누르고, 페이지를 모두 처리할 때까지 탭을 열어 두세요. 그런 다음 검색 가능한 PDF를 저장하고, 단어만 필요하다면 .txt 파일도 저장하세요.

예시로 살펴보기

계약서.pdf는 A4 10페이지입니다. 1~8페이지는 스캔본이고, 9페이지와 10페이지는 컴퓨터로 작성해 이미 텍스트가 들어 있습니다. 한국어를 선택하고 이미 텍스트가 있는 페이지 건너뛰기에 체크해 둔 채 실행하면, 1~8페이지는 각각 2,480 × 3,507픽셀(210 mm ÷ 25.4 × 300, 297 mm ÷ 25.4 × 300, 소수점 이하 버림)로 렌더링되어 Tesseract가 읽고, 각각 20자 이상의 텍스트가 있는 9페이지와 10페이지는 건너뜁니다.

결과 줄에는 ‘페이지 8개 인식, 2개 건너뜀’이 표시됩니다. 다운로드되는 파일은 이전과 똑같아 보이는 10페이지짜리 계약서-ocr.pdf와 계약서-ocr.txt입니다. .txt 파일에서는 9페이지와 10페이지의 구분 표시 아래가 비어 있는데, 기존 텍스트는 복사해 넣지 않기 때문입니다.

할 수 있는 일과 한계

  • 한 번에 10개 언어 중 1~3개를 고릅니다. 각 언어 모델은 pd00.com에서 한 번만 내려받고, 그 뒤로는 브라우저가 캐시에 저장해 둡니다.
  • 인쇄되거나 타자로 친 글자용입니다. 손글씨, 서명, 손으로 채운 칸은 제대로 읽지 못하거나 아예 읽지 못합니다.
  • 건너뛰기를 켜면 이미 20자 이상 들어 있는 페이지는 읽지 않으며, 그 텍스트는 .txt 파일에 들어가지 않습니다.
  • 결과는 검색할 수 있을 뿐 편집할 수는 없습니다. 각 페이지는 여전히 뒤에 텍스트가 숨은 이미지입니다. 한 번에 PDF 1개를 처리합니다.

출처

2026년 10월 10일에 링크를 확인했습니다.

PDF OCR 소개

스캐너나 휴대폰 스캔 앱은 종이 한 장 한 장을 그림으로 저장합니다. PDF 뷰어에는 픽셀만 보이므로 이름을 검색해도 아무것도 찾지 못하고, 커서로 끌면 문장이 아니라 페이지 전체가 잡힙니다. 문자 인식(OCR)은 그 픽셀을 분석해 어떤 글자가 찍혀 있는지 알아냅니다.

이 페이지에서는 파일의 모든 페이지를 pdf.js로 300 DPI로 그린 뒤, 오픈 소스 OCR 엔진인 Tesseract의 브라우저용 버전 tesseract.js(Apache-2.0 라이선스)에 넘깁니다. 인식한 단어는 원래 페이지의 해당 위치에 맞춰 보이지 않는 텍스트 레이어로 PDF에 다시 기록됩니다. 보이는 페이지는 그대로 둡니다. 스캔 이미지와 색, 도장, 서명이 전과 똑같아 보입니다. 달라지는 점은 이제 문서가 검색에 응답하고, 컴퓨터로 만든 PDF처럼 단어를 드래그해 복사할 수 있다는 것입니다. 단어만 필요하다면 인식한 내용 전체를 일반 .txt 파일로도 받을 수 있습니다.

인식 언어

Tesseract는 어떤 언어를 읽을지 알 때 더 정확합니다. 이 한국어 페이지에서는 한국어가 기본으로 선택되어 있습니다. 영어, 스페인어, 프랑스어, 독일어, 포르투갈어, 이탈리아어, 중국어(간체), 중국어(번체), 일본어도 고를 수 있습니다. 각 언어 모델은 처음 고를 때 pd00.com에서 약 0.7~3 MB를 내려받으며, 브라우저가 캐시에 저장해 다음 실행 때 다시 씁니다.

이럴 때 사용합니다

  • 서명한 계약서에서 조항 찾기

    서명한 계약서가 스캔본으로 돌아왔습니다. OCR을 거치면 당사자 이름이나 “해지” 같은 단어를 검색해, 이미지 수십 장을 넘기지 않고 바로 해당 문단으로 갈 수 있습니다.

  • 몇 년 뒤에도 찾을 수 있는 종이 기록

    보관용으로 스캔한 청구서, 보증서, 편지에 텍스트 레이어가 생기면 컴퓨터의 파일 검색이 그 내용을 색인할 수 있어, 파일 이름뿐 아니라 적힌 내용으로도 찾을 수 있습니다.

  • 복사한 책의 한 장에서 인용하기

    강의 자료집에 실린 책의 한 장이나 학술지 논문 스캔본은 다시 타이핑하지 않고는 인용할 수 없습니다. OCR을 거치면 해당 구절을 선택해 복사한 다음, 페이지 이미지와 대조해 잘못 읽은 글자를 잡아낼 수 있습니다.

텍스트 정확도를 좌우하는 것

OCR은 스캔본에 보이는 것만 읽을 수 있으므로, 어떤 설정보다도 원본 상태가 중요합니다. 가장 좋은 결과는 300 DPI로 스캔했고, 반듯하게 놓였으며, 밝은 바탕에 진한 글씨로 인쇄된 페이지에서 나옵니다. 다음과 같은 경우에는 정확도가 떨어집니다.

  • 낮은 해상도나 흐림. 300 DPI로 렌더링해도 저해상도 스캔이 애초에 담지 못한 디테일은 되살릴 수 없으며, 흔들린 휴대폰 사진 속 작은 글씨는 글자당 픽셀이 너무 적습니다.
  • 기울어지거나 옆으로 누운 페이지. 기울어진 줄과 책 제본 부분 근처의 휘어짐은 단어를 흐트러뜨립니다. 옆으로 누운 페이지는 시작하기 전에 PDF 회전으로 바로 세우세요.
  • 손글씨. Tesseract는 인쇄되거나 타자로 친 글자를 위해 만들어졌습니다. 손으로 쓴 메모, 서명, 손으로 채운 칸은 제대로 인식되지 않습니다.
  • 빠진 언어. 독일어 편지를 영어만으로 읽으면 움라우트가 빠지고 단어를 잘못 판단하기 쉬우므로, 페이지에 쓰인 언어를 모두 선택하세요.

깨끗한 스캔본이라도 숫자 1을 영문자 l로, rn을 m으로 읽는 식의 실수가 가끔 섞입니다. 검색으로는 대부분의 단어를 찾을 수 있지만, 중요한 문서에 복사해 넣는 내용은 꼭 다시 읽어 확인하세요.

인식에 걸리는 시간

노트북에서는 페이지당 몇 초, 휴대폰에서는 그보다 오래 걸린다고 보면 됩니다. 두 페이지짜리 편지는 금방 끝나지만 긴 보고서는 몇 분이 걸릴 수 있으며, 끝날 때까지 탭을 열어 두어야 합니다. 긴 파일은 컴퓨터에서 처리하는 편이 좋습니다. 큰 스캔본에서 일부만 필요하다면 PDF 페이지 추출로 그 페이지만 꺼내 더 짧은 파일에 OCR을 실행하세요.

‘이미 텍스트가 있는 페이지 건너뛰기’는 기본으로 켜져 있어, 컴퓨터로 작성한 보고서 끝에 스캔한 서명 페이지가 붙은 것처럼 섞인 문서에서 시간을 아껴 줍니다. 텍스트가 없는 페이지만 인식하는 것입니다. 모든 페이지를 읽게 하려면 이 옵션을 끄세요.

검색 가능한 사본에 남는 것

보이는 페이지에는 어떤 정리나 기울기 보정, 추가도 하지 않으므로, 결과물은 화면에서나 종이에서나 넣은 스캔본과 똑같아 보입니다. 추가되는 텍스트는 이미지에 비하면 아주 작아서 파일 용량은 대개 조금만 늘어납니다. PDF를 더 작게 하고 싶다면 별도 단계로 PDF 용량 줄이기를 거치고, 보관용으로 알아보기 쉬운 제목을 붙이려면 PDF 메타데이터 편집에서 정하세요.

OCR이 필요 없는 파일

  • 이미 선택할 수 있는 텍스트가 있는 PDF. 뷰어에서 단어를 드래그해 선택할 수 있다면 OCR은 건너뛰고 PDF 텍스트 추출로 단어를 복사하거나, 제목과 목록을 살리려면 PDF 마크다운 변환을 사용하세요.
  • 편집하려는 문서. OCR은 스캔본을 검색 가능하게 만들 뿐 편집 가능하게 만들지는 않습니다. 각 페이지는 뒤에 텍스트가 숨은 그림으로 남으므로, 문장을 그 자리에서 고쳐 쓸 수는 없습니다.

페이지는 이 브라우저 탭 안에서 렌더링되고 읽힙니다. 추가로 내려받는 것은 pd00.com에서 가져오는 언어 모델뿐이며, 스캔본도 그 텍스트도 어디로도 전송되지 않습니다. 확인하는 방법은 여기에 있습니다.

자주 묻는 질문

스캔한 PDF를 검색 가능하게 만들려면 어떻게 하나요?

여기에 PDF를 추가하고 문서에 쓰인 언어를 선택한 뒤 OCR을 시작하세요. 다운로드한 PDF에는 보이지 않는 텍스트 레이어가 들어 있어, Ctrl+F(Mac에서는 Cmd+F)로 스캔한 페이지의 단어를 찾을 수 있습니다.

OCR을 하면 페이지 모양이 바뀌나요?

아닙니다. 인식한 단어는 원래 페이지 이미지 위에 보이지 않게 놓이므로, 어떤 뷰어에서든 문서는 똑같아 보입니다.

스캔한 PDF를 텍스트로 바꿀 수 있나요?

네. 검색 가능한 PDF와 함께 인식한 단어를 .txt 파일로도 제공합니다. OCR은 글자를 잘못 읽을 수 있으므로 이름, 숫자, 금액은 스캔본과 대조해 확인하세요.

어떤 언어를 인식할 수 있나요?

영어, 스페인어, 프랑스어, 독일어, 포르투갈어, 이탈리아어, 중국어(간체), 중국어(번체), 일본어, 한국어입니다. 최대 3개까지 함께 쓸 수 있습니다. 각 언어 모델은 pd00.com에서 한 번만 내려받으며 브라우저가 캐시에 저장합니다.

손글씨도 읽을 수 있나요?

제대로 읽지는 못합니다. Tesseract는 인쇄되거나 타자로 친 글자용으로 설계되어, 손으로 쓴 단어는 잘못 읽거나 놓치는 일이 많습니다.

인식하려면 스캔본을 서버에 업로드해야 하나요?

아닙니다. Tesseract는 브라우저 탭 안에서 실행되고 PDF는 내 기기에 그대로 있습니다. 내려받는 것은 pd00.com에서 가져오는 언어 모델뿐입니다. 확인하는 방법을 참고하세요.

최종 수정일: