핵심 요약
워드프로세서나 웹페이지에서 내보낸 PDF는 글자를 실제 문자로 담고 있으며, pd00은 이를 pdf.js로 읽어 페이지마다 앞에 --- Page N --- 줄을 넣은 UTF-8 .txt 파일로 저장합니다. UTF-8은 모든 유니코드 문자를 1~4바이트로 인코딩하므로 악센트 문자, 키릴 문자, 한자도 온전히 옮겨집니다. 스캔한 페이지에는 문자가 없어서 빈 페이지로 나옵니다.
PDF 텍스트 추출 사용 방법
- PDF 추가하기기기에서 PDF를 고르거나 도구 위로 끌어다 놓으세요. 비밀번호를 묻는 파일은 잠금을 푼 뒤에야 텍스트를 읽을 수 있습니다.
- 추출한 텍스트 확인하기‘텍스트 추출’을 누르면 텍스트가 미리 보기에 페이지별로 나타나며, 페이지 사이는 --- Page N --- 줄로 구분됩니다. 읽는 순서가 자연스러운지 훑어보세요.
- 복사하거나 .txt로 저장하기‘텍스트 복사’를 누르면 전체 텍스트가 클립보드에 들어갑니다. 아니면 검색하고 편집하거나 다른 곳에 붙여 넣을 수 있는 UTF-8 텍스트 파일로 다운로드하세요.
예시로 살펴보기
3페이지짜리 임대차 계약서 임대차계약서.pdf가 있습니다. 1~2페이지는 워드프로세서로 작성했고, 3페이지는 서명란을 스캔한 것입니다. 추출하면 임대차계약서.txt가 만들어지는데, --- Page 1 --- 줄과 --- Page 2 --- 줄 아래에는 각 페이지의 문단이 들어가고 --- Page 3 --- 줄 아래에는 아무것도 없습니다. 스캔본에는 문자가 없기 때문입니다.
이 UTF-8 파일에서 임차인 이름 “José”는 5바이트를 차지합니다. J, o, s가 1바이트씩, é가 2바이트입니다.
할 수 있는 일과 한계
- 이미 있는 텍스트 레이어만 읽습니다. 스캔본은 먼저 PDF OCR을 거친 뒤 추출하세요.
- 항상 PDF 전체를 대상으로 하며 한 번에 파일 1개만 처리합니다. 특정 챕터만 필요하면 먼저 PDF 페이지 추출로 떼어 내세요.
- 텍스트는 파일에 저장된 순서를 따르므로, 2단 페이지나 사이드바는 줄이 뒤섞여 나올 수 있습니다.
- 글꼴, 이미지, 표의 칸 구분은 사라집니다. 제목과 목록을 살리려면 PDF 마크다운 변환을 사용하세요.
출처
- PDF.js Mozilla
- RFC 3629: UTF-8, a transformation format of ISO 10646 RFC Editor
2026년 10월 10일에 링크를 확인했습니다.
PDF 텍스트 추출 소개
워드프로세서, 웹페이지, 스프레드시트로 만든 PDF는 대부분 실제 텍스트를 담고 있습니다. 화면에 보이는 배치와 함께, 위치 정보가 붙은 문자가 저장되어 있습니다. 이 도구는 Mozilla의 오픈 소스 PDF 라이브러리인 pdf.js로 그 텍스트 레이어를 읽어 일반 텍스트로 돌려줍니다. 화면에서 미리 보며 텍스트 복사 버튼을 쓸 수 있고, 전체를 어떤 텍스트 편집기에서나 열리는 UTF-8 .txt 파일로 저장할 수도 있습니다.
결과물에는 페이지마다 텍스트 앞에 --- Page 3 --- 같은 표시 줄이 들어가므로, 어느 구절이 어느 페이지에서 왔는지 알 수 있고 필요 없는 페이지를 지울 수도 있습니다. 파일이 UTF-8이므로, PDF가 진짜 문자로 저장해 두었다면 악센트가 붙은 문자, 그리스 문자, 키릴 문자, 중국어, 일본어 등 다른 문자도 온전히 옮겨집니다. 제목, 작성자 같은 문서 속성은 포함되지 않고 페이지의 텍스트만 들어갑니다.
스캔한 PDF는 빈 결과가 나옵니다
스캐너나 휴대폰 카메라로 만든 PDF는 대개 페이지 사진을 쌓아 놓은 것에 불과합니다. 안에 추출할 문자가 없으므로 결과는 비어 있습니다. 이미지에서 글자를 읽으려면 OCR(문자 인식)이 필요합니다. 이 도구는 OCR을 직접 하지 않지만, 이 사이트의 PDF OCR이 역시 브라우저 안에서 그 일을 합니다. 시작하기 전에 간단히 시험해 보세요. 아무 뷰어에서나 PDF를 열고 단어 하나를 드래그해 선택해 봅니다. 선택 영역이 글자에 맞춰 잡히면 텍스트 레이어가 있는 것입니다.
이럴 때 사용합니다
다시 입력하지 않고 구절 인용하기
이메일이나 보고서에 계약서, 연구 논문, 사용 설명서의 한 문단이 필요할 때가 있습니다. 텍스트를 추출하고 표시 줄로 해당 페이지를 찾아 필요한 부분만 붙여 넣으세요.
긴 문서 검색과 비교
.txt 파일은 어떤 편집기에서든 검색할 수 있고, diff 도구로 이전 초안과 한 줄씩 비교하거나, 스프레드시트나 스크립트에 불러와 개수를 세고 정렬할 수도 있습니다.
다른 앱에 글자 넘기기
번역 도구, 메모 앱, 채팅 어시스턴트는 PDF보다 일반 텍스트를 더 쉽게 받습니다. 추출한 텍스트를 붙여 넣으면 원본 파일 전체를 올리는 대신 고른 구절만 공유할 수 있습니다.
읽는 순서와 레이아웃
텍스트는 PDF 안에 저장된 순서대로 나오며, 이 순서는 사람이 읽는 순서와 대개 같지만 항상 그렇지는 않습니다. 편지, 보고서, 대부분의 전자책처럼 단이 하나인 문서는 깔끔하게 추출됩니다. 2단이나 3단 레이아웃, 사이드바, 캡션, 떠 있는 텍스트 상자가 있으면 내용이 뒤섞일 수 있습니다. 왼쪽 단의 한 줄 다음에 오른쪽 단의 한 줄이 오거나, 캡션이 문단 한가운데에 끼어드는 식입니다.
서식은 일반 텍스트에 포함되지 않습니다. 굵은 글씨, 기울임꼴, 글자 크기, 색, 그림은 빠지고, 표는 깔끔한 칸이 아니라 공백이나 줄바꿈으로 구분된 단어의 나열이 됩니다. 글자보다 페이지 모양이 더 중요하다면 PDF PNG 변환으로 만든 이미지가 픽셀 형태로나마 레이아웃을 정확히 보존합니다.
해상도 설정이 없는 이유
pd00에서 페이지를 이미지로 바꾸는 도구들이 72, 150, 300 DPI를 묻는 것은 각 페이지를 픽셀 격자로 그리기 때문입니다. 텍스트 추출은 아무것도 그리지 않습니다. 저장된 문자를 직접 읽으므로 고를 해상도도 없고 품질 손실도 없습니다. 결과는 PDF에 든 텍스트 그대로입니다. 결과 파일도 가볍습니다. .txt에는 글꼴도 이미지도 없이 문자만 들어가므로, 원래 PDF보다 훨씬 작은 경우가 많습니다.
결과가 이상할 때
- 아무것도 나오지 않습니다. 스캔본이거나 이미지로 내보낸 PDF입니다. 이때는 OCR만이 도움이 됩니다. 먼저 PDF OCR로 보이지 않는 텍스트 레이어를 더한 뒤, 이 도구로 텍스트를 추출하세요.
- 단어 대신 이상한 기호가 나옵니다. 일부 PDF는 그려진 글자 모양을 실제 문자로 되돌리는 대응표 없이 글꼴을 포함합니다. 화면에서는 멀쩡해 보여도 저장된 코드는 그 글꼴 밖에서는 의미가 없으므로, OCR로만 단어를 되살릴 수 있습니다.
- 단어가 쪼개지거나 붙어 버립니다. PDF는 텍스트를 위치에 따라 조각조각 배치하므로, 특히 양쪽 정렬한 문단이나 자간을 넓힌 제목에서 공백이 더 생기거나 빠질 수 있습니다.
- 파일이 잠겨 있습니다. PDF 비밀번호 해제로 비밀번호를 없앤 뒤(비밀번호를 알고 있어야 합니다) 추출하세요.
문서의 일부만 필요하다면
텍스트 추출 도구는 파일 전체를 대상으로 작동합니다. 400페이지짜리 설명서에서 한 챕터만 필요하다면 먼저 PDF 페이지 추출이나 PDF 분할로 그 부분을 잘라 낸 다음, 짧아진 PDF를 여기에 넣으세요.
텍스트는 비공개로 남습니다
PDF는 브라우저 탭 안에서 해석되고 텍스트는 내 기기에서 만들어집니다. 파일도, 추출한 글자도 어디에도 업로드되지 않습니다. 계약서, 진료 관련 서신 같은 기밀 서류라면 이 점이 중요합니다. 개인정보 처리방침의 단계를 따라 직접 확인해 보세요.