PDF 텍스트 추출

PDF 에 담긴 글자를 뽑아 텍스트로 보여 줍니다. 복사해서 쓰거나 txt 파일로 내려받을 수 있습니다. 파일은 브라우저 안에서만 처리하며 서버로 올라가지 않습니다.

PDF 선택

PDF 파일을 끌어다 놓거나 클릭해서 고르세요

한 번에 한 개씩 처리합니다.

옵션

추출 결과

PDF 텍스트 추출은 PDF 안의 글자를 뽑아 편집할 수 있는 텍스트로 보여 줍니다. 복사해서 다른 문서에 붙이거나 txt 파일로 내려받을 수 있고, 필요한 페이지만 골라 뽑을 수도 있습니다. 보고서에서 문단을 인용하거나, 표가 아닌 본문을 다시 쓸 때 씁니다. 파일은 브라우저 안에서만 처리하므로 서버로 올라가지 않습니다.

PDF텍스트추출 사용 방법

  1. PDF 파일을 점선 영역에 끌어다 놓거나 클릭해서 고릅니다. 전체 페이지 수가 표시됩니다.
  2. 일부만 필요하면 뽑을 페이지 칸에 1-3, 5 처럼 적습니다. 비워 두면 전체를 뽑습니다.
  3. 페이지 구분선을 넣을지, 여분의 빈 줄을 정리할지 정합니다.
  4. 텍스트 추출을 누르면 오른쪽에 결과가 나옵니다.
  5. 전체 복사로 클립보드에 담거나 txt 다운로드로 저장합니다.

지원 형식과 입력 조건

입력
PDF 파일 한 개
페이지 지정
1-3, 5, 7-9 형식. 비우면 전체
옵션
페이지 구분선 넣기, 여분의 빈 줄 정리
출력
화면 표시, 클립보드 복사, txt 파일 저장(UTF-8 + BOM)
처리 위치
브라우저 안에서만 처리하며 파일을 서버로 올리지 않습니다
제한
스캔·사진으로 만든 PDF 는 뽑을 글자가 없습니다. 암호가 걸린 PDF 도 읽지 못합니다

스캔한 PDF 에서는 글자가 나오지 않습니다

  • PDF 에는 두 종류가 있습니다. 워드나 한글에서 만든 문서는 글자가 문자로 들어 있어 그대로 뽑을 수 있습니다.
  • 반면 종이를 스캔하거나 사진으로 찍어 만든 PDF 는 페이지 전체가 하나의 그림입니다. 사람 눈에는 글자로 보여도 파일 안에는 문자 정보가 없습니다.
  • 그런 파일을 넣으면 이 도구는 빈 결과를 성공처럼 내놓지 않고 왜 비었는지 알려 줍니다. 이 경우 문자 인식(OCR) 과정이 따로 필요합니다.

줄바꿈과 순서에 대해

  • PDF 는 글자를 위치로 배치하는 형식이라 "문단"이라는 개념이 약합니다. 이 도구는 글자의 세로 위치가 바뀌면 줄을 바꿔 원래 모양에 가깝게 잇습니다.
  • 단이 여러 개인 문서(신문·논문)는 순서가 뒤섞일 수 있습니다. 왼쪽 단과 오른쪽 단의 글자가 같은 높이에 있으면 어느 쪽이 먼저인지 파일만으로는 알 수 없기 때문입니다.
  • 표는 칸 구분이 사라지고 값만 이어집니다. 표 데이터가 필요하다면 옮겨 적거나 다른 방법을 쓰는 편이 정확합니다.

txt 파일에 BOM 을 붙입니다

  • 내려받는 txt 는 UTF-8 로 저장하고 맨 앞에 BOM 이라는 표식을 붙입니다.
  • 이 표식이 없으면 윈도우 메모장이 파일을 다른 인코딩으로 읽어 한글이 깨지는 일이 흔합니다.
  • 복사 버튼으로 가져간 내용에는 이 표식이 붙지 않습니다. 편집기에 붙여 저장할 때는 UTF-8 로 저장하세요.

자주 묻는 질문

올린 PDF 가 서버에 저장되나요?

저장되지 않습니다. 파일을 읽고 글자를 뽑는 일이 모두 브라우저 안에서 이루어집니다. 다만 PDF 를 다루는 라이브러리는 인터넷에서 받아 오므로 연결은 필요합니다.

글자가 하나도 안 나옵니다.

스캔본일 가능성이 높습니다. 페이지가 그림이라 뽑을 문자가 없는 경우이고, 화면에도 그 안내가 표시됩니다. PDF 뷰어에서 글자를 마우스로 드래그해 선택할 수 있는지 보면 바로 알 수 있습니다 — 선택되지 않으면 그림입니다.

표가 엉망으로 나옵니다.

PDF 의 표는 칸 정보가 아니라 위치만 갖고 있어, 텍스트로 뽑으면 구분이 사라집니다. 표가 목적이라면 원본을 만든 프로그램에서 내보내거나 직접 옮기는 편이 정확합니다.

쪽수가 많은 문서도 되나요?

됩니다. 다만 페이지가 아주 많으면 시간이 걸리므로, 필요한 부분만 페이지 범위로 지정하면 훨씬 빠릅니다.