PDF 글자 추출 (텍스트로 변환)

PDF 안의 글자를 뽑아 복사하거나 txt로 저장합니다. 쪽마다 붙는 머리말과 쪽 번호를 걸러 냅니다.

PDF 안의 글자를 뽑아 복사하거나 txt로 저장합니다.

PDF가 서버로 전송되지 않습니다. 모든 처리는 이 브라우저 안에서만 이루어집니다.

사용 방법

  1. PDF를 고르면 글자를 뽑아 바로 보여 줍니다.
  2. 머리말·쪽 번호가 섞여 나오거나 반대로 필요한 줄이 사라졌다면 설정을 켜고 꺼 보세요. 바로 다시 만들어집니다.
  3. 붙여 넣어 쓸 것이라면 문단으로 잇기를 켜는 편이 편합니다.
  4. 복사하거나 txt로 저장합니다.

PDF에서 글자를 뽑는 일이 왜 까다로운가

PDF는 글을 문단으로 담지 않습니다. "이 글자 조각을 이 좌표에 그려라"의 목록일 뿐입니다. 그래서 그냥 이어 붙이면 이렇게 됩니다.

계약당사자갑과을은다음과같이합의한다제1조목적본계약은…

읽을 수 있게 만들려면 세 가지를 짐작해야 합니다.

세 번째가 손으로 하기 가장 번거로운 일입니다. 300쪽짜리 문서에서 쪽마다 붙은 제목과 번호를 지우려면 300번을 지워야 합니다.

안 되는 경우

함께 쓰면 좋은 도구

자주 묻는 질문

글자가 하나도 안 나옵니다.

<strong>스캔한 PDF</strong>일 가능성이 큽니다. 종이를 찍거나 스캔해서 만든 PDF는 겉보기에 글자처럼 보여도 실제로는 <strong>사진 한 장</strong>이라, 뽑아낼 글자가 아예 없습니다. 그런 파일이면 미리 알려 드립니다. 글자로 바꾸려면 문자 인식(OCR)이 필요한데, 그 기능은 큰 프로그램을 내려받아야 해서 이 사이트에는 넣지 않았습니다.

쪽마다 붙는 제목과 쪽 번호가 섞여 나옵니다.

기본으로 <strong>걸러 내도록</strong> 해 두었습니다. 여러 쪽에 되풀이되면서 쪽의 위아래 끝에 있는 줄을 머리말·꼬리말로 봅니다. 본문 한가운데 되풀이되는 문장은 건드리지 않습니다 — 조항 제목이나 표의 항목 이름일 수 있어서입니다. 그래도 남거나, 반대로 필요한 줄이 사라졌다면 아래 설정을 꺼 보세요.

띄어쓰기가 이상합니다.

PDF에는 띄어쓰기가 글자로 저장되지 않는 경우가 많습니다. "이 글자를 여기에, 저 글자를 저기에"라고만 적혀 있어서, <strong>글자 사이 간격을 보고 띄어쓰기를 짐작</strong>해야 합니다. 대부분 맞지만 글꼴이나 자간에 따라 어긋날 수 있습니다. 어떤 도구를 써도 같은 문제가 생깁니다.

줄이 어정쩡하게 끊겨서 붙여 넣기 불편합니다.

<strong>문단으로 잇기</strong>를 켜 보세요. PDF의 줄바꿈은 대부분 종이 폭 때문에 생긴 것이지 문단이 바뀐 것이 아닙니다. 문장이 끝나지 않은 채로 다음 줄로 넘어간 곳을 찾아 하나로 잇습니다. 목록이나 조항처럼 번호·기호로 시작하는 줄은 잇지 않습니다.

표가 뒤죽박죽입니다.

표는 PDF에서 "칸"이라는 정보 없이 <strong>글자 조각의 위치</strong>로만 저장됩니다. 그래서 어디까지가 한 칸인지 알 방법이 없고, 왼쪽부터 순서대로 이어 붙일 수밖에 없습니다. 표가 중요한 문서라면 "PDF → 이미지"로 그림을 뽑아 두고 보시는 편이 낫습니다.

내용이 유출되지 않나요?

파일은 <strong>어디에도 전송되지 않습니다.</strong> 열기·뽑기·저장 모두 이 브라우저 안에서만 이루어집니다. 인터넷을 끊고도 동작합니다. 계약서나 내부 문서를 다룰 때 웹 도구를 쓰기 꺼려지는 이유가 바로 이 부분인데, 여기서는 해당하지 않습니다.

이 도구가 도움이 되었다면 공유해 주세요

계산 결과가 이상한가요? 알려 주세요.

계산 결과는 참고용이며 법적 효력이 없습니다.

다른 도구