PDF 텍스트 추출

PDF의 글자 레이어를 읽어 TXT로 저장합니다. 스캔 이미지만 있는 PDF는 글자가 없다고 알려 드립니다.

PDF 파일을(를) 여기에 끌어 놓거나

지원: PDF · 한 파일 · 결과: TXT 1개

파일이 서버로 전송되지 않습니다.

    먼저 파일을 선택하세요.

    다음 작업 보기 · 이 결과가 예상과 다른가요?

    스캔한 PDF(글자가 이미지로만 있는 파일)는 텍스트가 나오지 않습니다. 이 도구는 OCR(문자 인식)을 하지 않습니다.

    문서에 담긴 글자 레이어를 뽑아 냅니다

    PDF 텍스트 추출은 문서 안에 저장된 글자 데이터를 읽어 순서대로 늘어놓는 작업입니다. 결과는 화면에서 바로 읽고 복사할 수 있고, TXT 파일로 저장할 수도 있습니다. 워드로 옮겨 편집하거나, 긴 보고서에서 특정 문구를 찾거나, 두 문서의 문장을 비교하기 전 단계로 씁니다.

    이 페이지의 테스트 문서를 PC 크롬에서 재어 보았습니다. 3쪽짜리에서 5,712자를 뽑는 데 0.01초가 걸렸고, 20쪽 9.4메가바이트 문서는 0.18초, 82쪽 97메가바이트 문서는 0.49초였습니다. 파일 크기보다 쪽수와 글자 수에 시간이 좌우되므로, 사진이 많아 무거운 문서라도 글자가 적으면 금방 끝납니다.

    글자 뽑는 순서

    1. PDF 하나를 고릅니다.
    2. 일부만 필요하면 페이지 칸에 1-3처럼 적습니다. 비워 두면 전체를 읽습니다.
    3. 「텍스트 추출」을 누르고 화면에서 복사하거나 TXT로 저장합니다.

    스캔한 문서에서는 글자가 나오지 않습니다

    PDF에는 두 종류가 섞여 있습니다. 워드나 한글에서 저장한 문서는 글자가 글자 데이터로 들어 있어 그대로 읽힙니다. 반면 종이를 스캐너로 찍거나 사진으로 찍어 만든 문서는 쪽 전체가 그림 한 장이고, 사람 눈에만 글자로 보일 뿐 파일 안에는 글자 데이터가 없습니다.

    그런 문서를 넣으면 결과가 비어 있고 「글자 레이어가 없습니다」라고 알려 줍니다. 이 도구는 그림 속 글자 모양을 인식하는 문자 인식 기능을 갖고 있지 않기 때문입니다. 한 문서 안에서 앞부분은 워드로 만들고 뒷부분만 스캔해 붙인 경우도 있습니다. 이때는 앞쪽만 글자가 나오고 뒤쪽은 빈 채로 남으며, 몇 쪽이 비었는지 결과에 숫자로 표시됩니다.

    페이지 범위와 구분선을 정하는 법

    페이지 칸은 쉼표와 하이픈을 섞어 적을 수 있습니다. 1-3은 1쪽부터 3쪽까지, 2,5,9는 그 세 쪽만, 10-은 10쪽부터 끝까지를 뜻합니다. 적은 순서가 결과 순서가 되므로 뒤쪽을 먼저 적으면 그대로 뒤집혀 나옵니다.

    「페이지 구분선 넣기」를 켜 두면 쪽이 바뀔 때마다 몇 쪽인지 적힌 줄이 들어갑니다. 인용할 때 쪽 번호를 함께 적어야 하는 자료라면 켜 두는 편이 편합니다. 반대로 뽑은 글을 곧바로 다른 곳에 붙여 넣을 계획이면 끄는 편이 낫습니다. 구분선이 문장 사이에 끼어 문단이 끊기기 때문입니다.

    이 도구가 하는 일과 하지 않는 일

    합니다

    • 같은 높이에 놓인 글자 조각을 한 줄로 모아 원래 줄바꿈에 가깝게 복원합니다.
    • 몇 쪽에서 글자가 나왔고 몇 쪽이 비었는지, 전체 몇 자인지 숫자로 보여 줍니다.
    • 결과를 화면에서 바로 읽게 해 주고, 그대로 복사하거나 TXT 파일로 저장하게 합니다.
    • 지정한 페이지만 읽으므로 긴 문서에서 필요한 부분만 빠르게 뽑을 수 있습니다.

    하지 않습니다

    • 그림 속 글자를 인식하지 않습니다. 스캔본은 빈 결과가 나옵니다.
    • 표의 칸 구조를 살리지 않습니다. 표 안의 글자는 줄 단위로 늘어서며 열 구분이 사라집니다.
    • 굵기·색·글꼴 크기 같은 서식을 옮기지 않습니다. 결과는 서식 없는 글자입니다.
    • 단이 둘로 나뉜 논문에서 좌우 단의 순서를 항상 맞춰 주지는 못합니다.
    • 암호가 걸린 문서는 열지 못하고 그 사실을 알려 줍니다.

    뽑아낸 글에 같은 줄이 여러 번 반복되거나 머리말이 쪽마다 끼어 있다면 중복 줄 삭제로 걸러 낼 수 있습니다. 개정 전후 문서를 비교할 목적이라면 두 파일에서 각각 글자를 뽑은 뒤 텍스트 비교에 넣으면 바뀐 문장만 드러납니다.

    자주 묻는 질문

    PDF 텍스트 추출이 무료인가요

    무료입니다. 쪽수 제한도 파일 크기 제한도 없고 결과 파일에 표식을 넣지 않습니다. 문서가 서버로 올라가지 않고 방문자 기기 안에서 읽히기 때문에 제한을 걸 이유가 없습니다.

    결과가 비어 있는데 왜 그런가요

    그 문서가 스캔본이라 글자 데이터가 없기 때문입니다. 화면에서는 글자로 보여도 파일 안에는 그림만 들어 있습니다. 확인하려면 PDF 뷰어에서 본문 글자를 마우스로 긁어 보세요. 선택이 되지 않으면 이 도구로는 뽑을 수 없습니다.

    줄바꿈이 엉뚱한 자리에서 끊어집니다

    원본이 각 줄을 따로 배치해 저장한 경우입니다. 문서마다 글자를 배치하는 방식이 달라서 문단 단위로 항상 이어 붙이지는 못합니다. 뽑은 뒤 편집기에서 줄바꿈을 정리하는 편이 빠릅니다.

    한글이 깨져 나오는 문서가 있습니다

    글꼴을 넣을 때 글자 대응표를 빠뜨린 문서에서 생깁니다. 이 경우 파일 안의 글자 코드가 실제 글자와 연결되지 않아 어떤 프로그램으로 열어도 같은 결과가 나옵니다. 문서를 만든 쪽에서 다시 저장한 파일을 받아야 합니다.

    표를 엑셀로 옮기고 싶습니다

    이 도구의 결과로는 열이 구분되지 않아 바로 옮기기 어렵습니다. 쪽이 많지 않다면 PDF 이미지 변환으로 그림을 만들어 화면에 띄워 두고 보면서 옮기는 방법이 현실적입니다.