달달툴즈

PDF 텍스트 추출

PDF에서 글자를 뽑아내 복사하거나 .txt 파일로 저장합니다. 페이지마다 줄을 되살리고 원하면 페이지 구분선을 넣습니다. 브라우저 안에서만 처리됩니다.

브라우저에서만 처리

파일은 서버로 전송되지 않고 브라우저에서만 처리됩니다.

사용 방법

PDF를 올리면 몇 초 안에 모든 페이지의 텍스트가 아래 상자에 나타납니다. 버튼 한 번으로 복사하거나 원본 문서 이름을 딴 .txt 파일로 내려받을 수 있습니다. 페이지 구분선 옵션을 켜면 페이지마다 앞에 "--- N페이지 ---" 줄이 들어가서 어디서 페이지가 바뀌는지 알 수 있습니다.

이 도구는 PDF에 이미 들어 있는 텍스트 레이어를 읽고, 각 조각이 페이지 위 어디에 놓였는지를 보고 줄을 되살립니다. Word, 구글 문서, LaTeX, 웹 브라우저에서 내보낸 문서는 잘 됩니다. 다만 다단 편집, 표, 이미지 위에 얹은 글자는 읽는 순서와 다르게 나올 수 있으니 결과를 확인한 뒤 쓰세요.

스캔한 PDF는 글자가 아니라 사진을 쌓아 놓은 것이라서 이 도구로는 아무것도 나오지 않습니다. OCR 단계가 없기 때문입니다. 스캐너나 휴대폰 카메라로 만든 파일이라면 먼저 OCR 도구로 글자를 인식시켜야 합니다. 비밀번호가 걸린 PDF도 열 수 없으니 비밀번호를 해제한 뒤 다시 시도하세요.

파일은 컴퓨터 밖으로 나가지 않습니다. 추출은 전부 브라우저 안에서 이루어지고 어디에도 업로드되지 않으므로 계약서, 거래 명세서, 사내 보고서도 안심하고 다룰 수 있습니다.

이런 도구도 함께 씁니다