PDF テキスト抽出

PDF から文字を取り出して、コピーするか .txt ファイルとして保存します。ページごとに行を組み直し、必要ならページの区切りも入ります。処理はすべてブラウザー内です。

ブラウザ内だけで処理

ファイルはサーバーに送信されず、ブラウザ内だけで処理されます。

使い方

PDF を読み込むと、数秒で全ページのテキストが下の欄に表示されます。ボタンひとつでコピーするか、元の文書名を付けた .txt ファイルとしてダウンロードできます。ページ区切りのオプションをオンにすると各ページの前に「--- N ページ ---」の行が入り、どこでページが変わるかが分かります。

このツールは PDF にすでに含まれているテキストレイヤーを読み、各断片がページ上のどこにあるかを見て行を組み直します。Word、Google ドキュメント、LaTeX、ウェブブラウザーから書き出した文書ならうまくいきます。ただし段組み、表、画像の上に重ねた文字は読む順番と違って出ることがあるので、結果を確認してから使ってください。

スキャンした PDF は文字ではなく写真を束ねたものなので、このツールでは何も出てきません。OCR の工程がないためです。スキャナーやスマートフォンのカメラで作ったファイルなら、先に OCR ツールで文字を認識させる必要があります。パスワード付きの PDF も開けないので、パスワードを解除してからやり直してください。

ファイルはパソコンの外に出ません。抽出はすべてブラウザーの中で行われ、どこにもアップロードされないので、契約書や取引明細、社内の報告書も安心して扱えます。

あわせてよく使われるツール