PDF テキスト抽出
PDF から文字を取り出して、コピーするか .txt ファイルとして保存します。ページごとに行を組み直し、必要ならページの区切りも入ります。処理はすべてブラウザー内です。
ファイルをドラッグするか、クリックして選んでください
ファイルはサーバーに送信されず、ブラウザ内だけで処理されます。
使い方
PDF を読み込むと、数秒で全ページのテキストが下の欄に表示されます。ボタンひとつでコピーするか、元の文書名を付けた .txt ファイルとしてダウンロードできます。ページ区切りのオプションをオンにすると各ページの前に「--- N ページ ---」の行が入り、どこでページが変わるかが分かります。
このツールは PDF にすでに含まれているテキストレイヤーを読み、各断片がページ上のどこにあるかを見て行を組み直します。Word、Google ドキュメント、LaTeX、ウェブブラウザーから書き出した文書ならうまくいきます。ただし段組み、表、画像の上に重ねた文字は読む順番と違って出ることがあるので、結果を確認してから使ってください。
スキャンした PDF は文字ではなく写真を束ねたものなので、このツールでは何も出てきません。OCR の工程がないためです。スキャナーやスマートフォンのカメラで作ったファイルなら、先に OCR ツールで文字を認識させる必要があります。パスワード付きの PDF も開けないので、パスワードを解除してからやり直してください。
ファイルはパソコンの外に出ません。抽出はすべてブラウザーの中で行われ、どこにもアップロードされないので、契約書や取引明細、社内の報告書も安心して扱えます。
あわせてよく使われるツール
PDF を画像に変換 (PNG / JPG)
PDF の各ページを 72・150・300dpi の PNG または JPG 画像に変換します。必要なページだけ選んで、1 枚ずつでもまとめてでもダウンロードできます。
文字数カウント
スペースを含む文字数と含まない文字数、単語数、行数、段落数、UTF-8 のバイト数をまとめて数えます。文字数制限に合わせたいときに。
テキスト差分
二つのテキストの違う箇所を色分けして表示します。行単位と単語単位を切り替えて確認できます。
Markdown → Word 変換
Markdown を見出しスタイル・リスト・表・コードブロックが生きた本物の .docx に変換します。ブラウザーだけで処理し、アップロードはしません。