このツールはブラウザ内で PDF をページごとに読み取り、選択可能な文字をプレーンテキストとしてまとめます。文書全体だけでなく、開始ページと終了ページを指定して必要な範囲だけを抽出できます。
PDF が画像スキャンのみで埋め込みテキストを含まない場合、結果は空になることがあります。その場合はページを画像として書き出すかキャプチャし、画像 OCR で認識してから文字をコピーしてください。
このテーマに関するよくある疑問と回答をまとめました。
PDF を選ぶと、ファイル内に埋め込まれているテキストの抽出が自動で始まります。「すべてのページを抽出」のまま文書全体を処理するか、開始ページと終了ページを入力して必要な範囲だけを処理できます。結果には元の PDF のページ番号が保持されます。
PDF に OCR のテキストレイヤーが含まれていない限り抽出できません。画像だけのページには読み取れる埋め込みテキストがないため、結果が空になることがあります。ページを画像として書き出すかキャプチャし、先に画像 OCR で文字を認識してください。
はい。「すべてのページを抽出」を解除し、必要な最初と最後のページを入力してください。その連続した範囲をすべて抽出し、結果には元のページ番号が残ります。離れた複数の範囲を1回でまとめることはできません。
いいえ。出力は PDF が提供する順序で集めたプレーンテキストです。フォント、画像、表のセル、段組み、ページの見た目は保持されないため、複雑な複数段組みの文書では文字の順序が変わることがあります。
はい。抽出したすべてのページを横断して検索し、一致するページへ移動できます。現在のページまたは全文をコピーでき、選択中の「原文」または「整理後」を TXT ファイルとしてダウンロードできます。
「原文」は抽出結果を変更せず保持します。「整理後」は改行コードをそろえ、行末の半角スペースを削除し、余分な空行を減らすだけです。文章の書き換え、OCR や AI、段組みの再構成、Markdown 変換は行わず、いつでも原文に戻せます。