PDFからテキストを抽出
PDFからテキストを取り出し、TXTまたはWord(.docx)としてダウンロードできます。PDFはブラウザ内だけで読み込まれ、どこにもアップロードされません。契約書、履歴書、請求書のような書類ではこれが重要です。
このツールでできること・できないこと
PDFは文書形式ではなくレイアウト形式で、各文字がどこに描かれるかを保存し、テキストがどう構造化されているかは保存しません。そのため確実に扱える部分と近似になる部分があります。
- テキストは文字の位置から再構成されます。縦位置で行にまとめ、その行を左から右に並べます。通常の1段組みの文書はきれいに出力されます。
- 多段組み、表、ヘッダー、フッターは近似です。段が混ざったり、表のセルが格子を失ったりします。その構造はファイルに保存されていないためです。
- スキャンしたPDFにはテキストが一切含まれません。空のファイルをダウンロードする代わりに通知しますが、読み取りはできません。OCRが必要です。
- 書式は保持されません。太字、フォント、サイズ、色、画像は失われ、文字だけが残ります。
- パスワード保護されたPDFは開けず、その旨が表示されます。
- 何もアップロードされません。PDFはご自身のブラウザで解析され、解析用のworkerファイルも第三者のCDNではなくこのサイトから配信されます。
よくある質問
PDFはサーバーにアップロードされますか?
いいえ。PDFはご自身のブラウザだけで読み込まれ、解析用のworkerファイルも第三者のCDNではなくこのサイトから配信されます。そのため文書を開いてもファイルを外部へ送る通信は発生しません。ページを読み込んだ後にネットワークを切断して抽出すれば確認できます。
抽出されたテキストが空なのはなぜですか?
ほぼ確実にPDFがスキャンであるためです。ページが画像として保存されており、抽出できる文字がファイル内にありません。このツールはそれを検出し、空のファイルをダウンロードする代わりに通知します。スキャンを読むには画像内の文字を認識するOCRという別の技術が必要で、このツールは対応していません。
.docxではなく.docで出力できますか?
いいえ。これは意図的です。従来の.docはWord 97時代のバイナリ形式で、ブラウザで生成するのは現実的ではありません。HTMLファイルを.docという名前にする回避策もありますが、ファイルが自身の形式を偽ることになり、Wordで警告が出る場合があります。ここで出力される.docxは本物のWordファイルなので、Word、Googleドキュメント、LibreOffice、Pagesで問題なく開けます。
テキストの順序が正しくないのはなぜですか?
PDFは各文字がどこに描かれるかを記録し、どの順で読むべきかは記録しません。そのため順序は位置から再構成する必要があります。このツールは縦位置で文字を行にまとめ、各行を左から右に読みます。通常の文書では良好ですが、2段組みや表では崩れます。ファイルにそれが段やセルだという情報が残っていないためです。
DOCXで書式は維持されますか?
いいえ。抽出されたテキストが1行ごとに1段落として入るだけで、太字、フォント、サイズ、色、画像は含まれません。PDFから文字を取り出して編集できる形にすることが目的で、元のデザインを再現するものではありません。
PDFの上限サイズはどれくらいですか?
100MBまでです。ブラウザがファイル全体と解析済みの各ページをメモリに保持するため上限があり、ファイルサイズよりページ数の影響が大きくなります。テキストの多い5MBのPDFが数千ページになることもあります。拒否された場合は分割してお試しください。