TegaruTools

PDFテキスト抽出

PDFに埋め込まれた文字を読み取ってテキストとして取り出せます。コピーできないPDFの文字も取り出せます。

完全無料ブラウザ完結登録不要安全

ここにPDFをドラッグ&ドロップ

または下のボタンから選択

PDF対応

このツールについて

  • 選択したPDFはブラウザ内のみで処理されます。サーバーには送信されません。
  • 文字情報を持つPDFが対象です。画像だけのスキャンPDFからは文字を取り出せません。
  • レイアウトによっては読み順が乱れ、改行や並びが元と異なることがあります。
  • 抽出したテキストはその場で編集してから、コピー・ダウンロードできます。

関連ツール

使い方

PDFテキスト抽出ツールの操作画面。抽出結果のテキストエリアに、ページ区切り付きで各ページの文字が表示されている
PDFテキスト抽出ツールで抽出したテキストの表示画面
  1. 1「PDFを選択」ボタンをクリックするか、ドロップゾーンにPDFをドラッグ&ドロップします。
  2. 2「テキストを抽出する」ボタンを押すと、各ページから文字を読み取ります。
  3. 3抽出結果がテキストで表示されます。ページ区切りの有無はチェックボックスで切り替えられます。
  4. 4読み順や改行が気になるところは、その場でテキストを編集して整えます。
  5. 5「テキストをコピー」または「テキストをダウンロード」で、抽出した文章を保存します。

よくある利用シーン

  • コピーが禁止されているPDFから、必要な部分の文字を取り出す
  • 選択がうまくできないPDFの本文を、テキストとしてまとめて書き出す
  • PDFの内容を翻訳ツールや検索にかけるために、テキストへ変換する
  • 資料や論文の文章を引用するために、該当箇所をテキストで抜き出す
  • PDFの文字数を数えたいときに、いったんテキストにしてから文字数を確認する

よくある質問

PDFはサーバーに送信されますか?

いいえ。PDFの読み込みからテキストの抽出まで、すべての処理がブラウザ内で完結します。PDFがサーバーにアップロードされることは一切ないため、社外秘の資料や個人情報を含むPDFでも安心してご利用いただけます。

スキャンしたPDFからも文字を取り出せますか?

取り出せません。このツールは、PDFの中に埋め込まれた文字情報を読み取ります。スキャンした書類や、写真として保存されたPDFは中身が「画像」のため、文字を取り出せません。その場合は、まずPDFを画像に変換ツールでページを画像化し、画像文字起こし(OCR)ツールで文字を読み取ってください。文字を取り出せなかったときは、画面にこの案内を表示します。

抽出したテキストの改行や並びが元と違うのはなぜですか?

PDFは「どの位置にどの文字を置くか」という情報は持っていますが、「ここが段落」「ここが表」といった文書の構造は持っていないことが多いためです。段組み・表・縦書きなどのレイアウトでは、読み順が入れ替わったり、改行が元と異なったりすることがあります。抽出後のテキストはその場で編集できますので、必要に応じて整えてからご利用ください。

パスワード付きのPDFは処理できますか?

パスワードで保護されたPDFは、そのままでは処理できません。先にPDFパスワード解除・設定ツールでパスワードを外してから、あらためて読み込んでください。パスワードで保護されたPDFを選んだ場合は、画面に案内を表示します。

縦書きのPDFは正しく読み取れますか?

縦書きの文字も抽出できますが、レイアウトによっては読み順が乱れることがあります。とくに縦書きと横書きが混在するページや、ルビ・注釈が多いページでは、並びが元と変わる場合があります。抽出後に内容をご確認のうえ、必要なら編集して整えてください。

ページごとに区切って書き出せますか?

はい。「ページ区切りを入れる」にチェックを入れると、各ページの先頭に「----- ページ 2 -----」のような見出し行が挿入され、どこからどこまでが何ページ目か分かるようになります。チェックを外すと、区切りなしで全ページのテキストがつながって出力されます。

抽出した文字数を数えられますか?

抽出結果の上に文字数を表示しています。より詳しく行数や単語数まで確認したい場合は、テキストをコピーして文字数カウントツールに貼り付けると、まとめて確認できます。

PDFからテキストを取り出すときに知っておきたいこと

「PDFの文字がコピーできない」「選択しようとするとページ全体が選ばれてしまう」——こうした違いは、PDFが文字を持っているか、画像を持っているかで決まります。この記事では、テキストを取り出せるPDFと画像だけのPDFの違い、抽出したテキストの並びが崩れる理由、取り出せなかったときの対処法を整理します。

「文字を取り出せるPDF」と「画像だけのPDF」の違い

見た目が同じPDFでも、中身は大きく2種類に分かれます。

  • 文字情報を持つPDF:WordやExcel、Webページなどから作られたPDFです。文字が「文字」として埋め込まれているため、コピー・検索・テキスト抽出ができます。
  • 画像だけのPDF:紙をスキャンしたり、写真から作ったりしたPDFです。ページ全体が1枚の画像になっているため、見た目は文字でも中身は画像で、そのままでは文字を取り出せません。

このツールが対象にするのは前者です。PDFを開いて文字をなぞって選択できるなら、多くの場合テキストを取り出せます。ページ全体が四角く選択されてしまうときは、画像だけのPDFの可能性が高いです。

抽出したテキストの並びが崩れる理由

PDFは、紙に印刷したときの見た目を正確に再現するためのフォーマットです。そのため「この文字を、このページの、この座標に置く」という情報は細かく持っています。一方で、「ここからここまでが1つの段落」「これは表の3列目」といった文書の構造は、持っていないことがほとんどです。

テキストを抽出するときは、文字の座標を手がかりに並びを推測します。1段組みの素直な文書なら元どおりに近く取り出せますが、2段組みの資料では左右の段が交互に混ざったり、表では行と列の順序が入れ替わったりすることがあります。これは仕組み上どうしても起きるもので、抽出後に編集して整えるのが前提になります。

文字を取り出せなかったときの対処(画像化→OCR)

「文字を取り出せませんでした」と表示された場合は、画像だけのPDFです。この場合は、いったん画像に変換してから、画像の中の文字を読み取る流れに切り替えます。

OCRは画像から文字を推測する技術のため、印刷された文字なら実用的に読み取れますが、誤認識が混ざることがあります。読み取ったあとは必ず内容を確認してください。

抽出したテキストを使いやすく整える

取り出したテキストは、そのまま使うより少し整えると扱いやすくなります。

このツールの抽出結果はその場で編集できるので、コピー・ダウンロードの前に不要な行を消したり、順序を直したりしておくと、あとの作業がスムーズになります。