ファイルは端末から出ません。仕組み
PDFをテキストに変換する方法
- 1上のエリアにPDFをドロップ(またはクリックして選択)します。
- 2「テキストを抽出」をクリックします。
- 3すべてのテキストが入った.txtファイルをダウンロードします。
よくある質問
- ファイルはどこかにアップロードされますか?
- いいえ。テキストはすべてブラウザ内で読み取られます — PDFは端末から一切外に出ません。
- 「テキストが見つかりません」と表示されるのはなぜですか?
- そのPDFはおそらくスキャン(ページの画像)で、テキストレイヤーがありません。まずOCR PDFに通してテキストレイヤーを追加してから抽出してください。
- レイアウトは保たれますか?
- 読み取り順と改行は保たれますが、段組み・表・正確な字間は保たれません — 整形された書類ではなく、きれいなプレーンテキストが得られます。
PDFから文字だけを取り出す
引用したり、検索したり、他のツールに読み込ませたり、別の文書に貼り付けたりするために、PDFの実際のテキストが必要になることがあります。PDF to Textは、ファイルのテキストレイヤーを読み取り、1行ずつプレーンな.txtファイルとして再構築します。処理はすべてブラウザ内で完結するため、機密文書であってもお使いのデバイスの外に出ることはありません。
テキストであってレイアウトではない
このツールは読み取り順序と改行を保持します。これはコピーして再利用する際に望ましい特性ですが、段組みや表、正確な位置関係を再現しようとはしません。得られる結果はすっきりとしたプレーンテキストです。ページ同士は空行で区切られます。
スキャンされたPDFの場合
スキャンされたPDFはテキストレイヤーを持たない一連のページ画像であるため、抽出できるものが何もありません。まずOCR PDFにかけてテキストを認識させてから、改めてこちらで抽出してください。
抽出処理の実際の仕組み
実テキストを含むPDFは、Word文書のように段落を保存しているわけではありません。ページ上の正確な座標に配置された個々のグリフと、それを文字コードへと結びつけるマッピングを保存しています。PDF to Textは、ページごとにそれらの位置情報付きグリフをたどり、座標をもとに行として再構成します。PDF形式そのものには「行」や「段落」という本当の概念がないにもかかわらず、読み取り順序が概ね正しくなるのはこのためです。
抽出がうまくいかないとき
まれに、壊れた、あるいは非標準のフォントエンコーディングでPDFが作成されていることがあります——ニッチなソフトウェアから書き出された古い文書によく見られる現象です——この場合、見た目は正常でもテキストが文字化けして出力されます。抽出処理の側でこれを修正する方法はありません。ファイル内部の文字マッピング自体に不備があるためです。新聞や学術論文のような複数段組みのレイアウトも、ツールが視覚的な段ではなく位置情報をもとに読み取るため、予期しない順序で混ざり合うことがあります。
よくある使い道
大きな文書全体を検索する、数値や条文をスプレッドシートに転記する、プレーンテキストしか受け付けない別のツールに文書を読み込ませる、スクリーンリーダーでコンテンツを読み上げ可能にするといった用途がよくあります。抽出したテキストではなくPDFそのもののアクセシビリティを高めたい場合は、文書から離れることなく実際のテキストレイヤーを追加するOCR PDFをご覧ください。