デバイス内で処理 — アップロードされません

PDF → テキスト変換

PDF の全テキストをきれいな .txt に — ブラウザ内で一瞬で抽出します。そして PDF が実はスキャンだった場合は、空のファイルを渡す代わりに正直にそう伝えます。

PDF をここにドロップ、またはクリックして選択 タップしてファイルを選択
PDF · ローカルでテキスト抽出 · アップロードなし

一瞬でテキストに — あるいは正直な「これはスキャンです」

PDF にテキストレイヤーがあれば — Word・ブラウザ・LaTeX・請求システムから書き出したものなら何でも — テキストは瞬時に抽出され、ページ上でそのままプレビューされ、クリップボードへのコピーも .txt としてのダウンロードもすぐできます。サーバーとの往復もサイズの心配もありません: 初回のみ約 5 MB のエンジンをダウンロードしたあとは、すべてあなたの端末上で動きます。

そして PDF にテキストレイヤーがない場合、このツールは正直に振る舞います: 0 バイトの .txt を渡して成功と呼ぶ代わりに、このファイルは OCR(文字認識)が必要なスキャンだと伝えます。混在した文書にはページ単位の正直さを: デジタルなファイルの中で 4 ページ目と 7 ページ目だけがスキャンなら、結果は正確にそう報告します。

よくある質問

「この PDF はスキャンです」と言われるのはなぜですか?
テキストレイヤーがないからです — ページが文字の写真であり、抽出できるものが存在しません。それには OCR(文字認識)という別の作業が必要です。空の .txt よりも、正直なメッセージのほうが役に立ちます。
書式は保持されますか?
読み順どおりのプレーンテキストとして抽出します — 見出し・表・レイアウトはシンプルな行になります。構造を保持したい場合は「PDF → Markdown 変換」がそのためのツールです。
出力に一部のページが欠けています — なぜですか?
ステータス行に、テキストレイヤーのないスキャンのページ番号が正確に表示されます。それ以外の部分は通常どおり抽出されます。スキャンのページには、先に OCR が必要です。

関連ツール