PDF文字起こし(OCR)
スキャン済みPDFに実際のテキストレイヤーを追加し、テキストを検索・選択・コピーできるようにします。認識は完全にあなたのデバイスで実行され、文書を離れません。
- アップロードなし
- ローカル実行
- 登録なし
このセッションでアップロードされたファイルデータ: 0 B
ファイルはブラウザ内でローカルに処理されます。何もアップロードされません。
PDFをOCR処理する方法
- スキャン済みPDFをアップロード領域にドラッグするか、クリックして選択してください(最大100MB)。
- 認識品質を選択します。標準(200 DPI)がほとんどの文書に適切です。小さい文字(300 DPI)は活字が細かい時に役立ち、高速(150 DPI)が最速です。
- 「PDFをOCR」をクリック。初回のみ認識エンジンをダウンロードし、以降は即座に始まります。
- 検索可能なPDFをダウンロード。同じページに今度は実際のテキストレイヤーがあります。抽出されたテキストのみも受け取れます。
機微なスキャンをどこにも送らずOCR処理
スキャン文書はしばしば機微な部類です。署名済み契約書、医療記録、身分証のコピー、古い手紙などがそうです。多くのオンラインOCRサービスはまずアップロードを求めます。DofuPDFは代わりにブラウザタブの中でTesseract — WebAssemblyにコンパイルされた認識エンジン — を実行します。文書はあなたのコンピュータで読まれ、処理され、1バイトたりともネットワークを経由しません。動作中はブラウザのネットワークパネルで自分で確認できます。作業を走らせるサーバーがないため、ページ割り当てや1日上限もありません。唯一の上限はあなたのデバイスが決めます。
よくある質問
どの言語を認識できますか?
日本語と英語を一緒に認識します。 両言語の学習データが組み込まれており、追加設定なしで即使えます。
すでにテキストのあるPDFでも動きますか?
このツールはテキストレイヤーのないスキャン画像用のものです。 PDFにすでに選択可能なテキストがあればOCRは不要です。「PDFをMarkdownに」ツールがテキストを直接抽出できます。
初回だけ時間がかかるのはなぜ?
最初の認識時にOCRエンジンと言語データ(約7MB)をダウンロードします。 どちらも以降はデバイスにキャッシュされるので、2回目以降は即座に始まり、オフラインでも動きます。
OCRのために文書はアップロードされますか?
いいえ。 認識は完全にブラウザ内、あなたのプロセッサで実行されます。どのサーバーにも送信されません。動作中、上のアップロードデータカウンタは0のままです。
使用制限はありますか?
いいえ。 すべてのツールは無制限で無料です。1日の上限も、割り当ても、登録もありません。作業をするのはユーザーのデバイスなので、転嫁すべきサーバーコストがありません。ブラウザの安定性のため、ツールごとに余裕のあるファイルサイズの上限(ツールにより50〜150 MB)を設けていますが、日常の文書には十分すぎる大きさです。
DofuPDFはブラウザベースの無料PDFツール集です。既存のオンラインPDFツールとは異なり、DofuPDFはWebAssemblyを使ってすべてのファイルをユーザーのデバイス内でローカルに処理するため、ファイルがどのサーバーにもアップロードされません。ツールはアカウントもメールも登録も不要で、使用制限のない完全無料です。こうした特長により、DofuPDFは契約書、医療記録、財務明細といった機密文書に適しています。