PDF OCR(文字認識)
画像のみのスキャンページをブラウザー内で認識し、検索可能な PDF を作成します。既に埋め込みテキストがあるページは再認識しません。
使い方
使い方
- 30 MB・25 ページ以下のローカル PDF を選択します。
- スキャンの言語を選び、OCR を開始します。
- 検索可能な PDF をダウンロードします。ファイルはこの端末内で処理され、アップロードされません。
スキャンページと既存テキスト
PDF.js が各ページの埋め込みテキストを確認します。空白以外の文字が 12 文字以上あるページは元のページ内容を保持し、テキスト層がないページだけをローカルでレンダリングして OCR します。通常の電子文書への重複テキスト追加を防ぎます。
ローカル OCR と言語モデル
Tesseract.js はブラウザーの WebAssembly worker で動作します。英語、簡体字中国語、日本語、韓国語モデルは本サイトから必要時にダウンロードされます。PDF と認識テキストはサーバーへ送信されません。結果は近似値のため確認してください。
制限と出力
PDF 1 件、30 MB・25 ページ以下。スキャンページは 144 DPI でレンダリングし、1 ページ 1,200 万ピクセル、合計 8,000 万ピクセルまでです。OCR ページは画像を背景とする検索可能ページになります。既存テキストページはページ内容としてコピーします。少量のテキストとスキャン画像が混在するページは既存テキストページとして扱います。フォーム、注釈、署名、しおり、添付ファイル、メタデータの保持は保証しません。
よくある質問
あわせて知りたいこと
PDF はアップロードされますか?
いいえ。PDF の解析、レンダリング、OCR、PDF 作成はブラウザー内で行います。選択した言語モデルのみ本サイトからダウンロードします。
選択可能なテキストがあるページも OCR しますか?
いいえ。重複テキストを防ぐため既存テキストページはコピーし、埋め込みテキストのないページだけ OCR します。
複数言語を認識できますか?
スキャンページの主な言語を選択してください。現バージョンは PDF ごとに 1 言語です。混在言語や認識誤りが起きる場合があります。
元の PDF を完全に保持しますか?
いいえ。OCR が必要なページがある場合、新しい PDF を作成します。OCR ページは画像を背景とし、フォーム、署名、しおり、添付ファイル、メタデータの保持は保証されません。元ファイルを保管してください。