テキストと文書ツール

PDF OCR(文字認識)

画像のみのスキャンページをブラウザー内で認識し、検索可能な PDF を作成します。既に埋め込みテキストがあるページは再認識しません。

ブラウザ内で処理登録不要プライバシーの説明 ↗
ファイルが選択されていません

30 MB・25 ページ以下のローカル PDF を 1 件選択します。パスワード保護されたファイルには対応していません。

スキャンページは 144 DPI でレンダリングします。1 ページ 1,200 万ピクセル、合計 8,000 万ピクセルまでです。

PDF を選択してください。

PDF と OCR はブラウザー内で処理されます。言語データは必要時に本サイトからダウンロードされます。

使い方

使い方

  1. 30 MB・25 ページ以下のローカル PDF を選択します。
  2. スキャンの言語を選び、OCR を開始します。
  3. 検索可能な PDF をダウンロードします。ファイルはこの端末内で処理され、アップロードされません。

スキャンページと既存テキスト

PDF.js が各ページの埋め込みテキストを確認します。空白以外の文字が 12 文字以上あるページは元のページ内容を保持し、テキスト層がないページだけをローカルでレンダリングして OCR します。通常の電子文書への重複テキスト追加を防ぎます。

ローカル OCR と言語モデル

Tesseract.js はブラウザーの WebAssembly worker で動作します。英語、簡体字中国語、日本語、韓国語モデルは本サイトから必要時にダウンロードされます。PDF と認識テキストはサーバーへ送信されません。結果は近似値のため確認してください。

制限と出力

PDF 1 件、30 MB・25 ページ以下。スキャンページは 144 DPI でレンダリングし、1 ページ 1,200 万ピクセル、合計 8,000 万ピクセルまでです。OCR ページは画像を背景とする検索可能ページになります。既存テキストページはページ内容としてコピーします。少量のテキストとスキャン画像が混在するページは既存テキストページとして扱います。フォーム、注釈、署名、しおり、添付ファイル、メタデータの保持は保証しません。

よくある質問

あわせて知りたいこと

PDF はアップロードされますか?

いいえ。PDF の解析、レンダリング、OCR、PDF 作成はブラウザー内で行います。選択した言語モデルのみ本サイトからダウンロードします。

選択可能なテキストがあるページも OCR しますか?

いいえ。重複テキストを防ぐため既存テキストページはコピーし、埋め込みテキストのないページだけ OCR します。

複数言語を認識できますか?

スキャンページの主な言語を選択してください。現バージョンは PDF ごとに 1 言語です。混在言語や認識誤りが起きる場合があります。

元の PDF を完全に保持しますか?

いいえ。OCR が必要なページがある場合、新しい PDF を作成します。OCR ページは画像を背景とし、フォーム、署名、しおり、添付ファイル、メタデータの保持は保証されません。元ファイルを保管してください。