PDF を ODS に変換(テキスト transcript)
ページ別 transcript を検索・並べ替えできる ODS を作成します。PDF の表を認識・再構成する機能ではありません。
LOCAL TEXT TRANSCRIPT
PDF テキストを ODS に抽出
ページごとに 1 行を作成します。表認識ではなくテキスト transcript です。
埋め込みテキストのみを抽出します。スキャンページにはテキストなしと表示し、OCR は行いません。表、セル、列、数式、画像、読み順は認識しません。
PDF の解析と ODS 生成はブラウザー内で行われます。ファイルはアップロードされません。
使い方
使い方
- 50 MB・100 ページ以下の PDF を選択します。
- 既存テキストをページごとにローカル抽出します。
- ページ列とテキスト列を含む ODS をダウンロードします。スキャンページには注記し、OCR は行いません。
OpenDocument Spreadsheet ファイル
ODS は Page 列と Text transcript 列を持つ有効な OpenDocument Spreadsheet パッケージです。抽出テキストの検索や並べ替えに使えますが、表、セル、数式、レイアウトは認識しません。
埋め込みテキストのみ
PDF.js が取得できる順序でテキストオブジェクトを読み取ります。画像のみのページにはテキストなしと表示し、OCR は行いません。段組み、表、脚注、意味構造は再構築されません。
ローカル処理と上限
PDF 解析と表計算ファイル生成はブラウザー内で行われ、アップロードされません。1 ファイル 50 MB・100 ページ、抽出文字 2,500 万文字、出力 100 MB までです。
よくある質問
あわせて知りたいこと
PDF の表を認識しますか?
いいえ。ページごとに 1 行のテキストを出力します。表の行、列、数式、セルは認識しません。
スキャンページも読み取れますか?
いいえ。埋め込みテキストのみを読み取り、抽出できないページを示します。OCR はありません。
PDF はアップロードされますか?
いいえ。PDF の解析と ODS 生成はブラウザー内で行います。