文字与文档工具

PDF OCR 文字识别

在浏览器中识别图片扫描页并生成可搜索 PDF。已有嵌入文字的页面不会重复识别。

优先本地处理无需注册隐私说明 ↗
尚未选择文件

选择一个不超过 30 MB、25 页的本地 PDF。不支持受密码保护的文件。

扫描页按 144 DPI 渲染;每页最多 1,200 万像素,总计最多 8,000 万像素。

选择 PDF 以开始。

PDF 和 OCR 均在浏览器本地处理。需要时会从本站下载语言数据。

使用步骤

如何使用

  1. 选择一个不超过 30 MB、25 页的本地 PDF。
  2. 选择扫描页使用的语言并开始 OCR。
  3. 下载可搜索 PDF。文件仅在本设备处理,不会上传。

扫描页与已有文字

PDF.js 会检查每页是否含有嵌入文字。非空白字符达到 12 个的页面保留其原页面内容;没有文字层的页面会在本地渲染并执行 OCR,以避免在普通电子文档上叠加重复文字。

本地 OCR 与语言模型

Tesseract.js 在浏览器 WebAssembly worker 中运行。英文、简体中文、日文和韩文模型由本站托管,并按需下载。PDF 和识别出的文字不会发送到服务器。识别结果仅供参考,请人工校对。

限制与输出行为

仅支持一个不超过 30 MB、25 页的 PDF;扫描页按 144 DPI 渲染,每页最多 1,200 万像素,总计最多 8,000 万像素。OCR 页会变为以栅格图像为底、带可搜索文字层的页面;已有文字页按页面内容复制。如果同一页只有少量文字但还包含扫描图片,该页会按已有文字页处理。重建 PDF 时不保证保留表单、批注、签名、书签、附件和文档元数据。

常见问题

你可能还想知道

PDF 会上传吗?

不会。PDF 解析、页面渲染、OCR 和 PDF 创建都在浏览器本地运行;仅会从本站下载所选语言模型。

已有可选中文字的页面也会识别吗?

不会。为避免重复文字层,已有文字的页面会跳过 OCR;没有嵌入文字的页面才会识别。

一个文档可以识别多种语言吗?

请选择扫描页的主要语言。当前版本每份 PDF 只处理一种 OCR 语言,混合语言或误识别仍可能出现。

会完全保留原 PDF 吗?

不会。扫描页需要 OCR 时会重新组装 PDF。OCR 页以栅格图像为底;交互功能、签名、书签、附件和元数据不保证保留。请留存原文件。