扫描件 PDF 怎么提取文字?图片型 PDF 也能 OCR

扫描的合同、发票、书籍没法选中文字?用 PDF 文字识别(OCR)把图里的字读出来

扫描仪扫出来的 PDF、别人发来的图片型 PDF,打开后文字选不中、没法复制——这是因为里面其实是一张张图,没有文字层。这篇用 NBTools 的PDF 转文本工具讲清楚怎么对这类文件做文字识别(OCR),把图里的字变成可复制的文本。

先说结论:工具在浏览器本地运行识别引擎,支持中文简体 + 英文,识别结果可复制或下载;文件不上传服务器

三种模式,先分清

工具提供了三种提取方式,按文件类型各取所需:

模式适用文件原理
快速提取本身有文字层的 PDF直接读取内嵌文字,速度很快且不依赖识别
精确与表格版式复杂 / 要抽表格保留多栏、表格对齐,可导出 CSV
扫描件 OCR图片型 / 扫描件 PDF把每页渲染成图,再用 Tesseract 识别文字

上传后工具会自动检测是否有文字层:有就停在「快速提取」,没有则自动切到「扫描件 OCR」,省去你判断。

扫描件 OCR 操作步骤

  1. 上传 PDF:点上传区或拖入,解析后显示文件名、页数与「是否检测到文字层」的提示。
  2. 切到扫描件 OCR:若无文字层会自动进入;也可手动点该模式标签。
  3. 选识别语言:中文简体 + 英文 / 仅中文简体 / 仅英文。
  4. 选渲染精度:标准 144 DPI / 推荐 180 DPI / 高精度 216 DPI(越准越慢)。
  5. 开始识别:点「开始扫描识别」,识别完可复制文本下载 .txt / .md

几个实用要点

  • 首次识别要下载引擎:约 8MB 的识别引擎与语言包,首次识别时下载,之后走浏览器缓存,不必每次重下。
  • 页面范围可挑:留空表示全部;也可一键选「前 5 页 / 奇数页 / 偶数页」,先小范围试识别效果。
  • 加密 PDF:若文件有打开密码,输入密码本地解锁后再识别,密码不上传。
  • 识别率有前提:对印刷体扫描件效果较好;手写体、严重歪斜或模糊的页面识别率有限,建议先预览确认。

常见问题

扫描件 / 图片型 PDF 能提取文字吗

能。切到「扫描件 OCR」模式即可。工具会把每页渲染成图片再用 Tesseract 识别;没有文字层的文件上传后会自动切到该模式。

手写的内容能识别吗

主要针对印刷体扫描件;手写体、严重歪斜或模糊的页面识别率有限,建议先选几页试识别、预览确认效果。

支持中文吗

支持。可选「中文简体 + 英文」「仅中文简体」或「仅英文」,按需切换。

第一次用为什么要下载东西

首次识别需下载约 8MB 的识别引擎与语言包,之后浏览器会缓存,后续识别更快,也不需要重新下载。

文件会上传吗

不需要联网,也不上传。所有渲染与识别都在浏览器本地完成,适合合同、发票等敏感 PDF。

OCR 和「快速提取」有什么不同

快速提取直接读取 PDF 内嵌的文字层,快且准;OCR 是针对「图片型 / 扫描件」没有文字层的文件,用识别引擎把图里的字读出来,本质不同。

相关工具

作者:NBTools · 更新于 2026年9月24日 · 阅读约 5 分钟