扫描仪扫出来的 PDF、别人发来的图片型 PDF,打开后文字选不中、没法复制——这是因为里面其实是一张张图,没有文字层。这篇用 NBTools 的PDF 转文本工具讲清楚怎么对这类文件做文字识别(OCR),把图里的字变成可复制的文本。
先说结论:工具在浏览器本地运行识别引擎,支持中文简体 + 英文,识别结果可复制或下载;文件不上传服务器。
三种模式,先分清
工具提供了三种提取方式,按文件类型各取所需:
| 模式 | 适用文件 | 原理 |
|---|---|---|
| 快速提取 | 本身有文字层的 PDF | 直接读取内嵌文字,速度很快且不依赖识别 |
| 精确与表格 | 版式复杂 / 要抽表格 | 保留多栏、表格对齐,可导出 CSV |
| 扫描件 OCR | 图片型 / 扫描件 PDF | 把每页渲染成图,再用 Tesseract 识别文字 |
上传后工具会自动检测是否有文字层:有就停在「快速提取」,没有则自动切到「扫描件 OCR」,省去你判断。
扫描件 OCR 操作步骤
- 上传 PDF:点上传区或拖入,解析后显示文件名、页数与「是否检测到文字层」的提示。
- 切到扫描件 OCR:若无文字层会自动进入;也可手动点该模式标签。
- 选识别语言:中文简体 + 英文 / 仅中文简体 / 仅英文。
- 选渲染精度:标准 144 DPI / 推荐 180 DPI / 高精度 216 DPI(越准越慢)。
- 开始识别:点「开始扫描识别」,识别完可复制文本或下载 .txt / .md。
几个实用要点
- 首次识别要下载引擎:约 8MB 的识别引擎与语言包,首次识别时下载,之后走浏览器缓存,不必每次重下。
- 页面范围可挑:留空表示全部;也可一键选「前 5 页 / 奇数页 / 偶数页」,先小范围试识别效果。
- 加密 PDF:若文件有打开密码,输入密码本地解锁后再识别,密码不上传。
- 识别率有前提:对印刷体扫描件效果较好;手写体、严重歪斜或模糊的页面识别率有限,建议先预览确认。
常见问题
扫描件 / 图片型 PDF 能提取文字吗
能。切到「扫描件 OCR」模式即可。工具会把每页渲染成图片再用 Tesseract 识别;没有文字层的文件上传后会自动切到该模式。
手写的内容能识别吗
主要针对印刷体扫描件;手写体、严重歪斜或模糊的页面识别率有限,建议先选几页试识别、预览确认效果。
支持中文吗
支持。可选「中文简体 + 英文」「仅中文简体」或「仅英文」,按需切换。
第一次用为什么要下载东西
首次识别需下载约 8MB 的识别引擎与语言包,之后浏览器会缓存,后续识别更快,也不需要重新下载。
文件会上传吗
不需要联网,也不上传。所有渲染与识别都在浏览器本地完成,适合合同、发票等敏感 PDF。
OCR 和「快速提取」有什么不同
快速提取直接读取 PDF 内嵌的文字层,快且准;OCR 是针对「图片型 / 扫描件」没有文字层的文件,用识别引擎把图里的字读出来,本质不同。
相关工具
- NBTools PDF 转文本(含 OCR):https://nbtools.cn/tools/pdf-to-text
- PDF 转文字教程:文字型 / 扫描件都能提取
- PDF 提取页面:先挑要识别的几页
- PDF 转图片:把页面导出为图片再识别