PDF 里的内容想拿出来编辑、搜索或做数据统计,最头疼的是它「看着是字、选中却是图」。NBTools 的PDF 转文本工具在浏览器本地把 PDF 解析成文字:文字型 PDF 直接读文字层;扫描件(图片型)用 OCR 识别;表格还能单独导出成 CSV。文件始终不上传服务器。
先说结论:工具提供三种模式——快速提取(文字型 PDF)、精确与表格(保留排版结构、导出 CSV)、扫描件 OCR(识别印刷体图片)。根据 PDF 有没有文字层自动判断该用哪种。
第一步:选文件并看一眼检测结果
点上传区或把 .pdf 文件拖进去。工具先解析 PDF,告诉你共多少页、有没有文字层:
- 检测到文字层 → 提示「可直接提取文本」,默认停在快速提取模式;
- 前几页没文字层 → 提示「看起来是扫描件 / 图片型 PDF」,自动切到扫描件 OCR 模式。
加密的 PDF 会弹出密码框,在本地用你输入的密码解密后重试;密码与文件都不会上传,工具也不提供「找回 / 破解」密码功能。
第二步:选模式与页面范围
三种模式覆盖不同场景(见下表),可用顶部标签切换:
| 模式 | 适合什么 | 引擎 | 能导出 |
|---|---|---|---|
| 快速提取 | 文字型 PDF,要正文文字 | pdf.js 读文字层 | TXT / Markdown |
| 精确与表格 | 多栏、表格、要按结构或关键词搜 | pdfplumber 解析结构 | TXT / CSV / TSV |
| 扫描件 OCR | 图片型扫描件,无文字层 | pdf.js 渲染 + Tesseract | TXT |
页面范围三种模式共用:留空表示全部,如填 1-3,5,8 表示第 1–3、5、8 页;还有「全部 / 前 5 页 / 奇数页 / 偶数页」快捷按钮。
第三步:按模式微调并提取
快速提取(文字型 PDF)
两个开关:勾选「自动识别双栏排版」会按先左栏后右栏的顺序拼文字,避免两栏内容交错;勾选「在每页前插入页码分隔标记」方便后续对照原页。点「开始提取文本」,结果可直接复制、下载 .txt 或 .md。
精确与表格
勾选「尽量保留原始排版」可保留多栏 / 表格对齐;还能在框里填正则或关键词做全文搜索(比如 发票号码|¥\s?\d+),命中结果带页码与坐标。点「识别表格并导出 CSV」会把识别到的表格导出为 CSV(也支持 TSV)。
扫描件 OCR
选识别语言(中文简体 + 英文 / 仅中文简体 / 仅英文)和渲染精度(标准 144 DPI / 推荐 180 DPI / 高精度 216 DPI,越准越慢)。首次识别需下载约 8MB 的识别引擎与语言包,之后走浏览器缓存;主要面向印刷体扫描件,手写体或严重歪斜的识别率有限。
提取后要注意什么
文字型 PDF 提取的是内嵌文字层,顺序和正文基本一致;双栏排版记得开「自动识别双栏」。扫描件 OCR 受印刷质量影响,识别完建议通读一遍错别字。表格导出 CSV 后,双栏正文有时会被兜底判定成一张宽表,下载前先看预览确认。
常见问题
PDF 转文字后格式会乱吗
文字型 PDF 读的是文字层,文字与顺序基本保留;双栏可勾选自动识别先左后右;精确模式能保留多栏 / 表格对齐结构。但跨页表格、文本框等复杂元素可能仍需核对。
扫描件(图片型 PDF)能提取文字吗
能。切到扫描件 OCR 模式,用 Tesseract 识别印刷体,支持中文简体 + 英文等组合。首次需下载约 8MB 引擎与语言包,之后走浏览器缓存;手写体或严重歪斜识别率有限。
转换需要联网吗?文件会上传吗
不需要联网,也不上传。PDF 解析、渲染与 OCR 都在浏览器本地完成,适合合同、简历等敏感文档。
能把表格提取成 Excel 吗
精确与表格模式可把表格识别并导出为 CSV / TSV,用 Excel 或表格软件打开即可继续编辑;工具不直接生成 .xlsx。
加密的 PDF 怎么处理
工具会在本地用你输入的打开密码解密后重试;密码与文件都不上传,也不提供找回或破解密码功能。
能按关键词搜索内容吗
可以。精确与表格模式支持正则或纯文本全文搜索,结果会标出页码与坐标位置,方便定位。
能直接转成 Word 吗
工具导出 TXT / Markdown,不直接转 Word;拿到文字后可在文字编辑器里重新排版,或用站内的 Word 相关工具处理。
手机上能用吗
可以。网页版在手机浏览器打开即可上传、提取、下载,流程与电脑一致。
相关工具
- NBTools PDF 转文本:https://nbtools.cn/tools/pdf-to-text
- PDF 转图片:把每页导出为 JPG/PNG
- 从 PDF 提取图片:批量导出内嵌图
- 合并 PDF:多份 PDF 拼一起