PDF 转文字怎么转?文字型和扫描件都能提取

提取文本成 TXT/Markdown、扫描件 OCR、表格导出 CSV,本地不上传

PDF 里的内容想拿出来编辑、搜索或做数据统计,最头疼的是它「看着是字、选中却是图」。NBTools 的PDF 转文本工具在浏览器本地把 PDF 解析成文字:文字型 PDF 直接读文字层;扫描件(图片型)用 OCR 识别;表格还能单独导出成 CSV。文件始终不上传服务器。

先说结论:工具提供三种模式——快速提取(文字型 PDF)、精确与表格(保留排版结构、导出 CSV)、扫描件 OCR(识别印刷体图片)。根据 PDF 有没有文字层自动判断该用哪种。

第一步:选文件并看一眼检测结果

点上传区或把 .pdf 文件拖进去。工具先解析 PDF,告诉你共多少页、有没有文字层:

  • 检测到文字层 → 提示「可直接提取文本」,默认停在快速提取模式;
  • 前几页没文字层 → 提示「看起来是扫描件 / 图片型 PDF」,自动切到扫描件 OCR 模式。

加密的 PDF 会弹出密码框,在本地用你输入的密码解密后重试;密码与文件都不会上传,工具也不提供「找回 / 破解」密码功能。

第二步:选模式与页面范围

三种模式覆盖不同场景(见下表),可用顶部标签切换:

模式适合什么引擎能导出
快速提取文字型 PDF,要正文文字pdf.js 读文字层TXT / Markdown
精确与表格多栏、表格、要按结构或关键词搜pdfplumber 解析结构TXT / CSV / TSV
扫描件 OCR图片型扫描件,无文字层pdf.js 渲染 + TesseractTXT

页面范围三种模式共用:留空表示全部,如填 1-3,5,8 表示第 1–3、5、8 页;还有「全部 / 前 5 页 / 奇数页 / 偶数页」快捷按钮。

第三步:按模式微调并提取

快速提取(文字型 PDF)

两个开关:勾选「自动识别双栏排版」会按先左栏后右栏的顺序拼文字,避免两栏内容交错;勾选「在每页前插入页码分隔标记」方便后续对照原页。点「开始提取文本」,结果可直接复制、下载 .txt.md

精确与表格

勾选「尽量保留原始排版」可保留多栏 / 表格对齐;还能在框里填正则或关键词做全文搜索(比如 发票号码|¥\s?\d+),命中结果带页码与坐标。点「识别表格并导出 CSV」会把识别到的表格导出为 CSV(也支持 TSV)。

扫描件 OCR

选识别语言(中文简体 + 英文 / 仅中文简体 / 仅英文)和渲染精度(标准 144 DPI / 推荐 180 DPI / 高精度 216 DPI,越准越慢)。首次识别需下载约 8MB 的识别引擎与语言包,之后走浏览器缓存;主要面向印刷体扫描件,手写体或严重歪斜的识别率有限。

提取后要注意什么

文字型 PDF 提取的是内嵌文字层,顺序和正文基本一致;双栏排版记得开「自动识别双栏」。扫描件 OCR 受印刷质量影响,识别完建议通读一遍错别字。表格导出 CSV 后,双栏正文有时会被兜底判定成一张宽表,下载前先看预览确认。

常见问题

PDF 转文字后格式会乱吗

文字型 PDF 读的是文字层,文字与顺序基本保留;双栏可勾选自动识别先左后右;精确模式能保留多栏 / 表格对齐结构。但跨页表格、文本框等复杂元素可能仍需核对。

扫描件(图片型 PDF)能提取文字吗

能。切到扫描件 OCR 模式,用 Tesseract 识别印刷体,支持中文简体 + 英文等组合。首次需下载约 8MB 引擎与语言包,之后走浏览器缓存;手写体或严重歪斜识别率有限。

转换需要联网吗?文件会上传吗

不需要联网,也不上传。PDF 解析、渲染与 OCR 都在浏览器本地完成,适合合同、简历等敏感文档。

能把表格提取成 Excel 吗

精确与表格模式可把表格识别并导出为 CSV / TSV,用 Excel 或表格软件打开即可继续编辑;工具不直接生成 .xlsx。

加密的 PDF 怎么处理

工具会在本地用你输入的打开密码解密后重试;密码与文件都不上传,也不提供找回或破解密码功能。

能按关键词搜索内容吗

可以。精确与表格模式支持正则或纯文本全文搜索,结果会标出页码与坐标位置,方便定位。

能直接转成 Word 吗

工具导出 TXT / Markdown,不直接转 Word;拿到文字后可在文字编辑器里重新排版,或用站内的 Word 相关工具处理。

手机上能用吗

可以。网页版在手机浏览器打开即可上传、提取、下载,流程与电脑一致。

相关工具

作者:NBTools · 更新于 2026年9月14日 · 阅读约 6 分钟