这个工具会在浏览器中逐页读取 PDF,把可选择的文字整理成纯文本结果。你可以处理整份文件,也可以指定起始页与结束页,只提取需要的页面范围。
如果 PDF 只是扫描影像,文件内没有嵌入文字,输出结果可能会是空白。遇到这种情况时,请先把页面导出或截成图片,再用图片 OCR 获取识别文字。
关于这个主题的常见疑问与实用解答。
选择 PDF 后,工具会自动提取文件内已有的文字。保留“提取全部页面”即可处理整份文档,也可以输入起始页和结束页,只处理需要的范围。结果会保留每页对应的原始 PDF 页码。
除非 PDF 已经包含 OCR 文字层,否则无法提取。纯图片页面没有可供这个工具读取的嵌入文字,因此结果可能为空。请先将页面导出或截成图片,再用图片 OCR 识别文字。
可以。关闭“提取全部页面”,再输入需要的第一页和最后一页。工具会提取这段连续范围内的每一页,并在结果中保留原始页码;目前无法在同一次处理中合并多段不连续范围。
不会。输出是按 PDF 提供的顺序收集而成的纯文本,不会保留字体、图片、表格单元格、分栏或页面视觉排版,因此复杂的多栏文档可能会出现不同的文字顺序。
可以。搜索会检查所有已提取页面,并让你跳到包含结果的页面。你可以复制当前页面、复制全文,或将当前选择的“原文”或“整理后”版本下载为 TXT 文件。
“原文”会保留提取结果不变;“整理后”只会统一换行、移除行尾半角空格并缩减过多空白行。它不会改写文字、不使用 OCR 或 AI、不重建多栏排版,也不会转换为 Markdown,而且可以随时切回原文。