选择文字型PDF
支持未加密、50MB以内的PDF。
从文字型PDF的全部或指定页面提取可复制文字,可加入页码分隔并下载TXT。文档只在当前浏览器处理;扫描件需要OCR。
支持未加密、50MB以内的PDF。
留空提取全部,也可填写1,3,5-8。
先核对阅读顺序,再复制或保存UTF-8文件。
如果PDF阅读器中能用鼠标选中文字,通常可以快速提取为纯文本。
扫描件没有文字层时,本工具不会猜测内容,也不会把空结果冒充识别成功。
多栏、表格、脚注和竖排内容的阅读顺序可能变化,重要引用请对照原PDF核验。
Mozilla 的 PDF.js 官方API提供 getTextContent(),返回页面中的文字项、方向、位置变换与换行提示。本站在浏览器中逐页读取这些文字项,再整理为可复制的纯文本。
这不是OCR:页面只有扫描图片、文字已转轮廓或字体编码异常时,文字层可能为空或顺序不完整。工具会明确提示空白页面和使用边界,不承诺恢复原版式。
PDF.js:PDFPageProxy.getTextContent ↗PDF.js:TextContent与TextItem ↗
PDF字节、提取文字与生成TXT都只存在于当前浏览器标签页。本站不上传文档、不保存文字、不建立资料库,也不调用云端OCR。
不会。PDF读取、页码选择、文字层提取、复制和TXT生成都在当前浏览器中完成,本站服务器不会收到文档内容。刷新或关闭标签页后,临时结果会被释放。
不能直接提取。此工具只读取PDF内部已有的文字层,不做OCR。若整页只是扫描图片,结果会为空;可先用PDF转PNG导出页面,再交给可信的OCR工具识别。
有些PDF把文字转成路径轮廓、使用异常字体编码,或只保存了页面图片,视觉上像文字但没有可读取文字层。这些情况通常需要OCR或原始编辑文件。
不会完整保留。工具按PDF提供的文字项与换行提示生成纯文本,适合复制、检索和继续编辑;多栏、表格、脚注、竖排文字和复杂阅读顺序可能需要手动整理。
可以。填写1,3,5-8等页码或范围;留空表示全部。一次最多处理200页,超长文档建议分批提取,便于核对和控制浏览器内存。
本站使用UTF-8编码并写入兼容标记,现代记事本、Office和代码编辑器通常能正确识别中文。若旧软件仍乱码,请在打开时手动选择UTF-8。
页码标记能帮助你核对引用来自PDF的哪一页。若只需要连续文字,可取消“页码分隔”,再重新提取。
暂不支持,也不会要求你把PDF密码提交给本站。请由文件所有者先在可信软件中解除保护,再处理可正常打开的副本。