你的文件会留在你的设备上
文件在你的浏览器中处理,不会上传到我们的服务器。网站可能会下载处理引擎,并发送不含文件内容的使用或反馈事件。
我们如何处理你的数据PDF 转 HTML
把 PDF 的嵌入文字转成独立的、按页分隔的 HTML 文件,方便阅读。图片和原始版面不包含在结果中。
合成示例,运行前请检查操作设置。
你的文档会留在此设备上。工具下载和使用统计不包含文件内容。
本机限制: 单个文件的最大大小: 10 MB
文件在浏览器中处理,不会上传到本站。
实用指南
让文本视图与页面顺序保持关联
- 选择文字可被选择的 PDF。
- 导出 HTML,并在本地打开下载的文件。
- 把得到的各部分和措辞与源 PDF 比对。
试试这个示例
把一份可搜索的 5 页方案导出为 HTML。分享文字副本之前,核对第 1 页的摘要和第 5 页的联系方式是否出现在预期的部分。
之前
- 含文本的 PDF 页面
之后
- HTML 页面分节
开始之前: 这不是 PDF 渲染,也不是保留格式的转换;图片和原始版面都不会包含在内。
继续处理源 PDF获得的结果
把嵌入的文本导出为独立的 HTML 文档,每页一个分节。文本经过转义,不会作为 HTML 执行。不保留原始字体、图片、表格和版面;不含 OCR。限制:输入 10 MiB,200 页,输出 4 MiB。
限制与重要说明
输入最大 10 MiB,最多 200 页,输出文本最大 4 MiB。没有文本层的扫描文档会报错,而不会假装提取成功。阅读顺序、分栏和字体可能与可视版面不一致。这不是 OCR,也不是 PDF 转 Word。
示例
导出一份基于文本的报告,并在本地打开下载的 HTML。分节顺序与 PDF 页面顺序一致;空白页或扫描页会标明,而不会被悄悄当作已识别的文本。