你的文件会留在你的设备上
文件在你的浏览器中处理,不会上传到我们的服务器。网站可能会下载处理引擎,并发送不含文件内容的使用或反馈事件。
我们如何处理你的数据PDF 转 Markdown
把可搜索的 PDF 转为 Markdown 文本副本,同时保留按源页面分组。现有文字按原样导出,不重建版面。
合成示例,运行前请检查操作设置。
你的文档会留在此设备上。工具下载和使用统计不包含文件内容。
本机限制: 单个文件的最大大小: 10 MB
文件在浏览器中处理,不会上传到本站。
实用指南
提取的文字保留页面上下文
- 选择含有现有文本层的 PDF。
- 导出为 Markdown,并检查每个页面部分。
- 只使用已经与原始 PDF 核对过的文字。
试试这个示例
把一份可搜索的 3 页客户简报转换为 Markdown。核对所需的日期和两项行动事项,是否与 PDF 中一样位于同一个源页面标题之下。
之前
- PDF:Hello
之后
- 页面标题 + 原样文本块
示例 .md 文件
## Page 1
来自 PDF 的问候,王芳!可选中的源文本:来自 PDF 的问候,王芳!
开始之前: 这会把现有文字导出为原样的代码块,不会把 PDF 转换成可编辑的版面。
继续处理源 PDF获得的结果
把嵌入的文本按页分组,导出为原样的 Markdown 代码块。不会重建标题、表格、图片或原始版面。没有文本的页面会标明;不含 OCR。限制:输入 10 MiB,200 页,输出 4 MiB。
限制与重要说明
输入最大 10 MiB,最多 200 页,输出文本最大 4 MiB。没有文本层的扫描文档会报错,而不会假装提取成功。阅读顺序、分栏和字体可能与可视版面不一致。这不是 OCR,也不是 PDF 转 Word。
示例
把可选中的报告文本导出为 .md。页面标题会自动生成;PDF 文本在代码块中保持原样,不会变成可执行的 HTML,也不会被推断为表格。再次使用之前,请先检查阅读顺序。