你的文件会留在你的设备上

文件在你的浏览器中处理,不会上传到我们的服务器。网站可能会下载处理引擎,并发送不含文件内容的使用或反馈事件。

我们如何处理你的数据

OCR PDF:生成可搜索的 PDF

识别扫描版 PDF,并添加简体中文、英语、西班牙语或俄语的可选中文本。限制:每个文件最多 10 页、10 MiB。 文件保留在浏览器中。

识别文件首次使用时约 26 MB,另加语言数据。

PDF · 不超过 10 MiB、10 页。文本不超过 1 MiB;可搜索的 PDF 不超过 30 MiB。

识别出的文本

试试示例

下载示例文件

语言选择“简体中文”。下载 PDF 后搜索“发票”、148.50、“发货”和 2048。两页外观应与示例一致,文本可以选中并复制。

预期结果

每页按顺序作为图片识别。提供英语、俄语和混合识别。OCR 可能误读字母、数字、列和表格:请检查结果。 将根据渲染的页面图片和不可见的文本层创建新的 PDF。保留可见的页面大小和旋转;不保留表单、链接、书签、附件和数字签名。已有文本会重新识别;图片质量受渲染分辨率限制。

每页渲染最多 4 百万像素。加载和每个处理步骤最长 90 秒;整个任务在 10 分钟后停止。空白页会在文本中标出。处理失败或未识别到文本时,不提供下载。

受保护的 PDF?请先用密码解锁。

首次运行可能需要下载转换器文件,需要稍等片刻。如果失败,请检查网络连接,或尝试更小的文件。“取消”会停止正在进行的处理;之后可以重新选择文件再试。

引擎许可证和源代码

实用指南

扫描件进,可搜索的 PDF 出

  1. 选择不超过 10 页、10 MiB 的扫描版 PDF。
  2. 选择简体中文、英语、西班牙语或俄语。
  3. 在生成的 PDF 中搜索一个已知的词,检查文字层。

试试这个示例

用简体中文识别一份 2 页的扫描发票;搜索发票号码,应能在生成的 PDF 中找到并高亮显示。

开始之前: 只支持简体中文、英语、西班牙语和俄语,限 10 页、10 MiB;扫描质量较低时,识别的准确度会下降。