PDF с поиском по тексту
Распознайте сканированный PDF и добавьте выделяемый текст на английском, испанском или русском. Ограничения: до 10 страниц и 10 МиБ на файл. Файлы остаются в браузере.
Файлы распознавания ≈ 26 МБ при первом использовании, плюс языковые данные.
Распознанный текст
Инструмент был полезен?
Проверить на примере
Скачать примерВыберите язык «Русский». Скачайте PDF и найдите СЧЁТ, 148,50, Пётр Иванов, ДОСТАВКА и 2048. Обе страницы должны выглядеть как в примере, а текст должен выделяться и копироваться.
Какой будет результат
Страницы по порядку распознаются как изображения. Доступны английский, русский и смешанный режим. OCR может ошибаться в буквах, числах, столбцах и таблицах: проверяйте результат. Создаётся новый PDF из изображений страниц и невидимого текстового слоя. Размер и поворот страниц сохраняются; формы, ссылки, закладки, вложения и цифровые подписи — нет. Существующий текст распознаётся заново; качество ограничено разрешением отрисовки.
Каждая страница отрисовывается до 4 мегапикселей. Загрузка и отдельный этап ограничены 90 секундами, всё задание — 10 минутами. Пустые страницы отмечаются в тексте. При ошибке или отсутствии распознанного текста файл не предлагается для скачивания.
PDF защищён?Сначала разблокируйте его известным паролем.
При первом запуске могут загрузиться файлы конвертера. Если произошёл сбой, проверьте соединение или выберите меньший файл. Отмена останавливает обработку; затем можно выбрать другой файл и повторить.
Лицензии и исходный код движков
Практическое руководство
Скан на входе — PDF с поиском на выходе.
- Выберите сканированный PDF не более чем на 10 страниц и 10 МиБ.
- Выберите английский, испанский или русский.
- Найдите в получившемся PDF знакомое слово, чтобы проверить текстовый слой.
Проверить на этом примере
Распознайте сканированный счёт на 2 страницы на английском: поиск номера счёта в получившемся PDF должен находить его с подсветкой.
Прежде чем начать: Поддерживаются только английский, испанский и русский, в пределах 10 страниц и 10 МиБ; точность распознавания падает на сканах низкого качества.