OCR для PDF

Распознайте текст в отсканированном PDF и получите файл, в котором можно искать.

OCR для PDF работает на вашем устройстве, поэтому отсканированные дела и архивы остаются у вас. Скачиваются только языковые данные, один раз, и кешируются браузером.

Преобразовать результат в Word

Об инструменте OCR для PDF

Отсканированный PDF — это фотография документа. Вы его прочитаете, а больше никто: поиск ничего не находит, копирование ничего не даёт, и любой инструмент, работающий с текстом, остаётся ни с чем. Распознавание текста это исправляет: оно читает форму букв и записывает найденное обратно в файл невидимым слоем, лежащим ровно поверх напечатанных слов. Страница выглядит точно так же — скан не тронут, — но документ теперь доступен поиску, выделению и преобразованию. Распознавание работает в вашем браузере на любом из двенадцати языков.

Возможности

Как использовать OCR для PDF

  1. Перетащите отсканированный PDF на страницу
  2. Выберите язык, напечатанный на странице, и качество сканирования
  3. Запустите распознавание и следите за продвижением по страницам
  4. Скачайте PDF с поиском или только распознанный текст

Пример

Ввод

1987-minutes.pdf — 8 scanned pages, typewritten English

Результат

1987-minutes-searchable.pdf — same images, now with selectable text behind them.

Видимая страница не меняется; меняется то, что слова теперь есть в файле.

Частые ошибки и устранение неполадок

Часто задаваемые вопросы

Заменяет ли распознанный текст скан?
Нет. Изображение остаётся ровно таким же, а текст добавляется за ним, невидимо. Именно поэтому PDF с поиском выглядит как оригинал.
Загружаются ли мои отсканированные страницы для распознавания?
Нет. Движок распознавания работает в вашем браузере. Скачиваются только языковые данные, один раз, и дальше их кеширует браузер.
Сколько страниц можно распознать за раз?
До тридцати за проход: распознавание достаточно медленное, чтобы длинные документы удобнее было обрабатывать партиями.
Какое качество выбрать?
Начните с быстрого. Переходите к высокому, когда шрифт мелкий, скан старый или первая попытка вышла неряшливой.
Можно ли применить OCR к PDF, где текст уже есть?
Можно, но смысла нет: сначала попробуйте выделить слово. Если текст уже там, преобразуйте документ напрямую.

Связанные инструменты

Все инструменты ArrayKit