OCR для PDF
Распознайте текст в отсканированном PDF и получите файл, в котором можно искать.
OCR для PDF работает на вашем устройстве, поэтому отсканированные дела и архивы остаются у вас. Скачиваются только языковые данные, один раз, и кешируются браузером.
Преобразовать результат в Word
Об инструменте OCR для PDF
Отсканированный PDF — это фотография документа. Вы его прочитаете, а больше никто: поиск ничего не находит, копирование ничего не даёт, и любой инструмент, работающий с текстом, остаётся ни с чем. Распознавание текста это исправляет: оно читает форму букв и записывает найденное обратно в файл невидимым слоем, лежащим ровно поверх напечатанных слов. Страница выглядит точно так же — скан не тронут, — но документ теперь доступен поиску, выделению и преобразованию. Распознавание работает в вашем браузере на любом из двенадцати языков.
Возможности
- Распознавание работает в вашем браузере — страницы никуда не загружаются
- Двенадцать языков, включая хинди, русский, китайский, японский и арабский
- Невидимый текстовый слой ложится поверх нетронутого исходного скана
- Два качества сканирования: скорость против точности на мелком шрифте
- Кроме PDF с поиском, доступен вывод обычного текста
- Прогресс по страницам и остановка для длинных документов
- Языковые данные скачиваются один раз и кешируются браузером
Как использовать OCR для PDF
- Перетащите отсканированный PDF на страницу
- Выберите язык, напечатанный на странице, и качество сканирования
- Запустите распознавание и следите за продвижением по страницам
- Скачайте PDF с поиском или только распознанный текст
Пример
Ввод
1987-minutes.pdf — 8 scanned pages, typewritten English
Результат
1987-minutes-searchable.pdf — same images, now with selectable text behind them.
Видимая страница не меняется; меняется то, что слова теперь есть в файле.
Частые ошибки и устранение неполадок
- Распознанный текст полон ошибок. — Распознавание зависит от скана. Попробуйте более высокое качество и проверьте, что язык совпадает со страницей: английские данные на немецкой странице дают ровно такой результат.
- Распознавание идёт очень медленно. — Это по-настоящему тяжёлая работа, и она выполняется на вашем процессоре, а не на сервере. Возьмите быстрое качество и делите длинные документы.
- Двуязычный документ распознаётся плохо. — За один проход используется один язык. Разделите документ по языкам, распознайте части и объедините результаты.
- Рукописный текст не распознан. — Здесь распознаётся печатный и машинописный текст. Рукописи нужна модель совсем другого класса.
Часто задаваемые вопросы
- Заменяет ли распознанный текст скан?
- Нет. Изображение остаётся ровно таким же, а текст добавляется за ним, невидимо. Именно поэтому PDF с поиском выглядит как оригинал.
- Загружаются ли мои отсканированные страницы для распознавания?
- Нет. Движок распознавания работает в вашем браузере. Скачиваются только языковые данные, один раз, и дальше их кеширует браузер.
- Сколько страниц можно распознать за раз?
- До тридцати за проход: распознавание достаточно медленное, чтобы длинные документы удобнее было обрабатывать партиями.
- Какое качество выбрать?
- Начните с быстрого. Переходите к высокому, когда шрифт мелкий, скан старый или первая попытка вышла неряшливой.
- Можно ли применить OCR к PDF, где текст уже есть?
- Можно, но смысла нет: сначала попробуйте выделить слово. Если текст уже там, преобразуйте документ напрямую.
Связанные инструменты
- PDF в текст — Извлекайте выделяемый текст из PDF в виде обычного текста или Markdown.
- Сканирование в PDF — Использует камеру как сканер и сохраняет страницы в PDF.
- PDF в Word — Пересобирает PDF в редактируемый документ .docx.
- PDF в Excel — Извлекает таблицы из PDF в книгу .xlsx или CSV.
- PDF в HTML — Преобразует PDF в чистый индексируемый HTML.
- Сжать PDF — Уменьшайте PDF, перерисовывая каждую страницу в JPEG с выбранным качеством и разрешением.
- Краткое изложение PDF — Излагает длинный PDF по разделам на вашем устройстве.
Все инструменты ArrayKit