PDF в Word
Пересоберите PDF в .docx, который действительно можно править, с распознанными заголовками.
Чтение документа и запись .docx при преобразовании PDF в Word целиком идут на вашем устройстве. Договоры и отчёты не загружаются.
Сначала распознать текст в скане
Об инструменте PDF в Word
PDF хранит, где стоит каждый кусочек текста, а не что он значит. Вернуть редактируемый документ — значит прочитать эти положения и вывести структуру: строки на общей базовой линии образуют одну строку, заметно более крупная строка — заголовок, строка, оборвавшаяся задолго до края колонки, завершила абзац, а не перенеслась, а строка с маркером или номером — пункт списка. Именно это делает конвертер, прежде чем записать настоящий пакет .docx со стилями заголовков Word, абзацами списков и таблицами.
Возможности
- Положение и кегль текста читаются из PDF, а не угадываются по картинке
- Более крупные и полужирные строки повышаются до стилей «Заголовок 1–4»
- Перенесённые строки снова соединяются в цельные абзацы
- Строки с маркерами и номерами сохраняются как абзацы списка
- Необязательные разрывы страниц сохраняют исходную разбивку
- Поблочный предпросмотр распознанной структуры до скачивания
- Пишет стандартный .docx, который открывают Word, Pages и LibreOffice
Как использовать PDF в Word
- Перетащите PDF на страницу
- Просмотрите распознанные заголовки, абзацы и пункты списков
- Решите, сохранять ли разрывы страниц и записывать ли автора
- Скачайте .docx
Пример
Ввод
specification.pdf — 12 pages
Результат
specification.docx with 9 headings, 84 paragraphs and the list items kept as bullets.
Заголовки выводятся из кегля относительно основного текста каждой страницы.
Частые ошибки и устранение неполадок
- Документ вышел пустым. — В PDF нет текстового слоя — это скан. Сначала распознайте текст, затем преобразуйте результат.
- Колонтитулы появились отдельными абзацами. — Колонтитулы лежат в текстовом слое наравне со всем остальным. Удалите их один раз в Word и пользуйтесь его собственными колонтитулами.
- Двухколоночные страницы читаются поперёк. — Строки группируются по базовой линии, поэтому соседние колонки перемешиваются. Многоколоночная вёрстка по своей природе плохо преобразуется.
- Каждая строка стала отдельным абзацем. — Так бывает, когда строки кончаются на очень разной ширине — в стихах или коде. Результат всё равно редактируемый: соедините строки в Word.
Часто задаваемые вопросы
- Отправляется ли PDF в службу преобразования?
- Нет. Текстовый слой читается в этой вкладке, и .docx пишется здесь же. Юридические проекты и финансовые отчёты остаются на вашей машине.
- Будет ли файл Word выглядеть точно как PDF?
- Нет, и в этом суть: редактируемый документ перетекает. Заголовки, списки и порядок чтения переносятся, точное расположение — нет.
- Попадают ли изображения из PDF в .docx?
- Нет. Этот конвертер пересобирает текст. Если нужна графика, экспортируйте страницы изображениями отдельно.
- Можно ли преобразовать отсканированный документ?
- Напрямую нет: скан — это картинка без текста. Сначала распознайте текст, и распознанная версия преобразуется как обычно.
- Он делает .doc или .docx?
- .docx — современный пакет Office Open XML. Его читают все актуальные версии Word, Pages, Google Документов и LibreOffice.
Связанные инструменты
- Word в PDF — Преобразует .docx в PDF, сохраняя структуру.
- PDF в текст — Извлекайте выделяемый текст из PDF в виде обычного текста или Markdown.
- PDF в HTML — Преобразует PDF в чистый индексируемый HTML.
- OCR для PDF — Распознаёт текст в отсканированном PDF и делает его доступным поиску.
- PDF в Excel — Извлекает таблицы из PDF в книгу .xlsx или CSV.
- PDF в EPUB — Превращает PDF в перетекающий EPUB для читалок.
- Сравнить PDF — Сравнивайте извлечённый текст двух PDF построчно.
Все инструменты ArrayKit