PDF в HTML
Превратите PDF в семантический адаптивный HTML — с заголовками, списками и абзацами.
При преобразовании PDF в HTML документ читается и переписывается на вашем устройстве. Внутренние справочники и клиентские отчёты не загружаются.
Преобразовать HTML обратно в PDF
Об инструменте PDF в HTML
PDF плохо годится для публикации в вебе: он скачивается вместо того, чтобы открыться, не перетекает на телефоне, а поисковые системы индексируют его нехотя. Преобразовать по-человечески — значит восстановить структуру, на которую намекает вёрстка, а не заворачивать каждую строку в div. Этот инструмент собирает кусочки текста в строки, строки в абзацы, повышает более крупные строки до заголовков и пишет разметку, которая говорит, чем является каждый блок. Можно взять целую страницу — адаптивную, со светлой и тёмной палитрой — или только фрагмент тела для своего шаблона.
Возможности
- Семантическая разметка: h1–h6, p, ul, li, blockquote, pre и table
- Перенесённые строки соединяются в настоящие абзацы, а не идут по одной
- Самостоятельная целая страница или фрагмент тела для вашего шаблона
- Целая страница адаптивна и уважает светлую или тёмную тему читателя
- Необязательный идентификатор на каждом разрыве страницы для ссылок внутрь
- Отрисованный предпросмотр рядом с разметкой, в изолированной рамке
- Копирование в буфер обмена или скачивание файла .html
Как использовать PDF в HTML
- Перетащите PDF на страницу
- Выберите целую страницу или фрагмент тела
- Прочитайте отрисованный предпросмотр и проверьте структуру
- Скопируйте разметку или скачайте файл .html
Пример
Ввод
handbook.pdf — 24 pages
Результат
<h1>Staff handbook</h1>
<p>This handbook sets out…</p>
<h2>Working hours</h2>
Уровни заголовков берутся из кегля относительно основного текста каждой страницы.
Частые ошибки и устранение неполадок
- Разметка пустая. — В PDF нет текстового слоя. Сначала распознайте текст, затем преобразуйте индексируемую версию.
- Пропали изображения из PDF. — Преобразуется только текст. Экспортируйте страницы изображениями отдельно и сошлитесь на них в разметке.
- Все заголовки одного уровня. — Документ набирает все заголовки одним кеглем, и различить второй уровень от третьего не по чему. Поправьте уровни один раз вручную.
- Обстановка страницы тянется через весь документ. — Колонтитулы в PDF — обычный текст. Уберите их поиском с заменой по полученной разметке.
Часто задаваемые вопросы
- Загружает ли преобразование в HTML мой PDF?
- Нет. Текстовый слой читается в этой вкладке, и разметка формируется здесь же, поэтому внутренний справочник или клиентский отчёт не покидает устройство.
- Будет ли HTML похож на исходный PDF?
- Нет — он сделан для чтения с экрана: одна колонка, удобная длина строки и адаптивная вёрстка. Содержимое то же, оформление другое.
- Какой вывод брать для CMS?
- Фрагмент тела. У него нет ни головы, ни стилей, ни обёртки, и он встаёт в существующий шаблон без конфликтов.
- Доступна ли полученная страница?
- В ней настоящие заголовки, списки и ячейки шапки — это большая часть того, что нужно программе чтения с экрана. Проверьте порядок заголовков.
- Можно ли собрать несколько PDF в одну страницу?
- Сначала объедините PDF и преобразуйте один раз — тогда иерархия заголовков будет единой во всём документе.
Связанные инструменты
- HTML в PDF — Превращает HTML-разметку в аккуратный постраничный PDF.
- PDF в текст — Извлекайте выделяемый текст из PDF в виде обычного текста или Markdown.
- PDF в Word — Пересобирает PDF в редактируемый документ .docx.
- PDF в EPUB — Превращает PDF в перетекающий EPUB для читалок.
- Форматировщик HTML — Форматируйте или минифицируйте HTML, форматируйте встроенный CSS/JS и просматривайте результат.
- HTML в Markdown — Преобразование HTML в чистый, читаемый Markdown.
- OCR для PDF — Распознаёт текст в отсканированном PDF и делает его доступным поиску.
Все инструменты ArrayKit