PDFをWordに変換
PDFを本当に編集できる .docx に組み直します。見出しや箇条書きも認識されます。
PDFをWordに変換する読み取りと書き出しは、すべて端末上で行われます。契約書や報告書がアップロードされることはありません。
先にスキャンPDFの文字を認識する
PDFをWordに について
PDFは文字の断片がどこにあるかを保存していますが、それが何であるかは保存していません。編集できる文書を取り戻すには、その位置を読んで構造を推測する必要があります。同じベースラインの断片は1行、本文よりはっきり大きい行は見出し、段の端よりかなり手前で終わる行は折り返しではなく段落の終わり、行頭記号や番号で始まる行は箇条書きです。この変換はそれを行ったうえで、Wordの見出しスタイル、リスト段落、表を備えた本物の .docx を書き出します。
機能
- 文字の位置と大きさはPDFから読み取り、画像から推測しません
- 大きく太い行は見出し1から4のスタイルに昇格
- 折り返された行は1つの段落に結び直します
- 行頭記号や番号のある行はリスト段落として保持
- 任意の改ページで元のページ割りを保てます
- ダウンロード前に、検出した構造をブロック単位でプレビュー
- Word、Pages、LibreOffice が開ける標準の .docx を書き出し
PDFをWordに の使い方
- PDFをページに置きます
- 検出された見出し、段落、箇条書きを確認します
- 改ページを残すか、著者を記録するかを選びます
- .docx をダウンロードします
例
入力
specification.pdf — 12 pages
出力
specification.docx with 9 headings, 84 paragraphs and the list items kept as bullets.
見出しは、各ページの本文に対する文字の大きさから推定されます。
よくあるエラーとトラブルシューティング
- 文書が空でした。 — PDFに文字の層がありません。スキャンです。まず文字認識にかけ、その結果を変換してください。
- ヘッダーとフッターが独立した段落として現れます。 — 柱は他と同じく文字の層にあります。Wordで一度消し、ヘッダーとフッターの機能を使ってください。
- 2段組のページが横断して読まれます。 — 行はベースラインでまとめられるため、隣り合う段が交互になります。多段組は性質上うまく変換できません。
- すべての行が独立した段落になりました。 — 詩やコードのように行末の幅がばらつくと起こります。結果は編集可能なので、Wordで必要な箇所を結合してください。
よくある質問
- PDFは変換サービスに送られますか。
- いいえ。文字の層はこのタブで読み、.docx もここで書き出します。法務の草案や財務報告は手元に留まります。
- Wordのファイルは見た目までPDFと同じになりますか。
- いいえ。編集できる文書は流れ直します。見出し、箇条書き、読み順は引き継がれますが、正確な位置は引き継がれません。
- PDFの画像は .docx に含まれますか。
- いいえ。この変換は文字を組み直します。図版が必要なら、ページを画像として別に書き出してください。
- スキャンした文書も変換できますか。
- 直接はできません。スキャンは文字のない画像だからです。先に文字認識を行えば、その結果は通常どおり変換できます。
- .doc と .docx のどちらになりますか。
- .docx です。現行のWord、Pages、Googleドキュメント、LibreOffice がすべて読めます。
関連ツール
すべての ArrayKit ツール