PDF-OCR
Den Text in einem gescannten PDF erkennen und eine durchsuchbare Datei zurückbekommen.
Die Erkennung läuft auf Ihrem Gerät, gescannte Akten und Archive bleiben also bei Ihnen. Nur die Sprachdaten werden einmal geholt und zwischengespeichert.
Das durchsuchbare Ergebnis nach Word
Über PDF-OCR
Ein gescanntes PDF ist ein Bild eines Dokuments. Sie können es lesen, sonst niemand: Die Suche findet nichts, das Kopieren liefert nichts, und jedes Werkzeug, das auf Text arbeitet, steht ohne Material da. Texterkennung behebt das, indem sie die Formen der Buchstaben liest und das Gefundene als unsichtbare Ebene genau über die gedruckten Wörter schreibt. Die Seite sieht identisch aus — der Scan bleibt unangetastet —, aber das Dokument ist nun durchsuchbar, markierbar und wandelbar. Die Erkennung läuft in Ihrem Browser, in einer von zwölf Sprachen.
Funktionen
- Die Erkennung läuft in Ihrem Browser — Seiten werden nie hochgeladen
- Zwölf Sprachen, darunter Hindi, Russisch, Chinesisch, Japanisch und Arabisch
- Die unsichtbare Textebene liegt über dem unveränderten Scan
- Zwei Scanqualitäten, Tempo gegen Genauigkeit bei kleiner Schrift
- Reine Textausgabe zusätzlich zum durchsuchbaren PDF
- Fortschritt je Seite, mit Stopp für lange Dokumente
- Sprachdaten laden einmal und bleiben im Browser-Cache
So verwendest du PDF-OCR
- Das gescannte PDF auf die Seite ziehen
- Die Sprache auf der Seite und eine Scanqualität wählen
- Die Erkennung starten und beim Durchlauf zusehen
- Das durchsuchbare PDF oder nur den erkannten Text laden
Beispiel
Eingabe
1987-minutes.pdf — 8 scanned pages, typewritten English
Ausgabe
1987-minutes-searchable.pdf — same images, now with selectable text behind them.
Die sichtbare Seite ändert sich nicht; geändert hat sich, dass die Wörter nun in der Datei stehen.
Häufige Fehler & Fehlerbehebung
- Der erkannte Text steckt voller Fehler. — Die Erkennung hängt vom Scan ab. Nehmen Sie die höhere Qualität und prüfen Sie, ob die Sprache zur Seite passt.
- Die Erkennung ist sehr langsam. — Das ist wirklich schwere Arbeit, und sie läuft auf Ihrem eigenen Prozessor statt auf einem Server. Nehmen Sie die schnellere Qualität.
- Ein zweisprachiges Dokument wird schlecht erkannt. — Je Durchgang wird eine Sprache verwendet. Teilen Sie das Dokument nach Sprache und führen Sie die Ergebnisse zusammen.
- Handschrift wurde nicht erkannt. — Das hier erkennt gedruckten und maschinengeschriebenen Text. Handschrift braucht eine ganz andere Modellklasse.
Häufig gestellte Fragen
- Ersetzt der erkannte Text den Scan?
- Nein. Das Bild bleibt genau, wie es war, und der Text kommt unsichtbar dahinter. Deshalb sieht ein durchsuchbares PDF aus wie das Original.
- Werden meine gescannten Seiten zur Erkennung hochgeladen?
- Nein. Die Erkennung läuft in Ihrem Browser. Geholt werden nur die Sprachdaten, einmal, und Ihr Browser hält sie danach vor.
- Wie viele Seiten kann ich auf einmal erkennen lassen?
- Bis zu dreißig je Durchgang, denn die Erkennung ist langsam genug, dass längere Dokumente stapelweise besser aufgehoben sind.
- Welche Qualitätsstufe soll ich wählen?
- Beginnen Sie mit der schnellen. Wechseln Sie zur höheren, wenn die Schrift klein oder der Scan alt ist.
- Kann ich OCR auf ein PDF anwenden, das schon Text hat?
- Sie können, aber es bringt nichts: Prüfen Sie zuerst, ob sich ein Wort markieren lässt.
Verwandte Tools
- PDF zu Text — Extrahiere auswählbaren Text aus einem PDF als reinen Text oder Markdown.
- Scannen als PDF — Nutzt die Kamera als Scanner und sichert die Seiten als PDF.
- PDF zu Word — Baut ein PDF als bearbeitbares .docx neu auf.
- PDF zu Excel — Holt Tabellen aus einem PDF in eine .xlsx-Mappe oder als CSV.
- PDF zu HTML — Wandelt ein PDF in sauberes, durchsuchbares HTML.
- PDF komprimieren — Verkleinere ein PDF, indem jede Seite mit gewählter Qualität und Auflösung als JPEG neu gerendert wird.
- PDF-Zusammenfassung — Fasst ein langes PDF abschnittsweise auf dem Gerät zusammen.
Alle ArrayKit-Tools