Konvertieren Sie ein gescanntes PDF in ein bearbeitbares Word-Dokument (OCR-Anleitung)

Eine gescannte PDF-Datei ist eigentlich ein Fotoalbum: Jede Seite ist ein Bild und es gibt kein einziges auswählbares Zeichen darin. Aus diesem Grund erzeugt die Funktion „In Word konvertieren“ bei einem Scan ein Dokument, das ein riesiges Bild pro Seite enthält. Der fehlende Schritt ist OCR – optische Zeichenerkennung – die das Bild liest und echten Text rekonstruiert. Hier erfahren Sie, wie die Pipeline funktioniert und wie Sie die beste Genauigkeit daraus erzielen.

Was OCR tatsächlich macht

OCR-Engines führen drei Durchläufe über jedes Seitenbild durch:

  1. Erkennen – Textbereiche finden und von Bildern, Stempeln und Signaturen trennen
  2. Erkennen – jedes Zeichen klassifizieren und dabei ein Sprachmodell verwenden, um wahrscheinliche Fehler zu korrigieren („rn“ → "m")
  3. Neu erstellen – Geben Sie den Text mit Schriftgrößen, Positionen und Lesereihenfolge aus, sodass die Word-Datei die ursprüngliche Struktur beibehält

Moderne Engines verarbeiten sauber gedruckten Text mit einer Genauigkeit von 95–99 %. Handschrift, blasse Faxe und stark verzerrte Seiten sind die Ursachen für Genauigkeitsverluste.

So bereiten Sie einen Scan für beste Ergebnisse vor

  • 300 dpi ist der optimale Punkt – bei weniger als 200 dpi beginnen Zeichen zu verschmelzen; Bei über 400 dpi erhalten Sie nichts als größere Dateien.
  • Richten Sie die Seite gerade aus – mehr als etwa 5 Grad Neigung und Linien beginnen falsch zu brechen
  • Vermeiden Sie Fotos von Dokumenten, die schräg aufgenommen wurden – verwenden Sie einen Scanner oder eine Scan-App, die eine Perspektivkorrektur anwendet
  • Wählen Sie die richtige Sprache – die Erkennungsqualität nimmt stark ab, wenn die Engine Englisch erwartet und Deutsch erkennt, oder umgekehrt umgekehrt

Konvertieren mit WhizPDF

Laden Sie das gescannte PDF in PDF in Word hoch – WhizPDF erkennt gescannte Seiten automatisch und leitet sie durch OCR weiter, sodass Sie keinen Modus auswählen müssen. Das Ergebnis ist eine .docx-Datei mit echtem, bearbeitbarem Text. Gäste erhalten 1 OCR-Guthaben pro Tag und kostenlose Konten 2 pro Tag. Basic umfasst 100 OCR-Credits pro Monat und Pro 700; Bezahlte Credits werden monatlich zurückgesetzt und nicht verlängert.

Was nach der Konvertierung zu überprüfen ist

  • Namen und Nummern zuerst – OCR schlägt selten auf eine Art und Weise fehl, die Sie bemerken; es verwechselt 0/O, 1/l, 5/S in plausibel aussehenden Wörtern. Lesen Sie alles, was gedruckt oder abgelegt werden soll, Korrektur.
  • Tabellen – auf dem Scan gezeichnete Ränder helfen der Engine; Randlose Tabellen können als einfacher Text angezeigt werden
  • Signaturen und Stempel – sie werden als Bilder beibehalten, was Sie möchten

Wenn die Quelle ein Foto und kein Scan ist

Wenn Sie nur ein Telefonfoto haben, lassen Sie es zuerst durch Dateiscannen laufen: Dadurch wird die Perspektive abgeflacht, der Kontrast erhöht und die Seitenränder werden beschnitten. Ein korrigiertes Foto lässt sich wesentlich besser konvertieren als die Rohaufnahme.

Als Faustregel gilt: Die OCR-Qualität wird durch die Scanqualität begrenzt. Zwei Minuten Vorbereitungszeit sind weitaus größer als die Aufräumarbeiten nach der Konvertierung.

Müssen Sie jetzt ein Dokument konvertieren?

Durchsuchen Sie alle Tools