OCR und durchsuchbare PDFs richtig einrichten
So wird aus einem Bildscan ein durchsuchbares PDF – mit passenden Sprachen, Qualitätskontrolle und realistischen Grenzen der Texterkennung.
Geprüft am 2026-09-07 · Von Redaktion digitalarchiv-ratgeber.com

OCR erkennt Text in einem Scan und legt ihn meist als unsichtbare Textebene über das Bild. Das Originalbild bleibt sichtbar, während Namen, Daten oder Rechnungsnummern gesucht und kopiert werden können.
Was die Erkennung verbessert
- gerade, vollständig erfasste Seiten
- ausreichender Kontrast ohne abgeschnittene Schatten
- die richtigen Dokumentensprachen
- saubere Vorlagen und eine konsistente Ausrichtung
- ein Wörterbuch, das Umlaute und deutsche Begriffe beherrscht
Handschrift, Thermobelege, Tabellen, alte Schreibmaschinenschrift und schiefe Kopien bleiben schwierig. OCR ist daher eine Suchhilfe, keine garantierte Abschrift.
Lokal oder Cloud
Lokale OCR verarbeitet Dokumente auf dem eigenen Gerät und reduziert zusätzliche Datenübertragungen. Cloudbasierte Dienste können bequem sein, benötigen aber eine bewusste Prüfung von Anbieter, Speicherort, Löschung und Vertraulichkeit. Für Gesundheits-, Finanz- oder Ausweisdokumente sollte Datenschutz vor Komfort stehen.
Prüfroutine
Suche nach drei Elementen: einem Namen, einem Datum und einem Betrag oder Aktenzeichen. Kopiere eine Textstelle probeweise heraus. Prüfe außerdem, ob die sichtbare Bildseite unverändert und lesbar bleibt. Eine fehlerhafte Textebene darf nicht dazu führen, dass das Bildoriginal gelöscht wird.
Geräte- und Softwarewahl
Bei einem Dokumentenscanner zählt nicht nur das OCR-Logo auf der Verpackung. Prüfe unterstützte Sprachen, Ausgabeformate, Stapelverarbeitung, automatische Dateitrennung und Betriebssystem-Support. digitalarchiv-ratgeber.com bewertet solche Angaben derzeit anhand von Dokumentation und Fachquellen, nicht aus einem eigenen Labortest.
Nach OCR folgen konsistente Dateinamen und das 3-2-1-Backup im kompletten Workflow.