OCR und Volltextsuche in Dokumenten

OCR und Volltextsuche in Dokumenten

Texterkennung bei gescannten und fotografierten Dokumenten, automatische Indexierung und inhaltliche Suche — Sie finden das Dokument anhand seines Inhalts, nicht anhand des Dateinamens.

Ein gescanntes Archiv ohne Texterkennung ist eine Kiste voller Bilder: Sie wissen, dass das Dokument da ist, aber Sie können es nur finden, wenn Sie sich erinnern, wo Sie es abgelegt haben. OCR löst genau diese Einschränkung. Jede hochgeladene Seite wird automatisch analysiert, der Text wird extrahiert und indexiert, und von diesem Moment an ist das Dokument nach jedem darin vorkommenden Wort durchsuchbar — ein Name, eine Nummer, ein Betrag, eine Gerätebezeichnung. In Kombination mit Metadatenfiltern führt das in der Praxis dazu, dass Fragen wie „wo ist der Bescheid vom Frühjahr 2022 für die Arbeitsstelle in Cluj?" innerhalb von Sekunden beantwortet werden, nicht erst nach einem Nachmittag.

  • Automatische Texterkennung für gescannte PDFs, Bilder und fotografierte Dokumente.
  • Unterstützung für die rumänische Sprache, einschließlich diakritischer Zeichen — die Suche findet das Wort auch, wenn es ohne sie geschrieben wurde.
  • Inhaltliche Indexierung beim Hochladen, ohne manuellen Schritt und ohne Wartezeit für jemanden.
  • Kombinierte Suche: Wörter aus dem Text plus Metadatenfilter (Typ, Datum, Abteilung, Aussteller, Kategorie).
  • Hervorhebung des Treffers direkt auf der Dokumentseite, damit Sie sehen, warum es gefunden wurde.
  • Automatische Extraktion gängiger Felder (Datum, Nummer, Aussteller, Betrag) zur Vervollständigung der Metadaten.
  • Erneute Verarbeitung älterer Dokumente auf Anfrage, wenn sich die Scanqualität verbessert hat.
  • Auf Ihre Zugriffsrechte beschränkte Suche — die Ergebnisse respektieren die Zugriffsrechte, statt sie zu umgehen.

Wie die Texterkennung kurz zusammengefasst funktioniert

Für einen Computer ist ein Scan ein Bild: farbige Punkte, ohne Bedeutung. OCR — die optische Zeichenerkennung — durchläuft das Bild, identifiziert die Bereiche mit Schrift, trennt Zeilen und Zeichen und wandelt sie in Text um. Über diesem Text wird ein Index aufgebaut, also eine Struktur, die eine schnelle Suche ermöglicht, ohne jedes Dokument erneut zu lesen. Die Qualität des Ergebnisses hängt von der Quelle ab: Ein gedrucktes Dokument, gerade gescannt, mit 300 dpi, wird fast perfekt erkannt; eines, das schräg fotografiert wurde, mit Schatten, oder eine handschriftliche Notiz werden nur teilweise erkannt. Deshalb bewahrt die Plattform immer das Originalbild neben dem extrahierten Text auf — der Text dient der Suche, das Bild bleibt das Dokument.

Inhaltliche Suche plus Metadatenfilter

Eine reine Textsuche liefert zu viele Ergebnisse, und eine reine Metadatensuche setzt voraus, dass jemand sie korrekt ausgefüllt hat. Die Kombination beider ist das, was in der Praxis funktioniert. Sie beginnen mit einem Wort oder einer Formulierung, die sicher im Dokument vorkommt, und grenzen dann mit den bereits vorhandenen Filtern ein: Zeitraum, Abteilung, Kategorie aus dem Aktenverzeichnis, Aussteller. Die Ergebnisse zeigen den Textausschnitt, in dem der Treffer gefunden wurde, damit Sie das gesuchte Dokument schnell von ähnlichen unterscheiden können. Dieselbe Suche kann gespeichert und wiederverwendet werden — nützlich für regelmäßige Kontrollen, bei denen sich die Frage Monat für Monat wiederholt.

Aus dem erkannten Text automatisch ausgefüllte Metadaten

Der zeitaufwendigste Teil der Digitalisierung eines Archivs ist nicht das Scannen, sondern das Ausfüllen der Metadaten. OCR reduziert diesen Aufwand erheblich: Aus dem erkannten Text können die üblichen Felder automatisch extrahiert werden — Dokumentdatum, Nummer, Aussteller, Betrag. Sie werden vorgeschlagen, nicht vorgegeben: Der Bearbeiter bestätigt oder korrigiert sie, und die Korrekturen verbessern die folgenden Ergebnisse. Für große Stapel von Dokumenten desselben Typs können Extraktionsvorlagen einmal definiert und auf den gesamten Stapel angewendet werden, wodurch aus einer Aufgabe von Wochen eine von Tagen wird.

Was OCR nicht kann und wie Sie Überraschungen vermeiden

Es gehört zur Ehrlichkeit, auch die Grenzen zu benennen. Handschrift wird uneinheitlich erkannt, und handschriftlich ausgefüllte Formulare bleiben im Allgemeinen ein Problem. Dokumente mit Stempeln, die den Text überlagern, niedrig aufgelöste Scans oder geknickte Seiten führen zu Erkennungsfehlern. Praktisch bedeutet das, dass ein gesuchtes Wort im Index fehlen kann, obwohl es auf dem Papier steht. Die Empfehlung ist einfach: Tragen Sie für kritische Kategorien einige Schlüssel-Metadaten manuell ein, damit das Auffinden nicht ausschließlich vom erkannten Text abhängt, und scannen Sie von Anfang an in angemessener Qualität — ein erneutes Scannen kostet mehr als ein gleich gut ausgeführter erster Scan.

Rechtliche Hinweise

  • Gesetz Nr. 135/2007 (neu veröffentlicht) — Archivierung von Dokumenten in elektronischer Form: das Dokument muss während der gesamten Aufbewahrungsfrist unversehrt und zugänglich bleiben
  • Gesetz Nr. 16/1996 — Nationalarchivgesetz: Erfassung und Auffindung von Dokumenten aus dem Archivbestand des Unternehmens
  • Verordnung (EU) 2016/679 (DSGVO) — der erkannte Text kann personenbezogene Daten enthalten; der Zugriff auf die Suchergebnisse unterliegt denselben Rechten wie der Zugriff auf das Dokument

Häufige Fragen

Welche Dateien können mit OCR verarbeitet werden?

Gescannte PDFs, Bilder (JPG, PNG, TIFF) und fotografierte Dokumente. Dateien, die bereits digitalen Text enthalten — elektronisch erzeugte PDFs, textbasierte Dokumente — werden direkt indexiert, ohne Erkennung, weil ihr Text bereits vorhanden ist.

Funktioniert es bei rumänischsprachigen Dokumenten mit diakritischen Zeichen?

Ja. Die Erkennung ist für Rumänisch konfiguriert, und die Suche ist tolerant gegenüber diakritischen Zeichen: Sie finden das Dokument auch, wenn Sie das Wort ohne sie geschrieben haben, oder umgekehrt.

Wird Handschrift erkannt?

Nur teilweise und uneinheitlich. Gedruckter Text wird sehr gut erkannt; Handschrift und handschriftlich ausgefüllte Formulare bleiben unsicher. Für solche Dokumente wird empfohlen, einige Schlüssel-Metadaten manuell einzutragen, damit das Auffinden nicht von OCR abhängt.

Wie lange dauert die Verarbeitung eines Dokuments?

In der Regel wenige Sekunden pro Seite, je nach Auflösung und Komplexität der Seite. Die Verarbeitung erfolgt beim Hochladen im Hintergrund, sodass niemand blockiert wird: Das Dokument steht sofort zur Verfügung, und die inhaltliche Suche wird aktiv, sobald die Indexierung abgeschlossen ist.

Kann ich im Archiv suchen, das vor der Aktivierung von OCR hochgeladen wurde?

Ja. Bereits vorhandene Dokumente können einzeln oder in Stapeln zur erneuten Verarbeitung gesendet werden und werden nach der Indexierung genauso inhaltlich durchsuchbar wie neue Dokumente.

Zeigt mir die Suche Dokumente, auf die ich keinen Zugriff habe?

Nein. Die Ergebnisse respektieren die Zugriffsrechte: Ein Dokument, das Sie nicht einsehen dürfen, erscheint nicht in der Liste und wird Ihnen auch nicht über den Textausschnitt preisgegeben. Die Suche ist kein Schlupfloch um die Berechtigungen herum.

Weiterführende Artikel

Machen Sie Ihr gescanntes Archiv durchsuchbar

Wir aktivieren die Texterkennung für neue Dokumente und verarbeiten Ihr bestehendes Archiv erneut, damit jedes Dokument anhand seines Inhalts gefunden wird.

4b2b.net
Business-Ökosystem
4conta.ro
Buchhaltung
4invoices.net
Rechnungs-App
4expenses.net
Spesenmanagement
4notify.net
Benachrichtigungen
4hosting.net
Hosting
4database.net
Datenbanken
4buildsite.net
Website-Erstellung
4myapp.net
App-Baukasten
4avatars.net
KI-Avatare
4chaty.net
KI-Chatbot
4webagency.net
Web-Agentur-Software
4softedu.net
Bildungs-Websites
4softcrm.net
CRM-Plattform
4softerp.net
ERP-System
4softhr.net
Personalwesen
4mystaff.net
Mitarbeiterportal
4myprojects.net
Projektmanager
4docs.net
Dokumentenmanagement
4mycontracts.net
Verträge
4appointments.net
Terminvereinbarung
4marketingonline.net
Marketing
4insurance.net
Versicherungen
4property.net
Immobilien
4lawyers.net
Kanzleisoftware
4mygarage.net
Autowerkstatt
4driving.net
Fahrschulen
4fleet.net
Fuhrparkmanagement
4myevents.net
Veranstaltungen
4therapy.net
Therapie
4clinics.net
Kliniken
4dental.net
Zahnarztpraxen
4restaurants.net
Restaurants
4beautify.net
Beauty-Salons
4gym.net
Fitnessstudios
4guards.net
Sicherheitsfirmen
4construct.net
Bauunternehmen
4marketplace.net
Marktplatz
4shopy.net
Online-Shop
4pricing.net
Preisvergleich
4salefood.net
Essenslieferung
4rentify.net
Vermietungen
4transports.net
Transport
4agencytravel.net
Reisebüro
4hotel.net
Hotels & Pensionen
4ong.net
NGO-Verwaltung
OCR und Volltextsuche in Dokumenten | 4docs