Zum Inhalt springen

Eigene LLMs & KI-Systeme · ready4future ICT

Wie mache ich gescannte PDFs für eine KI durchsuchbar?

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Ein Scan ist nur ein Bild einer Seite, die KI findet darin keinen Text. Mit Texterkennung (OCR) wird das Bild in Text umgewandelt, den Sie danach in die KI-Suche laden. Prüfen Sie die Ergebnisse stichprobenartig, vor allem Zahlen, und senden Sie vertrauliche Scans nicht ungeprüft an Cloud-Dienste.

Das Problem

Im Archiv liegen Verträge, Rechnungen oder Protokolle als Scan. Auf dem Bildschirm sehen sie aus wie normale Dokumente, aber die KI findet nichts darin. Der Grund: Ein Scan ist ein Foto der Seite. Für den Computer sind das nur Bildpunkte, keine Buchstaben. Sie können den Text weder markieren noch durchsuchen.

Damit eine KI-Suche damit arbeiten kann, muss zuerst Text daraus werden. Das Verfahren heisst OCR (Optical Character Recognition, auf Deutsch Texterkennung). Dabei «liest» ein Programm die Buchstaben aus dem Bild.

OCR funktioniert gut bei sauberen Scans, aber nicht fehlerfrei. Wer die Grenzen kennt, vermeidet falsche Antworten der KI.

So lösen Sie es mit KI – Schritt für Schritt

  1. Scan erkennen. Öffnen Sie das PDF und versuchen Sie, mit der Suchfunktion nach einem Wort zu suchen. Wird nichts gefunden, obwohl das Wort sichtbar ist, handelt es sich um ein Bild ohne Textebene.
  1. Qualität des Scans prüfen. Wichtig sind gerade Seiten, gute Schärfe, ausreichender Kontrast und eine Auflösung, die für Texterkennung üblich ist, oft um 300 dpi. Schlechte Scans verschlechtern das Ergebnis stark. Falls möglich, scannen Sie neu.
  1. Werkzeug wählen. Bekannte Optionen sind das freie Programm Tesseract, das auch Deutsch unterstützt, und Hilfsprogramme wie OCRmyPDF, die dem PDF eine unsichtbare Textebene hinzufügen. Es gibt auch kommerzielle Produkte und Cloud-Dienste.
  1. Datenschutz klären. Bei Cloud-Diensten verlassen Ihre Dokumente das Haus. Für vertrauliche Unterlagen bevorzugen Sie Werkzeuge im Haus oder geprüfte Anbieter. Siehe Gescannte Dokumente im Chatbot.
  1. Probelauf mit zehn Seiten. Wählen Sie Seiten verschiedener Qualität, zum Beispiel eine saubere Seite, eine Kopie, einen Stempel und eine Tabelle. Lassen Sie sie erkennen.
  1. Ergebnis prüfen. Vergleichen Sie Text und Bild nebeneinander. Achten Sie besonders auf Zahlen, Datumsangaben und Namen. Typische Verwechslungen sind 0 und O oder 1 und l.
  1. Nachbearbeiten. Entfernen Sie Störungen wie Stempel-Text, Seitenränder oder Kopfzeilen. Fügen Sie Seitenzahlen als Metadaten bei. Siehe PDF-Text auslesen für RAG.
  1. Fehlerrate festhalten. Notieren Sie, wie viele Seiten sauber sind. Bei kritischen Dokumenten sollte eine Person kontrollieren, bevor die KI darauf zugreift.

Vorlage zum Kopieren

Du bist eine Datenaufbereiterin. Ich habe Text aus gescannten Dokumenten mit Texterkennung erzeugt. Prüfe den Text auf typische OCR-Fehler und liste Auffälligkeiten auf, ohne Inhalte zu verändern.

Dokumenttyp: [z. B. Rechnung, Vertrag, Protokoll]
Qualität des Scans: [gut / mittel / schlecht, z. B. schräg, verblasst]
Text aus der Texterkennung (Ausschnitt, ohne Personendaten): [Text einfügen]

Aufgabe:
1. Liste Stellen auf, die wie Erkennungsfehler aussehen (Zahlen, Buchstabenverwechslungen, zerrissene Wörter, Sonderzeichen).
2. Teile die Fehler in «wahrscheinlich harmlos» und «muss mit dem Original verglichen werden» ein.
3. Schlage einfache Prüfregeln vor, zum Beispiel Plausibilitätsprüfung von Beträgen und Daten.
Regeln: Korrigiere nichts selbst. Markiere unsichere Stellen und sage, dass ich sie im Original nachsehen muss.

Fügen Sie nur kurze, anonymisierte Ausschnitte ein. Die KI ersetzt nicht den Vergleich mit dem Original.

Qualität des Scans und Ergebnis

ScanErwartungEmpfehlung
Sauber, gerade, Schwarz auf WeissMeist gute ErkennungStichproben genügen
Schräg, leicht verblasstMehr FehlerSeiten begradigen, Kontrast verbessern
Foto mit dem HandyUnregelmässigBesser neu scannen
Tabellen und FormulareStruktur oft verlorenGesondert prüfen
HandschriftMeist schwachNicht ohne Kontrolle verwenden

Worauf Sie achten müssen

  • Fehler bei Zahlen: Eine falsch erkannte Ziffer kann zu falschen Auskünften führen. Prüfen Sie Beträge und Daten.
  • Cloud-Dienste: Prüfen Sie Standort, Vertrag und Aufbewahrung, bevor Sie Dokumente mit Personendaten hochladen. Das Schweizer Datenschutzgesetz gilt auch für Scans. Im Zweifel holen Sie Rat bei einer Fachperson.
  • Aufbewahrungspflichten: Das Original zu vernichten, weil es eingescannt ist, kann rechtliche Folgen haben. Klären Sie das, bevor Sie Papier entsorgen.
  • Handschrift: Wird meist schlecht erkannt. Rechnen Sie mit Nacharbeit. Siehe Handschriftliche Notizen.
  • Sprache einstellen: Das Programm muss wissen, dass Deutsch gelesen wird, sonst steigt die Fehlerquote. Umlaute prüfen.
  • Qualität der Quelle: Ein schlechter Scan wird auch mit der besten Software nicht gut.

Ein Beispiel aus der Praxis

Ein Beispiel: Ein Notariat in Bern, vertreten durch die Büroleiterin Frau Hug, 58, möchte alte Aktennotizen mit einer KI-Suche zugänglich machen. Vorher: 4000 Seiten liegen als Scan vor, die Suche findet nichts, und die Notare blättern von Hand.

Der IT-Partner richtet eine Texterkennung im Haus ein, ohne Cloud. Eine Stichprobe von 50 Seiten zeigt gute Ergebnisse bei Maschinenschrift und Schwächen bei Handschrift. Nachher: Maschinengeschriebene Seiten sind durchsuchbar, handschriftliche bleiben im Papierarchiv. Das Notariat prüft Beträge weiter am Original.

So hilft Ihnen Alpasana

Für die Aufbereitung von Dokumenten bietet ready4future ICT ein betreutes ICT-Praxisjahr für Lernende im vierten IMS-Jahr an. Beschrieben sind Skripte, Automatisierungen, Schnittstellen und Datenaufbereitung sowie KI-Workflows mit Dokumentauslesen. Dazu kommen fachliche Begleitung, Vier-Augen-Prüfung, Senior-Review, Dokumentation und Kundenabnahme. Als Standard dienen Testdaten, anonymisierte oder synthetische Daten.

Die Arbeit erfolgt primär remote durch Lernende unter Begleitung; Sie nehmen das Ergebnis ab. Vertrauliche Originaldaten sind kein Standard und müssen separat geklärt werden.

Häufige Fragen

Wie erkenne ich, ob ein PDF ein Scan ist?

Versuchen Sie, einzelne Wörter zu markieren oder mit der Suchfunktion zu finden. Ist das nicht möglich, ist das PDF ein Bild. Manche PDFs haben eine Textebene, die falsch ist. Prüfen Sie also auch den Inhalt.

Kann die KI selbst scannen und lesen?

Manche KI-Programme können Bilder lesen. Für grosse Mengen und überprüfbare Ergebnisse ist eine dedizierte Texterkennung mit Qualitätskontrolle meist die verlässlichere Wahl. Datenschutz und Kosten sind zu klären.

Wie genau ist Texterkennung bei Deutsch?

Bei sauberen Scans oft gut, aber nie perfekt. Umlaute, Sonderzeichen und Zahlen verlangen Kontrolle. Das Ergebnis testen Sie an Ihren eigenen Dokumenten.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Quellen

Weiterlesen in der Galaxie