Eigene LLMs & KI-Systeme · ready4future ICT
Wie werden Texte aus PDFs für die KI-Suche lesbar?
Kurz gesagt
Ein PDF speichert, wo Zeichen auf der Seite stehen, nicht welche Sätze und Absätze zusammengehören. Beim Auslesen kann die Reihenfolge durcheinandergeraten, vor allem bei Spalten, Tabellen und Kopfzeilen. Prüfen Sie den ausgelesenen Text stichprobenartig, bereinigen Sie ihn und speichern Sie die Seitenzahl für jede Textstelle.
Das Problem
Sie haben Hunderte PDF-Dateien in eine KI-Suche geladen. Doch die KI findet wichtige Inhalte nicht, oder sie gibt Sätze wieder, die keinen Sinn ergeben: Das Ende einer Spalte steht mitten im nächsten Satz, Fusszeilen wie «Seite 3 von 12» tauchen im Text auf, Tabellenwerte stehen untereinander ohne Bezug.
Der Grund: Ein PDF ist wie ein gedrucktes Blatt auf dem Bildschirm. Es merkt sich, an welcher Stelle der Seite jedes Zeichen steht, aber nicht, in welcher Reihenfolge man den Text lesen soll. Ein Auslese-Programm muss die Reihenfolge erraten, und das gelingt nicht immer.
Wenn der ausgelesene Text schlecht ist, hilft auch die beste KI nichts. Darum lohnt sich die Prüfung vor dem Import.
So lösen Sie es mit KI – Schritt für Schritt
- Prüfen, ob das PDF Text enthält. Öffnen Sie ein PDF und versuchen Sie, mit der Maus Text zu markieren oder mit der Suchfunktion ein Wort zu finden. Funktioniert das nicht, ist es ein Scan. Dann lesen Sie weiter bei Gescannte PDFs durchsuchbar machen.
- Stichprobe wählen. Nehmen Sie zehn typische PDFs: einfache Briefe, mehrspaltige Berichte, Formulare, Dokumente mit Tabellen, Präsentationen. So sehen Sie die verschiedenen Problemfälle.
- Text auslesen lassen. Ihre IT oder die Software wandelt die PDFs in reinen Text um. Dafür gibt es Werkzeuge, zum Beispiel «pdftotext» oder Programmbibliotheken wie PyMuPDF. Jedes verhält sich leicht anders.
- Ergebnis mit dem Original vergleichen. Öffnen Sie Text und PDF nebeneinander. Prüfen Sie Reihenfolge, Absätze, Umlaute, Tabellen und Listen.
- Probleme sammeln. Notieren Sie, was schiefgeht: durcheinandergeratene Spalten, wiederkehrende Kopf- und Fusszeilen, getrennte Wörter am Zeilenende, Tabellen ohne Zusammenhang.
- Bereinigen. Entfernen Sie Kopf- und Fusszeilen, fügen Sie getrennte Wörter zusammen und behandeln Sie Tabellen separat. Siehe Kopf- und Fusszeilen entfernen und Tabellen aufbereiten.
- Seitenzahl speichern. Merken Sie sich zu jedem Textstück Dateiname und Seite, damit die KI später die Fundstelle nennen kann. Siehe Quellenposition speichern.
- Mit Fragen testen. Stellen Sie zehn Fragen, deren Antwort Sie kennen. Prüfen Sie, ob die KI die richtige Stelle findet und korrekt wiedergibt.
Vorlage zum Kopieren
Du bist eine Datenaufbereiterin. Ich zeige dir ausgelesenen Text aus einem PDF. Prüfe, welche Probleme die Auslesung hat, und schlage Bereinigungsregeln vor. Verändere keinen Inhalt.
Dokumenttyp: [z. B. Jahresbericht, Reglement, Offerte]
Ausgelesener Text (Ausschnitt, ohne Personendaten): [Text einfügen]
Aussehen im Original: [z. B. zwei Spalten, Tabelle auf Seite 3, Kopfzeile mit Firmenname]
Aufgabe:
1. Liste alle Auffälligkeiten auf (Reihenfolge, wiederkehrende Zeilen, getrennte Wörter, Tabellen, Sonderzeichen).
2. Schlage pro Problem eine einfache Regel vor, wie man es automatisch bereinigen könnte.
3. Nenne Fälle, in denen eine Person das Ergebnis prüfen sollte.
Regeln: Ändere keine Inhalte und Zahlen. Wenn du unsicher bist, markiere die Stelle als «prüfen».Fügen Sie nur kurze Ausschnitte ohne Personendaten ein. Die Regeln setzt Ihre IT um und testet sie an Beispielen.
Typische Probleme und Gegenmittel
| Problem | Woran Sie es erkennen | Gegenmittel |
|---|---|---|
| Spalten vermischt | Sätze springen mitten im Satz | Auslese-Werkzeug mit Spaltenerkennung wählen oder Seite getrennt verarbeiten |
| Kopf- und Fusszeilen im Text | «Seite 3», Firmenname erscheint ständig | Wiederkehrende Zeilen automatisch entfernen |
| Getrennte Wörter | «Kündi-gungsfrist» am Zeilenende | Trennstriche am Zeilenende zusammenführen |
| Tabellen | Zahlen stehen ohne Spaltentitel | Tabelle separat auslesen oder in Zeilenform umwandeln |
| Sonderzeichen | Umlaute oder Ligaturen fehlen | Auslese-Werkzeug wechseln, Schriftcodierung prüfen |
Worauf Sie achten müssen
- Keine blinde Automatik: Auch gute Werkzeuge machen Fehler. Prüfen Sie Stichproben, besonders bei Zahlen und Tabellen.
- Scans erkennen: Ohne Textebene braucht es Texterkennung (OCR). Nur auslesen reicht dann nicht.
- Vertrauliche Inhalte: Geben Sie echte Dokumente nur in Werkzeuge, die Ihr Betrieb freigegeben hat. Für Tests nehmen Sie anonymisierte Beispiele.
- Passwortgeschützte PDFs: Sie lassen sich nicht ohne Weiteres auslesen. Klären Sie, ob Sie berechtigt sind, den Schutz aufzuheben.
- Layout kann Bedeutung tragen: Fettdruck, Überschriften und Fussnoten haben Sinn. Wenn sie verloren gehen, kann die KI Zusammenhänge verfehlen.
- Versionen verwalten: Notieren Sie, welche Fassung eines Dokuments importiert wurde, sonst kommen veraltete Auskünfte zustande.
Ein Beispiel aus der Praxis
Ein Beispiel: Die Verwaltungsleiterin einer Stiftung in Basel, Frau Wirz, 56, möchte die Statuten und Jahresberichte der letzten zehn Jahre durchsuchbar machen. Vorher: Die KI antwortet auf die Frage nach dem Stiftungszweck mit einem Satz, der in der Mitte abbricht und mit «Seite 4» endet.
Der IT-Partner liest den Text mit einem anderen Werkzeug aus, entfernt Fusszeilen und speichert die Seitenzahlen. Nachher: Die Antworten bestehen aus vollständigen Sätzen und nennen die Fundstelle. Eine Stichprobe von 20 Fragen bestätigt, dass die Treffer stimmen.
So hilft Ihnen Alpasana
Wenn Sie Dokumente für KI-Anwendungen aufbereiten lassen möchten, bietet ready4future ICT ein betreutes ICT-Praxisjahr für Lernende im vierten IMS-Jahr an. Beschrieben sind unter anderem Skripte, Automatisierungen, Schnittstellen und Datenaufbereitung, KI-Workflows mit Dokumentauslesen sowie fachliche Begleitung, Vier-Augen-Prüfung, Senior-Review, Dokumentation und Kundenabnahme. Als Standard werden Testdaten, anonymisierte oder synthetische Daten verwendet.
Die Arbeit erfolgt durch Lernende unter Begleitung, die Abnahme liegt bei Ihnen. Eine Zusage zu bestimmten Ergebnissen ist nicht Teil der Beschreibung.
Häufige Fragen
Warum findet die KI Inhalte aus Tabellen nicht?
Tabellen werden beim Auslesen oft zu losen Zahlen und Wörtern ohne Zeilenbezug. Wandeln Sie sie vorab in verständliche Zeilen um, zum Beispiel «Position X: Betrag Y». Details bei Tabellen für RAG aufbereiten.
Muss ich jedes PDF einzeln prüfen?
Nein, aber Stichproben je Dokumenttyp sind nötig. Wenn alle Briefe gleich aufgebaut sind, genügen wenige Proben. Bei uneinheitlichen Berichten prüfen Sie mehr.
Reicht das Kopieren des Textes aus dem PDF-Programm?
Für einzelne Dokumente ja. Bei vielen Dateien lohnt sich eine automatische Auslesung mit Prüfregeln, damit alle gleich behandelt werden.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Quellen
Weiterlesen in der Galaxie
- Wie mache ich gescannte PDFs für eine KI durchsuchbar?OCR für KI Suche: So wandeln Sie eingescannte Dokumente mit Texterkennung in durchsuchbaren Text um, prüfen die Qualität und schützen vertrauliche Inhalte.
- Wie bereite ich Tabellen für eine KI-Suche auf?Tabellen für RAG aufbereiten: So bleibt der Spaltenbezug beim Einlesen erhalten, damit die KI-Suche Werte nicht verwechselt. Mit Vorlage und Testplan.
- Was bedeutet Chunking bei einer KI-Dokumentensuche?Chunking einfach erklärt: Warum Dokumente für eine KI-Suche in kleine Textabschnitte zerlegt werden, wie gross diese sein sollten und was dabei schiefgehen kann.
- Wie findet die KI die richtige Seite zu einer Textstelle?RAG Seitenzahlen speichern: So hinterlegen Sie Seite und Fundstelle zu jedem Textabschnitt, damit KI-Antworten im Originaldokument nachprüfbar bleiben.