Zum Inhalt springen

Eigene LLMs & KI-Systeme · ready4future ICT

Wie werden nur geänderte Dokumente neu verarbeitet?

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Berechnen Sie für jede Datei einen Fingerabdruck (Hash) und speichern Sie ihn zusammen mit dem Index. Beim nächsten Lauf vergleichen Sie: Unveränderte Dateien bleiben, geänderte werden neu verarbeitet, gelöschte aus dem Index entfernt. So dauert die Aktualisierung Minuten statt Stunden.

Das Problem

Ihre KI-Suche läuft. Doch jedes Mal, wenn jemand ein Dokument ändert, startet die Aktualisierung von vorn: Alle Dateien werden neu gelesen, in Abschnitte geteilt und in Embeddings (Zahlenfolgen, die den Sinn eines Textes beschreiben) verwandelt. Bei einigen hundert Dokumenten dauert das Stunden, und der Rechner ist dabei ausgelastet.

Das ist doppelt ärgerlich: Meist hat sich nur eine Handvoll Dateien geändert. Die übrigen 99 Prozent liefern beim zweiten Durchlauf exakt dieselben Zahlen wie beim ersten. Die Zeit und der Strom sind verschwendet. Bei einem Cloud-Dienst, der pro Text abrechnet, kommen auch noch unnötige Kosten dazu.

Die Lösung heisst inkrementelle Aktualisierung: Man merkt sich, was schon verarbeitet wurde, und fasst nur Neues, Geändertes und Gelöschtes an. Das Prinzip ist einfach, die Umsetzung braucht aber etwas Technik. Eine KI (ein Programm, das Texte versteht und schreibt) kann beim Planen und Erklären helfen.

So lösen Sie es mit KI – Schritt für Schritt

  1. Ordnung schaffen: Legen Sie fest, welche Ordner oder Systeme überhaupt eingelesen werden und woran man eine Datei eindeutig erkennt, zum Beispiel am Pfad.
  2. Fingerabdruck berechnen: Für jede Datei wird ein Hash berechnet, eine kurze Zeichenfolge, die sich ändert, sobald sich der Inhalt ändert. Das Änderungsdatum allein ist unzuverlässig, weil es auch beim blossen Kopieren oder Öffnen wechseln kann.
  3. Verzeichnis führen: Speichern Sie in einer kleinen Tabelle pro Datei: Pfad, Hash, Datum der Verarbeitung und die Kennungen der erzeugten Abschnitte im Index.
  4. Beim Lauf vergleichen: Gehen Sie alle Dateien durch. Gleicher Hash: überspringen. Anderer Hash: als geändert markieren. Pfad ist neu: als neu markieren. Pfad fehlt jetzt: als gelöscht markieren.
  5. Geänderte Dateien ersetzen: Entfernen Sie zuerst die alten Abschnitte der Datei aus dem Index, dann fügen Sie die neuen ein. So bleiben keine veralteten Reste.
  6. Gelöschte Dateien entfernen: Löschen Sie deren Abschnitte aus dem Index. Siehe Dokument aus dem Vektorindex löschen.
  7. Konfiguration im Hash berücksichtigen: Ändern Sie Modell, Abschnittsgrösse oder Überlappung, müssen alle Dokumente neu verarbeitet werden. Speichern Sie diese Einstellungen als Teil der Kennung. Siehe Embedding-Modell wechseln.
  8. Fehler abfangen: Bricht ein Lauf ab, darf das Verzeichnis die Datei nicht als erledigt vermerken. Notieren Sie «verarbeitet» erst, nachdem alle Abschnitte gespeichert sind.
  9. Regelmässig testen: Ändern Sie probehalber ein Dokument, löschen Sie eines und fügen Sie eines hinzu. Prüfen Sie, ob die Suche danach den neuen Stand zeigt.

Vorlage zum Kopieren

Du bist ein erfahrener Entwickler und erklärst einer Laiin, wie man eine KI-Suche inkrementell aktualisiert. Deutsch (Schweiz), einfache Sprache.
Unsere Lage: [Anzahl Dokumente, Dateiarten, Speicherort, z. B. Netzlaufwerk], Vektordatenbank: [Name oder «noch offen»], Programmiersprache: [z. B. Python oder «keine»]
Aufgabe: 1. Erkläre in fünf Sätzen, was ein Datei-Hash ist und warum er besser ist als das Änderungsdatum. 2. Beschreibe als nummerierte Liste den Ablauf eines Aktualisierungslaufs. 3. Schlage eine Tabelle für das Verzeichnis der verarbeiteten Dateien vor (Spaltennamen und Zweck). 4. Nenne fünf Fehlerquellen und wie man sie testet.
Erfinde keine Befehle oder Bibliotheksnamen. Wenn du unsicher bist, schreibe «in der Dokumentation prüfen».

Setzen Sie Ihre Angaben ein. Wenn Sie nicht programmieren, geben Sie die Antwort der Person weiter, die Ihre Suche betreut.

Worauf Sie achten müssen

  • Hash ist kein Schutz: Der Fingerabdruck dient nur dem Vergleich. Er verschlüsselt nichts.
  • Umbenannte und verschobene Dateien: Eine umbenannte Datei sieht wie «gelöscht plus neu» aus. Ein Vergleich über den Hash erkennt sie als gleichen Inhalt und spart die Neuberechnung.
  • Geänderte Einstellungen: Wird die Abschnittsgrösse oder das Modell geändert, ist der Index nicht mehr einheitlich. Dann hilft nur eine vollständige Neuberechnung.
  • Zwischenstände: Wird eine Datei gerade gespeichert, kann ein halber Stand eingelesen werden. Verarbeiten Sie Dateien erst, wenn sie eine Weile unverändert sind.
  • Personendaten: Gelöscht heisst im Index auch gelöscht. Prüfen Sie nach einem Löschwunsch, dass keine Abschnitte zurückbleiben. Siehe Embeddings und Datenschutz.
  • Protokoll führen: Halten Sie fest, was ein Lauf neu, geändert oder gelöscht hat. Das hilft bei der Fehlersuche.
Zustand der DateiAktion im Index
Unverändertnichts tun
Inhalt geändertalte Abschnitte löschen, neue einfügen
Neu hinzugekommenAbschnitte einfügen
GelöschtAbschnitte entfernen
Nur umbenanntPfad im Verzeichnis anpassen

Ein Beispiel aus der Praxis

Ein Beispiel: Ein Ingenieurbüro in Baden hat auf dem Server rund 600 Projektberichte und Normenauszüge. Eine lokale KI-Suche liest jede Nacht alles neu ein, das dauert etwa sieben Stunden und blockiert den Rechner bis in den Morgen. Im Schnitt ändern sich pro Tag weniger als zehn Dateien.

Vorher: Vollständige Neuberechnung jede Nacht, der Rechner ist morgens oft noch beschäftigt.

Nachher: Ein kleines Skript führt ein Verzeichnis mit Pfad und Hash. Nachts werden nur neue und geänderte Dateien verarbeitet, gelöschte aus dem Index entfernt. Der Lauf dauert wenige Minuten. Einmal im Monat wird zur Kontrolle alles neu aufgebaut und mit dem inkrementellen Index verglichen. Die Zahlen sind erfunden und dienen nur als Muster.

So hilft Ihnen Alpasana

Wenn Sie die Aktualisierung Ihrer KI-Suche nicht selbst programmieren möchten, kann ready4future ICT helfen. Laut Beschreibung setzen begleitete Informatiklernende unter anderem Skripte, Automatisierungen, Schnittstellen, Datenaufbereitung und KI-Workflows um, mit Vier-Augen-Prüfung, Senior-Review und Dokumentation.

Standardmässig werden Test-, anonymisierte oder synthetische Daten verwendet. Welche Aufgaben im Rahmen eines Jahrespakets möglich sind, klären Sie vorab im Gespräch.

Häufige Fragen

Reicht das Änderungsdatum der Datei nicht aus?

Es ist ein erster Anhaltspunkt, aber nicht zuverlässig. Das Datum kann sich durch Kopieren oder Synchronisieren ändern, ohne dass sich der Inhalt ändert, oder umgekehrt trotz Änderung gleich bleiben. Der Hash prüft den Inhalt selbst.

Spart das auch bei einem Cloud-Dienst Kosten?

Ja, wenn pro verarbeitetem Text abgerechnet wird, fallen weniger Berechnungen an. Die genauen Preise entnehmen Sie dem Angebot des Anbieters. Eine Ergänzung bietet Embedding-Cache einrichten.

Kann ich auch einzelne Abschnitte statt ganzer Dateien aktualisieren?

Ja, wenn Sie für jeden Abschnitt einen eigenen Hash führen. Das lohnt sich bei sehr grossen Dokumenten, macht die Verwaltung aber aufwendiger. Für die meisten Betriebe genügt die Ebene der Datei.

Wie oft soll der Lauf stattfinden?

Das hängt davon ab, wie aktuell die Antworten sein müssen. Für Handbücher genügt meist ein Lauf pro Nacht. Planen Sie dazu die Pflege der Daten, siehe Chatbot-Wissen automatisch aktualisieren.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie