Eigene LLMs & KI-Systeme · KI-Beratung und digitale Transformation
Unser Chatbot antwortet langsam: Wo beginnt die Fehlersuche?
Kurz gesagt
Messen Sie zuerst, wo die Zeit verloren geht: beim Suchen in den Dokumenten, beim Modell oder auf dem Weg dazwischen. Häufige Ursachen sind ein zu grosses Modell, zu viele oder zu lange Textstücke, überlastete Server und langsame Verbindungen. Ändern Sie immer nur eine Sache auf einmal.
Das Problem
Ein Kunde stellt auf Ihrer Website eine Frage und wartet. Zehn Sekunden, zwanzig Sekunden, nichts passiert. Er schliesst das Fenster und ruft an. Oder Ihre Mitarbeitenden gewöhnen sich an, den internen Chatbot nicht mehr zu fragen, weil es mit der Suche im Ordner schneller geht.
Langsame Antworten sind mehr als ein Schönheitsfehler. Sie entscheiden darüber, ob der Chatbot genutzt wird. Zugleich ist die Ursache für Laien schwer zu sehen, denn hinter dem Chatfenster arbeiten mehrere Teile hintereinander.
Wer systematisch vorgeht, findet die Bremse meist in einer Stunde. Entscheidend ist, nicht zu raten, sondern zu messen.
So lösen Sie es mit KI – Schritt für Schritt
- Das Problem beschreiben. Wann ist der Chatbot langsam: immer, nur zu bestimmten Zeiten, nur bei bestimmten Fragen? Notieren Sie fünf Beispiele mit Uhrzeit und ungefährer Wartezeit.
- Die Kette verstehen. Eine Antwort entsteht in Etappen: Die Frage wird gesendet, im Wissen werden passende Textstücke gesucht, ein Sprachmodell formuliert die Antwort, die Antwort wird zurückgeschickt. Jede Etappe kann bremsen.
- Zeit pro Etappe messen. Fragen Sie Ihren Anbieter oder Ihre IT nach Protokollen mit Zeitangaben. Messen Sie sonst von Hand mit der Stoppuhr, wann das erste Wort erscheint und wann die Antwort fertig ist. Siehe Antwortzeit messen.
- Modell prüfen. Sehr grosse Modelle denken länger nach. Prüfen Sie, ob für einfache Fragen ein kleineres, schnelleres Modell genügt. Testen Sie die Qualität mit denselben Fragen.
- Textmenge prüfen. Wenn der Chatbot pro Frage viele oder lange Textstücke an das Modell gibt, dauert es länger. Fragen Sie, wie viele Stücke verwendet werden und ob weniger genügen. Siehe Suchtreffer-Anzahl einstellen.
- Auslastung prüfen. Läuft der Chatbot auf einem eigenen Server, schauen Sie, ob der Speicher voll ist oder viele Personen gleichzeitig fragen. Siehe Gleichzeitige Nutzer.
- Verbindung und Einbindung prüfen. Eine langsame Website oder ein überladenes Widget bremst schon vor der Antwort. Siehe Chatbot lädt Website langsam.
- Eine Änderung nach der anderen. Ändern Sie nur einen Punkt, messen Sie neu, dokumentieren Sie das Ergebnis. So wissen Sie, was geholfen hat.
Vorlage zum Kopieren
Diese Vorlage hilft Ihnen, die Beobachtungen zu ordnen und mit Ihrem Anbieter zu sprechen:
Du hilfst mir bei der Fehlersuche für einen langsamen Chatbot. Du gibst Hypothesen, keine Gewissheiten.
Beschreibung: [z. B. Antworten dauern am Vormittag oft deutlich länger]
Chatbot-Art: [Website-Chatbot / interner Wissens-Chatbot]
Läuft bei: [Anbieter in der Cloud / eigener Server / weiss ich nicht]
Messungen: [Frage, Uhrzeit, Zeit bis zum ersten Wort, Zeit bis zum Ende]
Anzahl Nutzende: [ungefähr]
Zuletzt geändert: [z. B. neue Dokumente, neues Modell, nichts]
Erstelle:
1. Eine Tabelle mit den fünf wahrscheinlichsten Ursachen, je mit «woran erkennen wir es» und «erster Test».
2. Eine Liste von sieben Fragen an meinen Anbieter oder meine IT-Betreuung.
3. Einen Vorschlag, in welcher Reihenfolge wir testen sollten.
Schreibe einfach und ohne unnötige Fachwörter.Tragen Sie Ihre Beobachtungen ein. Die Liste der Ursachen ersetzt keine Messung, sie ordnet Ihre Fragen.
| Beobachtung | Mögliche Ursache | Erster Test |
|---|---|---|
| Lange Wartezeit bis zum ersten Wort | Suche oder Modellstart | Zeit pro Etappe messen |
| Erstes Wort rasch, Antwort zieht sich | Grosses Modell oder lange Antwort | Kleineres Modell, kürzere Antworten testen |
| Nur zu Stosszeiten langsam | Viele gleichzeitige Nutzer | Auslastung prüfen |
| Nach längerer Pause erste Antwort langsam | Modell wird erst geladen | Beim Anbieter nachfragen |
| Nur bei langen Dokumenten langsam | Zu viel Text pro Frage | Anzahl Textstücke reduzieren |
Worauf Sie achten müssen
- Nicht raten: Ohne Messung ändern Sie vielleicht das Falsche. Notieren Sie Zahlen vor und nach jeder Änderung.
- Qualität im Blick behalten: Schneller ist wertlos, wenn die Antworten schlechter werden. Prüfen Sie dieselben Testfragen vor und nach der Änderung.
- Kosten: Mehr Leistung oder ein schnelleres Modell kann höhere Kosten bedeuten. Siehe Kosten pro Gespräch.
- Wartezeit sichtbar machen: Ein Hinweis wie «Ich suche in den Unterlagen» und die schrittweise Anzeige der Antwort lassen die Zeit kürzer erscheinen.
- Datenschutz bei Protokollen: Wenn Sie Gespräche zur Fehlersuche auswerten, achten Sie auf Personendaten und kurze Speicherfristen.
- Anbieterverantwortung: Bei Cloud-Diensten liegt die Ursache manchmal beim Anbieter. Halten Sie Beobachtungen schriftlich fest.
Ein Beispiel aus der Praxis
Ein Beispiel: Ein Treuhandbüro in Baden hat einen internen Chatbot für Weisungen und Checklisten. Die Mitarbeitenden klagen, dass Antworten oft zwanzig Sekunden oder mehr dauern. Einige geben auf.
Vorher: Niemand weiss, woran es liegt, und man vermutet «zu schwache Technik». Nachher: Die Büroleiterin misst fünf Fragen und stellt fest, dass die Suche rasch ist, das Modell aber sehr lange Textstücke erhält. Der Anbieter reduziert die Textmenge pro Frage und wechselt für einfache Fragen auf ein kleineres Modell. Die Wartezeit sinkt spürbar, die Qualität bleibt in den Testfragen gleich. Die Tests wiederholt sie nach vier Wochen.
So hilft Ihnen Alpasana
Wenn die Ursache nicht auf Anhieb zu finden ist, hilft ein Blick auf das ganze System. Die KI-Beratung und digitale Transformation der Alpasana GmbH umfasst nach Leistungsbeschreibung die Integration von KI-Agenten mit Anwendungsfall, Pilot, Einsatzregeln und Skalierung sowie das Konzipieren von Schnittstellen und das Verbinden von Systemen. Projekte werden individuell offeriert.
Häufige Fragen
Ist ein langsamer Chatbot ein Zeichen für schlechte Technik?
Nicht unbedingt. Oft sind Einstellungen die Ursache, etwa zu viel Text pro Frage oder ein unnötig grosses Modell. Mit einer sauberen Messung finden Sie das heraus, bevor Sie Geld für Technik ausgeben.
Hilft ein stärkerer Server immer?
Nein. Wenn die Ursache in der Menge des gesendeten Textes oder im Modell liegt, bleibt ein stärkerer Server wirkungslos. Erst messen, dann investieren.
Wie schnell sollte ein Chatbot antworten?
Eine feste Zahl gibt es nicht. Entscheidend ist, was Ihre Nutzenden erwarten. Beginnt die Antwort innerhalb weniger Sekunden zu erscheinen, wirkt es meist flüssig. Fragen Sie Ihre Nutzenden, ab wann es sie stört.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- Wie viele Personen können unseren Chatbot gleichzeitig nutzen?Chatbot gleichzeitige Nutzer: So prüfen Sie mit einem einfachen Lasttest, ob Ihr Chatbot auch bei vielen Fragen gleichzeitig läuft. Mit Checkliste und Vorlage.
- Was tun, wenn zu viele KI-Anfragen gleichzeitig eingehen?Zu viele gleichzeitige KI-Anfragen: Was eine Warteschlange ist, warum Ihr Team wartet und wie Sie Anzeige, Grenzen und Kapazität sinnvoll gestalten. Mit Beispiel.
- Der Chatbot macht die Website langsam: Was hilft?Chatbot bremst die Website? So finden Sie die Ursache beim Chat-Skript, messen die Ladezeit und beschleunigen die Seite. Mit Schritten, Tabelle und Vorlage.
- Ollama ist langsam: Wie finde ich die Ursache?Ollama langsam: So diagnostizieren Sie, warum Ihre lokale KI zäh antwortet, und prüfen Modellgrösse, Auslastung, Grafikkarte und Einstellungen Schritt für Schritt.