Eigene LLMs & KI-Systeme · KI und IT für konkrete Arbeitsaufgaben
Wie stark leidet die KI-Qualität durch Quantisierung?
Kurz gesagt
Eine mässige Quantisierung, zum Beispiel auf vier oder fünf Bit, verändert die Antworten bei vielen Alltagsaufgaben kaum spürbar. Je stärker die Komprimierung, desto eher häufen sich Fehler bei Zahlen, Fakten und längeren Gedankengängen. Prüfen Sie den Unterschied mit Ihren eigenen Aufgaben, statt sich auf allgemeine Aussagen zu verlassen.
Das Problem
Ihr Computer hat nicht genug Speicher für das grosse Modell. Die Lösung scheint einfach: eine stärker komprimierte Version laden. Aber leidet dadurch die Antwortqualität? Und wie merken Sie es, wenn ja? Das Modell schreibt ja weiter flüssig und selbstsicher.
Genau darin liegt die Tücke. Ein komprimiertes Modell wird nicht plötzlich unverständlich, sondern macht oft nur etwas häufiger Fehler: eine falsche Zahl, eine vergessene Bedingung, einen Wortlaut, der leicht danebenliegt. Bei einem Entwurf für eine E-Mail fällt das kaum auf, bei einer Berechnung oder einem Vertragsentwurf umso mehr.
Wie viel Qualität verloren geht, hängt von Modell, Komprimierungsstufe und Aufgabe ab. Pauschale Zahlen helfen deshalb wenig. Hilfreich ist ein kleiner, ehrlicher Vergleich mit Ihren eigenen Aufgaben.
So lösen Sie es mit KI – Schritt für Schritt
- Verstehen Sie das Prinzip. Quantisierung speichert die Zahlen im Modell mit weniger Genauigkeit. Das Modell wird kleiner und oft schneller, aber ungenauer. Eine Einführung bietet Quantisierung erklärt.
- Wählen Sie Vergleichsvarianten. Nehmen Sie dasselbe Modell in zwei Stufen, zum Beispiel eine mittlere und eine höhere. Siehe GGUF-Quantisierung auswählen.
- Sammeln Sie echte Aufgaben. Nehmen Sie 8 bis 10 Aufgaben aus Ihrem Alltag: eine Zusammenfassung, ein E-Mail-Entwurf, eine Rechnung, eine Frage mit Zahlen, eine Aufgabe mit mehreren Bedingungen. Verwenden Sie keine vertraulichen Originaldaten, sondern anonymisierte Beispiele.
- Lassen Sie beide Varianten antworten. Verwenden Sie die gleichen Einstellungen, damit die Antworten vergleichbar bleiben.
- Bewerten Sie blind. Lassen Sie eine zweite Person die Antworten beurteilen, ohne zu wissen, welche Variante sie vor sich hat. Das verhindert, dass die Erwartung das Urteil färbt.
- Achten Sie auf typische Fehler. Falsche Zahlen, vergessene Teilaufgaben, erfundene Details, Sprachfehler und Wiederholungen. Siehe Halluzinationen testen.
- Wiederholen Sie wichtige Aufgaben. Stellen Sie dieselbe Aufgabe mehrmals, denn Antworten schwanken auch von Natur aus.
- Entscheiden Sie nach Aufgabe. Für Entwürfe genügt vielleicht die kleinere Stufe, für Zahlenarbeit die höhere. Notieren Sie die Entscheidung.
Vorlage zum Kopieren
Mit dieser Tabelle halten Sie die Ergebnisse fest. Den Auftrag unten lassen Sie auf beiden Varianten laufen.
Aufgabe [Nr.]: [Beschreibung, z. B. «Fasse den folgenden Text in fünf Sätzen zusammen»]
Text/Daten (anonymisiert):
[Beispieltext]
Regeln:
- Antworte auf Deutsch (Schweiz), in der Sie-Form.
- Verwende nur Informationen aus dem Text.
- Wenn etwas im Text fehlt, schreibe «nicht angegeben».
- Zeige bei Rechnungen den Rechenweg.Bewertungsraster pro Antwort (1 bis 5): Inhalt richtig, Zahlen richtig, Vollständigkeit, Sprache. Tragen Sie die Werte für beide Varianten nebeneinander ein.
| Aufgabenart | Empfindlichkeit für Qualitätsverlust |
|---|---|
| Entwürfe, Ideen, Umformulierungen | eher gering |
| Zusammenfassungen kurzer Texte | gering bis mittel |
| Zahlen, Rechnen, Fakten | eher hoch |
| Mehrschrittige Aufgaben | hoch |
| Seltene Sprachen, Fachbegriffe | oft hoch |
Worauf Sie achten müssen
- Kleine Stichprobe: Zehn Aufgaben zeigen eine Tendenz, keinen Beweis. Für wichtige Entscheide testen Sie mehr.
- Subjektiver Eindruck: Flüssige Sprache täuscht über Fehler hinweg. Prüfen Sie Inhalte, nicht nur den Stil.
- Aufgabenabhängig: Eine Variante, die bei E-Mails reicht, kann bei Zahlen versagen.
- Datenschutz beim Testen: Verwenden Sie anonymisierte oder erfundene Daten. Testdaten gehören nicht zu den echten Kundendaten.
- Grenzen der Hardware: Wenn nur die kleine Stufe passt, kann ein kleineres, weniger komprimiertes Modell die bessere Wahl sein. Siehe Modellgrösse.
- Keine Garantie: Auch das Original-Modell erfindet Dinge. Wichtige Aussagen bleiben prüfpflichtig.
Ein Beispiel aus der Praxis
Ein Beispiel: Ein Bauunternehmen in Solothurn möchte aus Baustellenberichten Wochenzusammenfassungen erstellen. Die Sachbearbeiterin vergleicht eine Q4- und eine Q8-Variante desselben Modells mit acht anonymisierten Berichten.
Vorher vermutet sie keinen Unterschied. Nachher zeigt der Test: Bei der Zusammenfassung sind beide Varianten ähnlich gut. Bei zwei Berichten mit Mengenangaben verwechselt die kleinere Stufe zweimal eine Zahl. Das Unternehmen setzt die höhere Stufe ein und lässt die Zahlen in jedem Fall gegenlesen. Das Testblatt mit den Bewertungen wird abgelegt, damit der Test bei einem Modellwechsel wiederholt werden kann.
So hilft Ihnen Alpasana
Einen eigenen Vergleich aufzusetzen, ist leichter mit etwas Anleitung. Die Kurse von absofort zu KI und IT für konkrete Arbeitsaufgaben behandeln lokale KI mit Ollama und Open-Source-Modellen und üben die Qualitätsprüfung von Ergebnissen an Praxisaufgaben.
Sie lernen im eigenen Tempo und können Ihre Tests direkt an Aufgaben aus Ihrem Berufsalltag ausrichten.
Häufige Fragen
Gibt es eine verlässliche Prozentzahl für den Verlust?
Allgemeine Angaben gibt es, aber sie gelten für bestimmte Modelle und Tests. Für Ihre Aufgaben und Ihr Modell sagt nur ein eigener Vergleich etwas aus.
Ist ein grösseres Modell in Q4 besser als ein kleines in Q8?
Oft ja, aber nicht immer. Beide Varianten mit eigenen Aufgaben zu testen, schafft Klarheit.
Merkt man Qualitätsverlust bei Deutsch stärker?
Häufig ist die Schwäche bei Sprachen mit weniger Trainingstexten grösser. Prüfen Sie deshalb ausdrücklich Deutsch und Schweizer Schreibweise. Siehe Schweizer Schreibweise.
Wann lohnt sich die höchste Stufe?
Wenn Genauigkeit wichtig ist, etwa bei Zahlen, Fristen oder Fachtexten, und der Speicher es erlaubt. Für Entwürfe genügt meist weniger.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- Was bedeutet Quantisierung bei einem lokalen LLM?LLM Quantisierung einfach erklärt: Warum dasselbe Sprachmodell in verschieden grossen Dateien angeboten wird und was das für Speicherbedarf und Qualität heisst.
- Welche GGUF-Quantisierung passt zu meinem Computer?GGUF Quantisierung wählen: Eine Checkliste hilft Ihnen zu verstehen, was Q4, Q5 und Q8 bedeuten und welche Variante zu Ihrem Arbeitsspeicher passt.
- Wie vergleicht man Sprachmodelle mit den eigenen Büroaufgaben?Sprachmodelle vergleichen mit eigenen Büroaufgaben: Eine Testvorlage mit Aufgaben, Bewertung und Auswertung, damit Sie das passende Modell für Ihren Alltag finden.
- Wie testen wir eine lokale KI auf erfundene Antworten?LLM Halluzinationen testen: Checkliste mit Faktenprüfung, Fangfragen und Unsicherheitstests, damit Sie erkennen, wann Ihre lokale KI überzeugend Falsches erfindet.
- Welche Modellgrösse passt zu unserem lokalen Chatbot?Modellgrösse für lokale KI wählen: Wann ein kleines Modell genügt und wann ein grösseres nötig ist. Mit Faustregeln, Testplan, Tabelle und Praxisbeispiel.