Eigene LLMs & KI-Systeme · Begriff · KI und IT für konkrete Arbeitsaufgaben
Was bedeutet Quantisierung bei einem lokalen LLM?
Kurz gesagt
Quantisierung ist eine Art Komprimierung: Die Zahlen im Innern eines Sprachmodells werden mit weniger Genauigkeit gespeichert. Die Datei wird kleiner und das Modell läuft auf schwächerer Hardware, dafür kann die Qualität leicht sinken. Deshalb gibt es dasselbe Modell in mehreren Grössen.
Einfach erklärt
Auf einer Download-Seite für Sprachmodelle finden Sie dasselbe Modell in mehreren Versionen, zum Beispiel mit Kürzeln wie «Q4» oder «Q8», und die Dateien sind unterschiedlich gross. Dahinter steckt die Quantisierung.
Ein Sprachmodell besteht aus Milliarden von Zahlen, den Gewichten. Jede Zahl wird mit einer bestimmten Genauigkeit gespeichert, vergleichbar mit der Anzahl Nachkommastellen. Bei der Quantisierung werden die Zahlen gröber gerundet. Statt «3,14159265» steht dann «3,14». Das spart Platz.
Ein Vergleich: Ein Foto in sehr hoher Auflösung ist gross, ein verkleinertes Foto belegt weniger Speicher und lädt schneller. Für den Alltag sieht man den Unterschied oft kaum, bei starker Verkleinerung aber verschwinden Details.
Was bedeutet das für Ihre Entscheidung?
- Kleinere Datei: Das Modell passt in weniger Arbeits- oder Grafikspeicher und läuft auf günstigerer Hardware.
- Oft auch schneller: Es müssen weniger Daten bewegt werden.
- Mögliche Qualitätseinbusse: Bei mässiger Quantisierung ist der Unterschied häufig gering, bei sehr starker können Antworten ungenauer werden, besonders bei Zahlen, Fachbegriffen und Deutsch.
Als Faustregel gilt: Die mittleren Stufen sind ein häufiger Kompromiss. Wie gut sie für Ihre Aufgaben genügen, zeigt nur ein Test. Wichtig zu wissen: Quantisierung ändert nichts am Wissen des Modells, sie verändert nur die Genauigkeit, mit der es rechnet. Das Modell kennt also weiterhin dieselben Dinge, kann sie aber unter Umständen weniger zuverlässig abrufen.
Mehr dazu unter Quantisierung und Qualität und GGUF-Quantisierung auswählen.
Ein Beispiel: Ein Handwerksbetrieb in Sarnen möchte ein Modell auf einem Büro-PC mit begrenztem Arbeitsspeicher betreiben. Die unkomprimierte Version passt nicht. Eine stärker quantisierte Version läuft, liefert aber bei Berechnungen von Materialmengen ab und zu falsche Zahlen. Der Betrieb wählt deshalb eine mittlere Stufe und lässt Rechnungen weiterhin vom Menschen prüfen.
| Stufe (vereinfacht) | Dateigrösse | Qualität | Typischer Einsatz |
|---|---|---|---|
| Schwach komprimiert | Gross | Hoch | Server mit viel Speicher |
| Mittel komprimiert | Mittel | Meist gut | Häufige Wahl |
| Stark komprimiert | Klein | Teils spürbar tiefer | Knappe Hardware, Tests |
So hilft Ihnen Alpasana
Wer die Auswahl und Einrichtung lokaler Modelle verstehen möchte, findet in den Kursen von absofort eine Grundlage. Die Angebote KI und IT für konkrete Arbeitsaufgaben umfassen nach Beschreibung lokale KI mit Ollama und Open-Source-Modellen, mit Praxisaufgaben und KI-Lerncoach.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- Wie stark leidet die KI-Qualität durch Quantisierung?LLM Quantisierung Qualität: Wie viel Genauigkeit eine komprimierte KI verliert, woran Sie es erkennen und wie Sie den Verlust bei Ihren Aufgaben selbst prüfen.
- Welche GGUF-Quantisierung passt zu meinem Computer?GGUF Quantisierung wählen: Eine Checkliste hilft Ihnen zu verstehen, was Q4, Q5 und Q8 bedeuten und welche Variante zu Ihrem Arbeitsspeicher passt.
- Welche Modellgrösse passt zu unserem lokalen Chatbot?Modellgrösse für lokale KI wählen: Wann ein kleines Modell genügt und wann ein grösseres nötig ist. Mit Faustregeln, Testplan, Tabelle und Praxisbeispiel.
- Wie viel Grafikspeicher braucht mein KI-Modell?LLM VRAM Bedarf einschätzen: So rechnen Sie vor dem Kauf einer Grafikkarte, wie viel Grafikspeicher ein Sprachmodell mit Kontext wirklich benötigt.
- Was sagt die Parameterzahl über ein KI-Modell aus?LLM Parameter Bedeutung einfach erklärt: Was «7B» oder «70B» heisst, was die Zahl über Speicherbedarf und Leistung verrät und was sie nicht verrät.