Zum Inhalt springen

Eigene LLMs & KI-Systeme · Begriff · KI und IT für konkrete Arbeitsaufgaben

Was bedeutet Quantisierung bei einem lokalen LLM?

Stand 10.10.2026 · 2 Min. Lesezeit

Kurz gesagt

Quantisierung ist eine Art Komprimierung: Die Zahlen im Innern eines Sprachmodells werden mit weniger Genauigkeit gespeichert. Die Datei wird kleiner und das Modell läuft auf schwächerer Hardware, dafür kann die Qualität leicht sinken. Deshalb gibt es dasselbe Modell in mehreren Grössen.

Einfach erklärt

Auf einer Download-Seite für Sprachmodelle finden Sie dasselbe Modell in mehreren Versionen, zum Beispiel mit Kürzeln wie «Q4» oder «Q8», und die Dateien sind unterschiedlich gross. Dahinter steckt die Quantisierung.

Ein Sprachmodell besteht aus Milliarden von Zahlen, den Gewichten. Jede Zahl wird mit einer bestimmten Genauigkeit gespeichert, vergleichbar mit der Anzahl Nachkommastellen. Bei der Quantisierung werden die Zahlen gröber gerundet. Statt «3,14159265» steht dann «3,14». Das spart Platz.

Ein Vergleich: Ein Foto in sehr hoher Auflösung ist gross, ein verkleinertes Foto belegt weniger Speicher und lädt schneller. Für den Alltag sieht man den Unterschied oft kaum, bei starker Verkleinerung aber verschwinden Details.

Was bedeutet das für Ihre Entscheidung?

  • Kleinere Datei: Das Modell passt in weniger Arbeits- oder Grafikspeicher und läuft auf günstigerer Hardware.
  • Oft auch schneller: Es müssen weniger Daten bewegt werden.
  • Mögliche Qualitätseinbusse: Bei mässiger Quantisierung ist der Unterschied häufig gering, bei sehr starker können Antworten ungenauer werden, besonders bei Zahlen, Fachbegriffen und Deutsch.

Als Faustregel gilt: Die mittleren Stufen sind ein häufiger Kompromiss. Wie gut sie für Ihre Aufgaben genügen, zeigt nur ein Test. Wichtig zu wissen: Quantisierung ändert nichts am Wissen des Modells, sie verändert nur die Genauigkeit, mit der es rechnet. Das Modell kennt also weiterhin dieselben Dinge, kann sie aber unter Umständen weniger zuverlässig abrufen.

Mehr dazu unter Quantisierung und Qualität und GGUF-Quantisierung auswählen.

Ein Beispiel: Ein Handwerksbetrieb in Sarnen möchte ein Modell auf einem Büro-PC mit begrenztem Arbeitsspeicher betreiben. Die unkomprimierte Version passt nicht. Eine stärker quantisierte Version läuft, liefert aber bei Berechnungen von Materialmengen ab und zu falsche Zahlen. Der Betrieb wählt deshalb eine mittlere Stufe und lässt Rechnungen weiterhin vom Menschen prüfen.

Stufe (vereinfacht)DateigrösseQualitätTypischer Einsatz
Schwach komprimiertGrossHochServer mit viel Speicher
Mittel komprimiertMittelMeist gutHäufige Wahl
Stark komprimiertKleinTeils spürbar tieferKnappe Hardware, Tests

So hilft Ihnen Alpasana

Wer die Auswahl und Einrichtung lokaler Modelle verstehen möchte, findet in den Kursen von absofort eine Grundlage. Die Angebote KI und IT für konkrete Arbeitsaufgaben umfassen nach Beschreibung lokale KI mit Ollama und Open-Source-Modellen, mit Praxisaufgaben und KI-Lerncoach.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie