Eigene LLMs & KI-Systeme · KI und IT für konkrete Arbeitsaufgaben
Welche GGUF-Quantisierung passt zu meinem Computer?
Kurz gesagt
Eine Quantisierung verkleinert ein KI-Modell, indem sie die Zahlen darin gröber speichert. Für viele Einsteiger ist eine mittlere Stufe wie Q4 oder Q5 ein guter Start. Wählen Sie die grösste Variante, die komfortabel in Ihren Speicher passt, und testen Sie sie mit Ihren eigenen Aufgaben.
Das Problem
Frau Müller hat sich für ein Modell entschieden. Auf der Downloadseite stehen aber zehn Varianten: Q2_K, Q3_K_M, Q4_K_M, Q5_K_M, Q6_K, Q8_0. Die Dateigrössen reichen von knapp zwei bis weit über zehn Gigabyte. Welche ist die richtige?
Diese Kürzel beschreiben die Quantisierung. Das ist eine Art Komprimierung: Das Modell besteht aus Milliarden Zahlen, und jede Zahl wird mit weniger Genauigkeit gespeichert, damit die Datei kleiner wird und weniger Arbeitsspeicher braucht. Das spart Platz, kostet aber etwas Qualität.
Wählt man zu gross, passt das Modell nicht in den Speicher. Wählt man zu klein, leidet die Qualität. Mit einer kurzen Checkliste finden Sie den Mittelweg.
So lösen Sie es mit KI – Schritt für Schritt
- Notieren Sie Ihren Speicher. Wie viel Arbeitsspeicher (RAM) hat der Computer? Hat er eine Grafikkarte, wie viel Grafikspeicher (VRAM)? Diese Zahlen sind entscheidend.
- Verstehen Sie die Zahl im Namen. «Q4» bedeutet grob vier Bit pro Zahl, «Q8» acht Bit. Weniger Bit heisst kleinere Datei und gröbere Genauigkeit. Der Zusatz (etwa «K_M») beschreibt eine bestimmte Bauart. Für den Einstieg reicht die Grundstufe.
- Rechnen Sie grob mit Faustregeln. Eine Modelldatei in Q4 braucht ungefähr ein halbes Byte pro Modellparameter, Q8 etwa ein Byte. Ein Modell mit 7 Milliarden Parametern ist in Q4 also grob 4 bis 5 Gigabyte gross. Das ist eine Schätzung; massgeblich ist die Dateigrösse auf der Seite.
- Planen Sie Reserve ein. Zusätzlich zur Datei brauchen das Betriebssystem, das Programm und das Gesprächsgedächtnis Platz. Rechnen Sie grosszügig mit mindestens zwei bis vier Gigabyte Reserve. Mehr dazu unter Gesprächslänge und Speicher.
- Wählen Sie eine mittlere Stufe zum Start. Meist ist Q4 oder Q5 ein sinnvoller Ausgangspunkt. Q8 ist genauer, braucht aber deutlich mehr Platz.
- Testen Sie mit Ihren Aufgaben. Lassen Sie dieselben fünf Aufgaben mit zwei Varianten bearbeiten und vergleichen Sie. Siehe Qualität bei Quantisierung.
- Wechseln Sie bei Bedarf. Zu langsam oder zu ungenau? Probieren Sie die nächste Stufe.
- Halten Sie das Ergebnis fest. Notieren Sie Modell, Variante, Dateigrösse und Beobachtungen.
Vorlage zum Kopieren
Ich möchte ein KI-Modell lokal betreiben und die passende Quantisierung wählen.
Mein Computer: [Modell, Betriebssystem]
Arbeitsspeicher (RAM): [Gigabyte]
Grafikkarte und Grafikspeicher (VRAM): [Angabe oder «keine»]
Modell: [Name], etwa [Zahl] Milliarden Parameter
Verfügbare Varianten mit Dateigrösse: [Liste, z. B. Q4_K_M 4.4 GB, Q5_K_M 5.2 GB, Q8_0 7.7 GB]
Meine Aufgaben: [z. B. E-Mails entwerfen, Texte zusammenfassen]
Aufgabe:
1. Erkläre in einfachen Worten, was die genannten Varianten unterscheidet.
2. Sage, welche Varianten wahrscheinlich in meinen Speicher passen, und erwähne die Reserve für Betriebssystem und Gesprächsverlauf.
3. Empfiehl eine Variante zum Starten und eine zum Vergleich.
4. Kennzeichne Schätzungen als Schätzungen. Erfinde keine Messwerte zu Geschwindigkeit oder Qualität.Die Antwort ist eine Orientierung. Prüfen Sie sie durch einen kurzen Test auf Ihrem Computer.
| Stufe | Dateigrösse | Qualität | Typische Wahl |
|---|---|---|---|
| Q2/Q3 | sehr klein | merklicher Verlust | Nur wenn sonst nichts passt |
| Q4 | klein | meist gut | Guter Start |
| Q5/Q6 | mittel | sehr nah am Original | Wenn Platz da ist |
| Q8 | gross | nahezu Original | Bei viel Speicher |
Worauf Sie achten müssen
- Faustregeln sind Schätzungen: Der tatsächliche Bedarf hängt von Programm, Gesprächslänge und Modell ab. Planen Sie Reserve ein.
- Qualitätsverlust bleibt unbemerkt: Stark komprimierte Modelle schreiben oft noch flüssig, machen aber mehr Fehler bei Zahlen und Fakten. Kontrollieren Sie Ergebnisse, besonders bei wichtigen Texten.
- Vertraulichkeit: Lokale Modelle halten Daten im Haus, aber nur, wenn das Programm nichts an Dritte sendet. Prüfen Sie die Einstellungen.
- Quelle der Datei: Laden Sie Varianten von bekannten Anbietern, siehe Hugging-Face-Modelle herunterladen.
- Lizenz: Auch komprimierte Fassungen unterliegen der Modelllizenz.
Ein Beispiel aus der Praxis
Ein Beispiel: Eine Gemeindeverwaltung im Kanton Bern testet eine lokale KI auf einem Arbeitsplatz-PC mit 16 Gigabyte Arbeitsspeicher und ohne eigene Grafikkarte. Sie möchte Textentwürfe und Zusammenfassungen erstellen.
Vorher lädt der IT-Mitarbeiter eine sehr grosse Variante. Der Rechner wird träge, das Modell lädt kaum. Nachher wählt er eine mittlere Stufe eines kleineren Modells, sodass genügend Speicher frei bleibt. Er lässt dieselben fünf Aufgaben mit zwei Stufen laufen, vergleicht die Ergebnisse und entscheidet sich für die höhere, weil sie bei Zahlen genauer bleibt. Die Notizen dazu legt er im Projektordner ab.
So hilft Ihnen Alpasana
Die Wahl der Modellvariante ist Teil einer grösseren Frage: Was soll lokale KI im Betrieb leisten? Der Kurs von absofort zu KI und IT für konkrete Arbeitsaufgaben behandelt lokale KI mit Ollama und Open-Source-Modellen als Teil des Angebots, mit Praxisaufgaben und KI-Lerncoach.
So üben Sie an konkreten Aufgaben, wie man Modelle auswählt und Ergebnisse prüft.
Häufige Fragen
Was bedeutet das «K_M» im Namen?
Es beschreibt eine bestimmte Bauart der Komprimierung («K-Quants», Variante «Medium»). Für den Einstieg müssen Sie das nicht genau verstehen: Vergleichen Sie Varianten über Dateigrösse und Test.
Ist Q8 immer besser?
Sie ist genauer, aber auch viel grösser und oft langsamer. Wenn der Unterschied zu Q5 für Ihre Aufgaben nicht sichtbar ist, lohnt sich der Mehrverbrauch nicht.
Kann ich ein kleineres Modell in hoher Qualität statt ein grosses in Q2 nehmen?
Das ist oft die bessere Wahl. Ein kleines Modell in guter Stufe antwortet häufig zuverlässiger als ein grosses, stark komprimiertes. Testen Sie beides.
Muss ich die Quantisierung selbst machen?
Nein. Für beliebte Modelle gibt es fertige Varianten zum Download. Prüfen Sie nur die Herkunft.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.
Quellen
Weiterlesen in der Galaxie
- Was bedeutet Quantisierung bei einem lokalen LLM?LLM Quantisierung einfach erklärt: Warum dasselbe Sprachmodell in verschieden grossen Dateien angeboten wird und was das für Speicherbedarf und Qualität heisst.
- Wie stark leidet die KI-Qualität durch Quantisierung?LLM Quantisierung Qualität: Wie viel Genauigkeit eine komprimierte KI verliert, woran Sie es erkennen und wie Sie den Verlust bei Ihren Aufgaben selbst prüfen.
- Wie viel Arbeitsspeicher braucht ein lokales LLM?LLM RAM Bedarf selbst berechnen: Mit einer einfachen Faustregel schätzen Sie, ob der Arbeitsspeicher Ihres Rechners für ein lokales Sprachmodell reicht.
- Safetensors oder GGUF: Welche Modelldatei brauche ich?Safetensors vs GGUF: Der Unterschied einfach erklärt und welche Modelldatei Sie für Ollama, LM Studio oder eigene Programme herunterladen sollten.
- Welche Modellgrösse passt zu unserem lokalen Chatbot?Modellgrösse für lokale KI wählen: Wann ein kleines Modell genügt und wann ein grösseres nötig ist. Mit Faustregeln, Testplan, Tabelle und Praxisbeispiel.
- Lohnt sich ein Chatbot für ein kleines Unternehmen?Chatbot für kleine Unternehmen: Wann sich ein Chatbot für KMU lohnt, wann nicht, und wie Sie Nutzen und Aufwand ehrlich einschätzen, bevor Sie investieren.