Eigene LLMs & KI-Systeme · KI-Beratung und digitale Transformation
LoRA oder QLoRA: Was bedeutet das für den Speicherbedarf?
Kurz gesagt
Bei LoRA wird nur ein kleiner Zusatz zum Sprachmodell trainiert, das Grundmodell bleibt unverändert. QLoRA geht einen Schritt weiter und lädt das Grundmodell in verkleinerter Form, was weniger Grafikspeicher braucht, aber etwas Genauigkeit und Rechenzeit kosten kann. Welche Methode passt, zeigt ein kleiner Test auf Ihrer Hardware.
Das Problem
Sie möchten ein Sprachmodell auf Ihre Aufgaben trainieren, zum Beispiel auf Ihren Schreibstil oder auf feste Antwortformate. Im Internet lesen Sie, dass sich ein Modell mit der Methode «LoRA» oder «QLoRA» auch auf normaler Hardware anpassen lässt. Aber was ist der Unterschied? Und reicht Ihre Grafikkarte?
Das Training eines grossen Sprachmodells braucht viel Speicher auf der Grafikkarte (VRAM). Wer alle Zahlen des Modells ändern will, braucht ein Mehrfaches dessen, was ein einfacher Chat benötigt. Für kleine Betriebe ist das meist unrealistisch. LoRA und QLoRA sind Wege, den Bedarf zu senken.
Beide Begriffe klingen technisch, lassen sich aber gut vergleichen. Eine KI (ein Programm, das Texte versteht und schreibt) kann Ihnen helfen, Ihre Hardware und Ziele zu ordnen. Ob die Methode wirklich auf Ihrem Rechner läuft, müssen Sie ausprobieren.
So lösen Sie es mit KI – Schritt für Schritt
- Begriffe klären: Ein Sprachmodell besteht aus Milliarden von Zahlen, den Gewichten. Beim vollständigen Training werden alle verändert. Bei LoRA (Low-Rank Adaptation) bleiben die Gewichte des Grundmodells eingefroren, und nur kleine zusätzliche Bausteine, sogenannte Adapter, werden trainiert.
- QLoRA verstehen: Bei QLoRA wird das eingefrorene Grundmodell zusätzlich in einer stark verkleinerten Zahlenform (quantisiert, meist 4 Bit) geladen. Die Adapter werden weiterhin trainiert. Das spart nochmals Speicher.
- Ihr Ziel formulieren: Wollen Sie Stil, Format oder Fachsprache anpassen? Oder neues Faktenwissen vermitteln? Für Fakten ist Training oft die falsche Wahl, siehe RAG oder Fine-Tuning.
- Hardware erfassen: Notieren Sie Grafikkarte, Grafikspeicher (VRAM), Arbeitsspeicher und Betriebssystem. Das ist die Grundlage für die Wahl.
- Modellgrösse wählen: Kleinere Modelle brauchen weniger Speicher. Beginnen Sie klein, bevor Sie grosse Modelle versuchen.
- Vergleich anstellen: Lassen Sie die KI beide Methoden gegenüberstellen, mit Ihren Angaben als Rahmen.
- Kleinen Test durchführen: Probieren Sie mit wenigen Beispielen, ob das Training auf Ihrer Hardware startet und stabil läuft.
- Qualität prüfen: Vergleichen Sie Antworten mit und ohne Training an festen Testfragen. Prüfen Sie, ob QLoRA gegenüber LoRA spürbar schlechtere Ergebnisse liefert.
Vorlage zum Kopieren
Du hilfst mir, zwischen LoRA und QLoRA für ein lokales Training zu entscheiden. Deutsch (Schweiz), einfache Sprache, ohne unnötige Fachwörter.
Mein Ziel: [z. B. Schreibstil und Antwortformat eines Sprachmodells anpassen]
Meine Hardware: Grafikkarte [Modell], VRAM [GB], Arbeitsspeicher [GB], Betriebssystem [Name]
Geplante Modellgrösse: [z. B. klein/mittel, Parameterzahl falls bekannt]
Aufgabe: 1. Erkläre den Unterschied zwischen LoRA und QLoRA in fünf Sätzen. 2. Erstelle eine Tabelle mit Speicherbedarf (qualitativ: niedriger/höher), Rechenzeit, Qualität, Aufwand beim Einrichten. 3. Nenne die Faktoren, die den Speicherbedarf beim Training bestimmen. 4. Schlage einen kleinen Testplan vor, mit dem ich auf meiner Hardware prüfen kann, welche Methode läuft.
Nenne keine genauen Speicherzahlen, wenn du sie nicht sicher weisst, und weise darauf hin, was ich selbst messen muss.Setzen Sie Ihre Hardwaredaten ein. Konkrete Speicherzahlen messen Sie im Test selbst, denn sie hängen von Modell, Einstellungen und Software ab.
Worauf Sie achten müssen
- Zahlen aus dem Netz sind Richtwerte: Der Speicherbedarf hängt von Modell, Textlänge, Stapelgrösse und Software ab. Verlassen Sie sich auf eigene Messungen.
- Qualität kann leiden: Stark verkleinerte Modelle können Details verlieren. Prüfen Sie mit Ihren Testfragen, ob die Ergebnisse genügen.
- Lizenz des Grundmodells: Nicht jedes offene Modell darf geschäftlich angepasst oder weitergegeben werden. Prüfen Sie die Lizenz.
- Trainingsdaten: Daten mit Personenbezug oder Rechten Dritter brauchen Vorbereitung. Siehe Fine-Tuning-Daten anonymisieren.
- Training ist nicht Wissen: Ein trainiertes Modell kann Fakten falsch wiedergeben. Aktuelle Inhalte gehören besser in eine Suche.
- Fachwissen nötig: Die Einrichtung verlangt technisches Verständnis. Planen Sie Zeit oder fachliche Unterstützung ein.
Ein Beispiel aus der Praxis
Ein Beispiel: Ein Ingenieurbüro in Winterthur möchte ein lokales Sprachmodell so anpassen, dass es technische Berichte im hausüblichen Stil formuliert. Der IT-Verantwortliche hat einen Arbeitsplatzrechner mit einer Mittelklasse-Grafikkarte.
Vorher: Er versucht, ein Modell vollständig zu trainieren, und die Software bricht mit einer Speicherfehlermeldung ab.
Nachher: Er wechselt zu LoRA mit einem kleineren Modell. Das Training startet, ist aber knapp. Mit QLoRA läuft es stabil, braucht aber mehr Zeit. Er vergleicht die Ergebnisse an 30 Testfragen und stellt fest, dass der Stil in beiden Fällen gut getroffen wird. Er entscheidet sich für QLoRA, weil es auf seiner Hardware zuverlässig läuft.
| Kriterium | LoRA | QLoRA |
|---|---|---|
| Was wird trainiert? | kleine Adapter | kleine Adapter |
| Grundmodell | in normaler Genauigkeit | verkleinert (quantisiert) |
| Speicherbedarf | geringer als Vollstraining | nochmals geringer |
| Rechenzeit | meist kürzer | oft etwas länger |
| Qualität | sehr nahe am Vollstraining | kann leicht abweichen |
Die Tabelle zeigt Tendenzen, keine festen Werte. Prüfen Sie jede Annahme an Ihrer eigenen Hardware.
So hilft Ihnen Alpasana
Bevor Sie Hardware und Zeit in ein Training stecken, lohnt die Frage, ob es die einfachste Lösung ist. Die KI-Beratung und digitale Transformation von Alpasana hilft, KI-Potenziale zu analysieren, Vorhaben zu priorisieren und einen Umsetzungsplan zu erstellen. Bei KI-Agenten gehören Anwendungsfall, Pilot und Einsatzregeln dazu.
Projekte werden individuell offeriert. Eine Einführung zu LoRA finden Sie in LoRA einfach erklärt.
Häufige Fragen
Ist QLoRA immer besser, weil es weniger Speicher braucht?
Nicht unbedingt. Es spart Speicher, kann aber langsamer sein und die Genauigkeit leicht beeinflussen. Wenn Ihre Hardware LoRA verkraftet, ist das oft die einfachere Wahl.
Brauche ich dafür eine teure Grafikkarte?
Das hängt vom Modell ab. Kleine Modelle lassen sich mit weniger Speicher anpassen. Mehr dazu in Wie viel Grafikspeicher braucht ein Sprachmodell?.
Verändert LoRA das Originalmodell?
Nein. Die Adapter liegen als separate Dateien vor und werden beim Einsatz dazugeladen. Das Grundmodell bleibt unverändert, was Tests und Rückgängigmachen erleichtert.
Reicht ein Chat-Modell, um LoRA zu testen?
Ein Chat läuft auf ähnlicher Hardware, braucht aber deutlich weniger Speicher als das Training. Warum das so ist, erklärt Warum braucht Training mehr Grafikspeicher als der KI-Chat?.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- Was ist LoRA und wie verändert es ein KI-Modell?LoRA einfach erklärt: Wie ein kleiner Zusatz (Adapter) ein grosses Sprachmodell anpasst, ohne das ganze Modell neu zu trainieren, und wann das sinnvoll ist.
- Warum braucht Training mehr Grafikspeicher als der KI-Chat?Fine-Tuning Grafikspeicher: Warum ein Modell im Chat läuft, sich aber nicht trainieren lässt, und welche Posten beim Training zusätzlich Speicher brauchen.
- Was bedeutet Quantisierung bei einem lokalen LLM?LLM Quantisierung einfach erklärt: Warum dasselbe Sprachmodell in verschieden grossen Dateien angeboten wird und was das für Speicherbedarf und Qualität heisst.
- Fine-Tuning lokal vorbereiten: Welche Schritte sind nötig?Fine-Tuning lokal vorbereiten: Checkliste mit Zielklärung, Daten, Hardware, Basismodell, Testset und Abnahme, bevor Sie ein lokales Training starten.
- Wie viel Grafikspeicher braucht mein KI-Modell?LLM VRAM Bedarf einschätzen: So rechnen Sie vor dem Kauf einer Grafikkarte, wie viel Grafikspeicher ein Sprachmodell mit Kontext wirklich benötigt.