Eigene LLMs & KI-Systeme · KI und IT für konkrete Arbeitsaufgaben
Kann ein lokales LLM ohne besondere Grafikkarte laufen?
Kurz gesagt
Ja, kleine Sprachmodelle laufen auch nur mit dem Hauptprozessor und genügend Arbeitsspeicher, die Antworten kommen dann aber langsamer. Für Tests und kurze Aufgaben reicht das oft. Für viele Nutzer gleichzeitig oder grosse Modelle lohnt sich eine Grafikkarte.
Das Problem
Auf vielen Seiten steht: «Für lokale KI brauchen Sie eine teure Grafikkarte.» Das schreckt ab. Ihr Büro-PC hat keine, und die Anschaffung ohne Erfahrung ist ein Risiko.
Die gute Nachricht: Eine Grafikkarte ist keine Voraussetzung, sondern ein Beschleuniger. Sprachmodelle lassen sich auch vom Hauptprozessor (CPU) berechnen. Das geht langsamer, aber für viele Alltagsaufgaben genügt es.
Wichtig ist, dass Sie realistisch einschätzen, was «langsamer» bedeutet und wann der Aufwand sich nicht lohnt. Diese Seite zeigt, wie Sie das ohne Neukauf herausfinden.
So lösen Sie es mit KI – Schritt für Schritt
- Gerät prüfen. Ermitteln Sie Arbeitsspeicher und Prozessor. Siehe Voraussetzungen auf dem PC.
- Kleines Modell wählen. Beginnen Sie mit einem der kleinsten Modelle für Ihre Sprache. Kleine Modelle sind schneller und brauchen weniger Speicher.
- Komprimierte Fassung nehmen. Viele Modelle gibt es in «quantisierter» Form, also verkleinert, damit sie weniger Speicher benötigen. Die Qualität sinkt leicht, das Tempo steigt. Siehe Quantisierung erklärt.
- Mit kurzen Aufgaben testen. Stellen Sie drei kurze Fragen und messen Sie mit einer Uhr, wann die Antwort beginnt und wie lange sie dauert.
- Mit typischer Aufgabe testen. Nun geben Sie eine Aufgabe, die Sie wirklich haben, etwa einen Absatz zusammenfassen. Prüfen Sie Tempo und Qualität.
- Anspruch festlegen. Ist die Wartezeit für Ihre Aufgabe in Ordnung? Für Hintergrundaufgaben, die über Nacht laufen, ist langsam kein Problem. Für ein Gespräch im Chat eher.
- Entscheiden. Reicht es nicht, prüfen Sie zuerst Alternativen: kleineres Modell, kürzere Texte, anderer Arbeitsablauf. Erst dann eine Grafikkarte erwägen.
Einfach erklärt
Stellen Sie sich einen grossen Schreibtisch und zwei Arbeitsweisen vor. Der Hauptprozessor ist wie eine sehr kluge Person, die eine Aufgabe nach der anderen erledigt. Eine Grafikkarte ist wie ein grosses Team, das viele einfache Rechnungen gleichzeitig macht. Sprachmodelle bestehen aus sehr vielen einfachen Rechnungen, deshalb ist das Team viel schneller.
Aber die kluge Person schafft es auch, nur dauert es länger. Wie viel länger, hängt von drei Dingen ab:
- Grösse des Modells: Je mehr Parameter (die «Einstellschrauben» des Modells), desto mehr Rechenarbeit pro Wort.
- Arbeitsspeicher: Das Modell muss in den Speicher passen. Reicht er nicht, wird es sehr langsam oder startet nicht.
- Länge der Texte: Lange Dokumente zu lesen und zu verarbeiten dauert deutlich länger als kurze Fragen.
| Situation | Ohne Grafikkarte |
|---|---|
| Einzelne Person, kurze Aufgaben | Oft ausreichend |
| Lange Dokumente zusammenfassen | Spürbar langsamer |
| Mehrere Personen gleichzeitig | Eher ungeeignet |
| Grosses Modell | Je nach Speicher kaum nutzbar |
Worauf Sie achten müssen
- Wartezeit realistisch einschätzen: Testen Sie mit Ihren eigenen Aufgaben, nicht nur mit Demo-Fragen.
- Fehler bleiben: Auch lokale Modelle erfinden Dinge. Prüfen Sie Zahlen und Fakten.
- Wärme und Lärm: Dauerlast heizt Laptops auf. Achten Sie auf Belüftung.
- Datenschutz: Lokal läuft nur, was Sie nicht über eine Cloud-Funktion laufen lassen. Kontrollieren Sie die Einstellungen.
- Begriffe nicht verwechseln: Die Grafikkarte (GPU) ist nicht der Arbeitsspeicher. Der Arbeitsspeicher entscheidet, ob ein Modell überhaupt läuft, die Grafikkarte, wie schnell. Auch ist «lokal» nicht gleich «offline», siehe LLM offline nutzen.
- Qualität hängt nicht nur von der Hardware ab: Eine bessere Grafikkarte macht ein kleines Modell schneller, aber nicht klüger.
- Mehrere Nutzende: Wollen mehrere Personen gleichzeitig fragen, steigt der Bedarf stark. Siehe Gleichzeitige Nutzer und Hardware.
- Alternativen: Wenn die Wartezeit stört, hilft oft zuerst ein kürzerer Text oder ein kleineres Modell, bevor Sie Geld ausgeben.
Ein Beispiel aus der Praxis
Ein Beispiel: Eine Sekretärin in einer Gemeinde in Thurgau testet auf ihrem Büro-PC ein kleines Modell, um Protokollentwürfe zu glätten. Die Antworten erscheinen Wort für Wort, etwa im Lesetempo einer ruhigen Leserin. Für einen Absatz von zehn Zeilen wartet sie kurz. Das genügt ihr für diese Aufgabe, für einen Chat mit mehreren Personen gleichzeitig wäre es zu langsam.
Vorher dachte sie, sie brauche eine neue Grafikkarte. Nachher weiss sie: Für ihre Aufgabe genügt der vorhandene PC, und sie hat CHF 0 für Hardware ausgegeben. Erst wenn mehrere Personen gleichzeitig arbeiten sollen, prüft sie eine Anschaffung.
So hilft Ihnen Alpasana
Wenn Sie lokale KI Schritt für Schritt kennenlernen möchten, hilft ein Praxiskurs. Das Angebot KI und IT für konkrete Arbeitsaufgaben von absofort umfasst nach Angebotsbeschreibung unter anderem lokale KI mit Ollama und Open-Source-Modellen sowie Praxisaufgaben und einen verifizierbaren Abschluss.
Häufige Fragen
Wie viel langsamer ist es ohne Grafikkarte?
Das lässt sich nicht pauschal sagen, weil es von Modell und Gerät abhängt. Messen Sie mit Ihrer Aufgabe: Notieren Sie Zeit bis zum ersten Wort und bis zum Ende. Der direkte Vergleich auf Ihrem Gerät sagt mehr als jede Tabelle.
Hilft mehr Arbeitsspeicher statt einer Grafikkarte?
Mehr Arbeitsspeicher erlaubt grössere Modelle, macht sie aber nicht schneller. Er löst das Problem «passt nicht hinein», nicht das Problem «dauert lange».
Lohnt sich eine gebrauchte Grafikkarte?
Das kann sich lohnen, hat aber Risiken wie Garantie und Zustand. Prüfen Sie erst, ob Sie überhaupt eine brauchen. Siehe Gebrauchte GPU prüfen.
Wann ist der Zeitpunkt für eine Grafikkarte gekommen?
Wenn Sie nach dem Test sagen können: «Die Aufgabe ist sinnvoll, aber die Wartezeit hindert uns.» Oder wenn mehrere Personen gleichzeitig arbeiten sollen. Bis dahin sammeln Sie am besten Erfahrung mit der vorhandenen Hardware und halten fest, wie oft die KI genutzt wird. Diese Zahlen helfen später bei der Auswahl und beim Gespräch mit der Geschäftsleitung.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.
Quellen
Weiterlesen in der Galaxie
- Welche Voraussetzungen braucht ein lokales LLM auf dem PC?LLM lokal PC Voraussetzungen: Checkliste zu Arbeitsspeicher, Speicherplatz, Grafikkarte und Betriebssystem, um eine lokale KI auf dem eigenen PC zu testen.
- Was sagt die Parameterzahl über ein KI-Modell aus?LLM Parameter Bedeutung einfach erklärt: Was «7B» oder «70B» heisst, was die Zahl über Speicherbedarf und Leistung verrät und was sie nicht verrät.
- Was bedeutet Quantisierung bei einem lokalen LLM?LLM Quantisierung einfach erklärt: Warum dasselbe Sprachmodell in verschieden grossen Dateien angeboten wird und was das für Speicherbedarf und Qualität heisst.
- Welche Hardware brauche ich für lokale KI?Lokale KI Hardware: Checkliste zu Arbeitsspeicher, Grafikkarte, Prozessor und Speicherplatz, damit Sie vor dem Kauf wissen, was Ihr Computer schafft.
- Ollama erkennt die Grafikkarte nicht: Was prüfen?Ollama GPU nicht erkannt: Checkliste zu Grafiktreibern, Hardware-Unterstützung und Kontrolle, ob Ihr Modell auf Grafikkarte oder Prozessor läuft.
- Einen eigenen Chatbot kostenlos testen: Worauf achten?Eigenen Chatbot kostenlos erstellen und testen: Checkliste zu Gratis-Tarifen, Testdaten und Einschränkungen für einen aussagekräftigen Test.