Eigene LLMs & KI-Systeme · KI-Beratung und digitale Transformation
Ein LLM auf mehreren Grafikkarten betreiben: Was beachten?
Kurz gesagt
Viele Programme können ein grosses Modell auf mehrere Grafikkarten verteilen, sodass sich deren Speicher addiert. Das setzt passende Software, ausreichende Stromversorgung, Platz und Kühlung voraus. Die Geschwindigkeit steigt dabei nicht im gleichen Mass wie die Anzahl der Karten.
Das Problem
Im Betrieb liegen zwei ältere Grafikkarten, die nicht mehr gebraucht werden. Frau Müllers IT-Kollege fragt: «Können wir beide zusammen für ein grösseres KI-Modell einsetzen? Dann hätten wir doppelt so viel Speicher.»
Die Idee ist nicht abwegig. Ein KI-Modell muss in den Grafikspeicher passen, damit es schnell läuft. Reicht eine Karte nicht aus, können manche Programme das Modell auf mehrere Karten verteilen.
Allerdings ist es nicht so einfach wie «zwei Karten, doppelte Leistung». Es gibt Voraussetzungen und Grenzen bei Programmen, Hardware und Geschwindigkeit. Wer sie vorab klärt, spart sich Geld und Frust.
So lösen Sie es mit KI – Schritt für Schritt
- Ermitteln Sie die Ausgangslage. Notieren Sie von jeder Karte Modell, Hersteller und Grafikspeicher. Gleiche Karten sind einfacher zu verwalten als unterschiedliche.
- Klären Sie das Ziel. Wollen Sie ein grösseres Modell laden, das auf eine Karte nicht passt, oder mehr Geschwindigkeit? Das Erste ist leichter zu erreichen als das Zweite.
- Prüfen Sie die Software. Viele gängige Programme für lokale KI können Modelle auf mehrere Grafikkarten aufteilen, etwa llama.cpp-basierte Werkzeuge. Lesen Sie in der aktuellen Dokumentation, wie das Programm das macht und für welche Hersteller.
- Verstehen Sie die Aufteilung. Das Modell wird in Abschnitte geteilt, jede Karte hält einen Teil. Dadurch addiert sich der nutzbare Speicher ungefähr, aber nicht verlustfrei, denn zusätzlich braucht jede Karte Platz für Zwischenspeicher.
- Prüfen Sie Mainboard und Stromversorgung. Passen beide Karten physisch ins Gehäuse, und hat das Mainboard genug Steckplätze mit ausreichender Anbindung? Reicht das Netzteil für beide Karten bei Volllast? Eine Elektrofachperson oder die IT-Betreuung prüft das.
- Planen Sie Kühlung und Lärm. Zwei Karten erzeugen mehr Wärme. Siehe Wärme und Lärm.
- Testen Sie in kleinem Rahmen. Laden Sie ein Modell, das sicher nicht auf eine Karte passt, und prüfen Sie Auslastung und Geschwindigkeit. Siehe Hardware testen.
- Entscheiden Sie nach Messung. Vergleichen Sie die Lösung mit einer einzelnen grösseren Karte, siehe Grafikspeicher-Bedarf.
Vorlage zum Kopieren
Ich möchte klären, ob wir vorhandene Grafikkarten gemeinsam für ein grösseres KI-Modell nutzen können.
Vorhandene Karten: [Modell, Hersteller, Grafikspeicher je Karte]
Rechner: [Mainboard/Gehäuse/Netzteil-Leistung, soweit bekannt]
Betriebssystem: [Windows / Linux]
Programm: [Ollama / llama.cpp / anderes]
Ziel-Modell: [Name, ungefähre Grösse und gewünschte Komprimierung]
Aufgabe:
1. Erstelle eine Checkliste mit Punkten, die ich vor dem gemeinsamen Betrieb mehrerer Grafikkarten klären muss (Software-Unterstützung, Hersteller und Mischbetrieb, Steckplätze und Anbindung, Netzteil, Gehäuse und Kühlung, Treiber).
2. Erkläre, was bei der Aufteilung des Modells auf mehrere Karten passiert und warum die Geschwindigkeit nicht im gleichen Mass wächst.
3. Nenne Risiken und Warnzeichen, auf die ich beim Test achten soll.
4. Gib keine Messwerte an, die du nicht kennst, und mach keine Annahmen über meine Hardware, die ich nicht genannt habe.Besprechen Sie die Antworten mit Ihrer IT-Betreuung, bevor Sie Hardware einbauen oder bestellen.
| Frage | Warum wichtig |
|---|---|
| Unterstützt das Programm die Aufteilung? | Ohne Unterstützung bleibt eine Karte ungenutzt |
| Gleiche oder verschiedene Karten? | Verschiedene können Einschränkungen haben |
| Reicht das Netzteil? | Überlast kann das System gefährden |
| Passen beide Karten ins Gehäuse? | Platz und Luftzufuhr |
| Wie gut ist die Anbindung? | Beeinflusst die Geschwindigkeit |
Worauf Sie achten müssen
- Elektrische Sicherheit: Stromversorgung und Gehäuse müssen die Last tragen. Lassen Sie den Aufbau von einer Fachperson ausführen. Pfuscharbeiten können Brand- und Schadenrisiken bergen.
- Lärm und Wärme: Mehr Karten bedeuten mehr Abwärme und Lüfterlärm. Planen Sie den Aufstellort entsprechend.
- Software ändert sich: Unterstützung und Einstellungen verändern sich mit neuen Programmversionen. Lesen Sie die aktuelle Dokumentation.
- Gemischte Karten: Verschiedene Modelle oder Hersteller sind möglich, aber anfälliger für Probleme und oft langsamer. Planen Sie Testzeit ein.
- Kosten: Strom, Netzteil, Gehäuse und Arbeitszeit können die Ersparnis gegenüber einer einzelnen grösseren Karte aufheben.
- Gesamtbild: Manchmal ist ein kleineres, komprimiertes Modell auf einer Karte die einfachere Lösung. Siehe GPU und CPU aufteilen.
Ein Beispiel aus der Praxis
Ein Beispiel: Eine Planungsfirma in St. Gallen hat nach einer Rechner-Erneuerung zwei gebrauchte, gleiche Grafikkarten übrig. Die IT möchte ein grösseres Sprachmodell testen, das auf eine Karte nicht passt.
Vorher ist unklar, ob der Rechner beide Karten tragen kann. Nachher prüft die IT-Betreuung Steckplätze, Netzteil und Kühlung und ersetzt das Netzteil durch ein stärkeres. Das Programm verteilt das Modell auf beide Karten, und es lädt. Die Antwortgeschwindigkeit ist brauchbar, aber nicht doppelt so hoch wie bei einer einzelnen Karte. Das Büro nutzt die Lösung für interne Tests, dokumentiert Aufbau und Kosten und prüft, ob eine einzelne grössere Karte langfristig besser wäre.
So hilft Ihnen Alpasana
Bevor Sie Hardware zusammenbauen, lohnt sich die Frage, welcher Nutzen damit erreicht werden soll. Die KI-Beratung und digitale Transformation von Alpasana unterstützt dabei, KI-Potenziale zu analysieren, Vorhaben zu priorisieren und einen Umsetzungsplan zu erstellen.
So entscheiden Sie anhand Ihrer Aufgaben, ob Eigenbau, Kauf oder ein anderer Weg sinnvoll ist. Projekte werden individuell offeriert.
Häufige Fragen
Addiert sich der Grafikspeicher einfach?
Ungefähr, aber nicht vollständig. Jede Karte braucht zusätzlichen Platz für Zwischenspeicher, und die Aufteilung ist nicht immer gleichmässig. Planen Sie Reserve ein.
Müssen die Karten gleich sein?
Nicht zwingend, aber gleiche Karten machen es einfacher. Bei gemischten Karten ist die Einrichtung anspruchsvoller.
Wird es mit zwei Karten doppelt so schnell?
Nein. Meist bringt die Aufteilung vor allem mehr Speicher. Die Geschwindigkeit hängt von Software, Anbindung und Modell ab.
Ist das für ein kleines Büro sinnvoll?
Nur, wenn ohnehin Karten vorhanden sind und eine Fachperson den Aufbau übernimmt. Sonst ist ein Rechner mit einer geeigneten einzelnen Karte oft einfacher.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- Wie viel Grafikspeicher braucht mein KI-Modell?LLM VRAM Bedarf einschätzen: So rechnen Sie vor dem Kauf einer Grafikkarte, wie viel Grafikspeicher ein Sprachmodell mit Kontext wirklich benötigt.
- NVIDIA oder AMD: Was ist beim KI-Betrieb zu prüfen?NVIDIA AMD lokale KI im Vergleich: Welche Fragen zu Treibern, Software-Unterstützung und Betriebssystem Sie vor dem Kauf einer Grafikkarte klären sollten.
- KI-Server: Abwärme und Lärm im Büro planenKI-Server Lautstärke und Abwärme: Planen Sie Aufstellort und Luftzufuhr. Prüfen Sie Temperatur und Geräusch, damit der Rechner den Büroalltag nicht stört.
- Welche Hardware brauche ich für lokale KI?Lokale KI Hardware: Checkliste zu Arbeitsspeicher, Grafikkarte, Prozessor und Speicherplatz, damit Sie vor dem Kauf wissen, was Ihr Computer schafft.
- Ollama mit Docker betreiben: Wie funktioniert das?Ollama Docker einfach erklärt: Was ein Container ist, wie Ihre IT Ollama damit betreibt und worauf bei Modellspeicher, Grafikkarte und Netzwerk zu achten ist.
- Lokale KI kostenlos nutzen: Was ist dafür nötig?Lokale KI kostenlos: Was Sie ohne Abo brauchen, welche Voraussetzungen Ihr Computer erfüllen sollte und wo trotzdem Kosten und Grenzen warten.