Zum Inhalt springen

Eigene LLMs & KI-Systeme · KI-Beratung und digitale Transformation

Wie überwachen wir die Auslastung unseres KI-Rechners?

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Beobachten Sie vier Werte: Auslastung der Grafikkarte, belegten Grafikspeicher, Temperatur und Arbeitsspeicher. Mit Bordmitteln wie dem Task-Manager oder dem Befehl nvidia-smi sehen Sie diese Werte sofort. Für den Dauerbetrieb lassen Sie sie von der IT aufzeichnen und mit Schwellen versehen.

Das Problem

Der KI-Rechner arbeitet seit einigen Wochen im Betrieb. Manchmal sind Antworten zäh, manchmal fliegen sie. Frau Müller fragt die IT, woran das liegt. Die Antwort: «Vielleicht ist er überlastet.» Aber wer weiss das schon? Niemand hat nachgesehen.

Eine Grafikkarte, die ständig auf Anschlag läuft, ist ein Zeichen: Das System ist an seiner Grenze, und zusätzliche Nutzer machen alles langsamer. Ein Speicher, der fast voll ist, kann zu Abstürzen führen. Eine hohe Temperatur kann zu Drosselung führen.

Wer diese Werte regelmässig sieht, kann rechtzeitig reagieren: Last verteilen, ein kleineres Modell einsetzen oder mehr Leistung beschaffen. Das Beobachten ist mit einfachen Mitteln möglich.

So lösen Sie es mit KI – Schritt für Schritt

  1. Kennen Sie die vier Werte. Auslastung der Grafikkarte (wie stark sie rechnet), belegter Grafikspeicher (wie viel vom Modell und Zwischenspeicher belegt ist), Temperatur und Arbeitsspeicher des Rechners. Dazu kommt der Prozessor.
  2. Schauen Sie mit Bordmitteln nach. Unter Windows zeigt der Task-Manager im Reiter «Leistung» GPU-Auslastung, Speicher und oft Temperatur. Bei Nvidia-Karten liefert der Befehl «nvidia-smi» eine Übersicht, die man auch in Intervallen aktualisieren lassen kann. Unter Linux gibt es ähnliche Werkzeuge. Ihre IT kennt sie.
  3. Beobachten Sie bei einer typischen Anfrage. Stellen Sie eine Frage und sehen Sie zu: Wie stark steigt die Auslastung, wie viel Speicher belegt das Modell, wie warm wird es?
  4. Beobachten Sie bei Last. Wiederholen Sie das während eines Lasttests, siehe Lasttest vorbereiten.
  5. Legen Sie Schwellen fest. Ab wann ist die Auslastung dauerhaft zu hoch, der Speicher zu knapp, die Temperatur zu hoch? Die Grenzen leiten Sie aus Tests und Herstellerangaben ab.
  6. Zeichnen Sie die Werte auf. Für den Betrieb sollte die IT Messwerte regelmässig speichern, damit man Verläufe sieht, etwa Spitzen am Morgen. Siehe Monitoring-Dashboard.
  7. Richten Sie Alarme ein. Bei kritischen Werten soll jemand informiert werden, siehe Fehleralarm einrichten.
  8. Handeln Sie nach Plan. Was tun bei dauernd hoher Auslastung? Nutzung begrenzen, Zeiten verschieben, kleineres Modell, mehr Hardware. Legen Sie es im Voraus fest.

Vorlage zum Kopieren

Ich möchte die Auslastung unseres KI-Rechners überwachen.

Rechner: [Prozessor, Arbeitsspeicher, Grafikkarte mit Speicher]
Betriebssystem: [Windows / Linux]
Programm: [Ollama / LM Studio / anderes]
Nutzung: [Anzahl Personen, Stosszeiten]
Bisherige Beobachtung: [z. B. «Antworten manchmal langsam»]

Aufgabe:
1. Erkläre in einfachen Worten, was Auslastung, Grafikspeicher und Temperatur bedeuten und woran man erkennt, dass der Rechner an seine Grenze kommt.
2. Erstelle eine Tabelle mit den Werten, die ich beobachten soll: Wert | Was er zeigt | Womit ich ihn lese | Warnzeichen | Erste Massnahme.
3. Schlage einen einfachen Beobachtungsplan für zwei Wochen vor (wann, wie oft, wer notiert).
4. Nenne keine konkreten Grenzwerte, die du nicht kennst, sondern verweise auf Herstellerangaben und unsere Tests.

Notieren Sie in den ersten Wochen die Werte zu festen Zeiten, auch ohne Technik. Das gibt Ihnen ein Gefühl für den Normalzustand.

WertWas er zeigtWarnzeichen
GPU-AuslastungWie stark die Karte rechnetDauerhaft am Anschlag bei normaler Nutzung
GrafikspeicherPlatz für Modell und ZwischenspeicherFast voll, Modell wird ausgelagert
TemperaturWärme der KarteHohe Werte, Leistung sinkt
ArbeitsspeicherPlatz für Betriebssystem und ProgrammeAuslagerung auf die Festplatte
AntwortzeitWartezeit der NutzendenSteigt im Tagesverlauf

Worauf Sie achten müssen

  • Messwerkzeuge aus seriösen Quellen: Installieren Sie Software nur aus vertrauenswürdigen Quellen, und auf Firmenrechnern nach Absprache mit der IT. Die Nvidia-Dokumentation beschreibt den Befehl nvidia-smi.
  • Momentaufnahme täuscht: Ein einzelner Blick sagt wenig. Beobachten Sie über Tage, auch zu Stosszeiten.
  • Keine Chattexte mitprotokollieren: Messwerte sollen keine Inhalte enthalten, siehe Datensparsame Protokolle.
  • Hersteller unterscheiden sich: Die Werkzeuge hängen vom Hersteller ab, etwa bei Nvidia und AMD. Klären Sie mit Ihrer IT, was für Ihre Karte vorgesehen ist.
  • Zusammenhang prüfen: Hohe Temperatur und Drosselung hängen zusammen. Siehe Überhitzung erkennen.
  • Zugriff: Überwachung kann auch Rückschlüsse auf Nutzung und Personen zulassen. Informieren Sie Ihre Mitarbeitenden.

Ein Beispiel aus der Praxis

Ein Beispiel: Eine Anwaltskanzlei in Basel betreibt einen gemeinsamen KI-Rechner. Immer wieder beklagen sich Mitarbeitende über langsame Antworten am Vormittag.

Vorher gibt es nur Vermutungen. Nachher beobachtet die IT zwei Wochen lang mit «nvidia-smi» und dem Task-Manager: Zwischen 9 und 11 Uhr ist die Grafikkarte nahezu dauernd voll ausgelastet, der Speicher ist knapp. Die Kanzlei verschiebt automatische Zusammenfassungen auf die Nacht, begrenzt parallele Anfragen und prüft die Anschaffung eines zweiten Geräts. Der Beobachtungsplan wird zum festen Bestandteil des Betriebshandbuchs.

So hilft Ihnen Alpasana

Ob Ihr Rechner an der Grenze arbeitet, ist ein Teil der Frage, wie viel KI-Leistung Ihr Betrieb braucht. Die KI-Beratung und digitale Transformation von Alpasana unterstützt dabei, KI-Potenziale zu analysieren, Vorhaben zu priorisieren und einen Umsetzungsplan zu erstellen.

So entscheiden Sie anhand von Daten, ob Optimierung oder Ausbau sinnvoll ist. Projekte werden individuell offeriert.

Häufige Fragen

Ist 100 Prozent Auslastung schlecht?

Nicht unbedingt. Während einer Antwort rechnet die Karte voll, das ist normal. Problematisch ist es, wenn Anfragen sich stauen oder Antworten deutlich langsamer werden.

Muss ich das täglich anschauen?

Am Anfang ja, danach genügen Alarme und regelmässige Blicke auf das Dashboard.

Gilt das auch für AMD-Karten?

Das Prinzip ja, die Werkzeuge unterscheiden sich. Ihre IT kennt die passenden für Ihre Hardware.

Wann kaufen wir mehr Leistung?

Wenn trotz Optimierung dauerhaft zu hohe Last besteht und Nutzende leiden. Dann helfen die Messwerte bei der Begründung.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.

Quellen

Weiterlesen in der Galaxie