Eigene LLMs & KI-Systeme · KI-Beratung und digitale Transformation
Wie teste ich einen Computer mit unserem KI-Modell?
Kurz gesagt
Testen Sie mit Ihrem eigenen Modell und fünf bis zehn echten Aufgaben, nicht mit allgemeinen Ranglisten. Messen Sie die Zeit bis zur ersten Antwort und die Geschwindigkeit der weiteren Wörter, notieren Sie Temperatur und Speicherbedarf und halten Sie alles in einem Protokoll fest, das Sie zwischen Geräten vergleichen können.
Das Problem
Der Händler preist einen Rechner als «ideal für KI» an. Das Datenblatt nennt beeindruckende Zahlen. Frau Müller möchte aber wissen: Wie schnell erledigt dieser Rechner unsere Aufgaben, also die Zusammenfassung eines Protokolls oder den Entwurf einer Offerte?
Allgemeine Ranglisten und Herstellerangaben beziehen sich auf bestimmte Modelle und Testbedingungen. Sie sagen wenig darüber, wie sich Ihr Modell mit Ihren Texten auf Ihrem Gerät verhält. Fehlkäufe entstehen oft, weil niemand vorher gemessen hat.
Ein eigener Test ist einfacher, als er klingt. Sie brauchen kein Messlabor, sondern ein Protokoll, eine Stoppuhr oder die Anzeige Ihres KI-Programms und etwas Disziplin.
So lösen Sie es mit KI – Schritt für Schritt
- Wählen Sie das Modell. Nehmen Sie das Modell, das Sie später tatsächlich einsetzen wollen, in der geplanten Komprimierung. Notieren Sie Name und Variante genau.
- Sammeln Sie echte Aufgaben. Fünf bis zehn Beispiele aus dem Alltag in unterschiedlicher Länge: eine kurze Frage, eine Zusammenfassung, ein längerer Entwurf. Verwenden Sie anonymisierte oder erfundene Daten, keine echten Kundendaten.
- Bereiten Sie das Testgerät vor. Aktuelle Treiber, keine anderen grossen Programme im Hintergrund, Gerät am Netzstrom. Siehe Grafiktreiber prüfen.
- Messen Sie die Antwortzeit. Zwei Werte sind wichtig: die Zeit bis zum ersten Wort und die Geschwindigkeit danach, meist in «Tokens pro Sekunde» angegeben (ein Token ist ein Wortbaustein). Programme wie Ollama zeigen diese Werte mit einer Zusatzoption im Befehl an, die Ihre IT kennt. LM Studio blendet sie in der Oberfläche ein.
- Wiederholen Sie jeden Test dreimal. Die erste Antwort ist oft langsamer, weil das Modell geladen werden muss. Notieren Sie Ladezeit und die Werte der späteren Läufe getrennt.
- Beobachten Sie Speicher und Temperatur. Wie viel Arbeits- und Grafikspeicher wird belegt, und wie warm wird das Gerät? Siehe Überhitzung.
- Testen Sie bei Dauerlast. Lassen Sie 15 bis 30 Minuten lang Aufgaben laufen, um Drosselung zu erkennen.
- Bewerten Sie auch die Qualität. Eine schnelle, aber schlechte Antwort nützt nichts. Beurteilen Sie Inhalt und Sprache der Ergebnisse.
Vorlage zum Kopieren
Dieses Testprotokoll legen Sie für jedes Gerät an. Eine KI kann es nach Ihren Angaben in eine Tabelle bringen, die Messung selbst führen Sie durch.
Testprotokoll lokale KI
Datum: [Datum] Prüfer/in: [Name]
Gerät: [Modell, Prozessor, Arbeitsspeicher, Grafikkarte/Grafikspeicher]
Betriebssystem und Treiberversion: [Angaben]
Programm und Version: [Ollama / LM Studio / anderes]
Modell und Variante: [Name, Komprimierung]
Kontextlänge-Einstellung: [Zahl oder Standard]
Aufgabe | Eingabelänge (ungefähr) | Zeit bis zum ersten Wort (s) | Tokens pro Sekunde | Gesamtdauer (s) | Qualität (1 bis 5) | Bemerkung
1 [kurze Frage] | [Wörter] | [ ] | [ ] | [ ] | [ ] | [ ]
2 [Zusammenfassung] | [Wörter] | [ ] | [ ] | [ ] | [ ] | [ ]
3 [Entwurf] | [Wörter] | [ ] | [ ] | [ ] | [ ] | [ ]
Dauerlast (20 Minuten): Temperatur Grafikkarte/Prozessor am Ende: [ ] Leistung nach 20 Minuten im Vergleich zu Beginn: [gleich/langsamer]
Belegter Speicher während der Antwort: [Arbeitsspeicher, Grafikspeicher]
Lärm und Wärme am Aufstellort: [Beobachtung]
Fazit: [geeignet / bedingt / nicht geeignet]Verwenden Sie für alle Geräte dasselbe Protokoll und dieselben Aufgaben, sonst lassen sich die Ergebnisse nicht vergleichen. Das Ergebnis dürfen Sie in Ihr Beschaffungsdokument übernehmen.
| Messgrösse | Bedeutung für Sie |
|---|---|
| Zeit bis zum ersten Wort | Wie lange man auf den Anfang wartet |
| Tokens pro Sekunde | Wie flüssig der Text erscheint |
| Gesamtdauer | Wie lange eine ganze Aufgabe dauert |
| Speicherbelegung | Ob das Modell bequem passt |
| Temperatur bei Dauerlast | Ob das Gerät drosselt |
Worauf Sie achten müssen
- Testdaten: Verwenden Sie keine echten Kundendaten oder vertraulichen Dokumente. Nehmen Sie anonymisierte oder erfundene Beispiele.
- Vergleichbarkeit: Gleiche Aufgaben, gleiche Einstellungen, gleiches Modell. Ändern Sie nur das Gerät.
- Schwankungen: Messwerte schwanken. Wiederholen Sie die Tests und notieren Sie Spannen.
- Praxisgrenze festlegen: Entscheiden Sie vorher, was zumutbar ist, etwa «Antwort beginnt innerhalb weniger Sekunden». Das schafft ein Kriterium.
- Anbieterangaben: Geben Sie dem Händler Ihr Testprotokoll mit. Wenn er Leihgeräte anbietet, nutzen Sie sie.
- Weiteres: Für mehrere gleichzeitige Nutzer reicht ein Einzeltest nicht, siehe Gleichzeitige Nutzer.
Ein Beispiel aus der Praxis
Ein Beispiel: Eine Anwaltskanzlei in Luzern möchte für Textentwürfe einen Rechner beschaffen. Zwei Angebote stehen zur Wahl, beide mit der Bezeichnung «KI-bereit».
Vorher lautet die Entscheidungsgrundlage: Preis und Datenblatt. Nachher leiht die Kanzlei beide Geräte eine Woche aus und führt dasselbe Protokoll mit denselben acht anonymisierten Aufgaben durch. Gerät A beginnt schneller zu antworten, wird aber bei Dauerlast laut und langsamer. Gerät B ist etwas gemächlicher, bleibt aber konstant und leise. Die Kanzlei wählt B und legt das Protokoll als Begründung ab.
So hilft Ihnen Alpasana
Ein sauberer Test macht Beschaffungsentscheide nachvollziehbar. Die KI-Beratung und digitale Transformation von Alpasana unterstützt dabei, KI-Potenziale zu analysieren, Vorhaben zu priorisieren und einen Umsetzungsplan zu erstellen, in den Testfälle und Anforderungen eingehen.
So kaufen Sie nach Messung statt nach Datenblatt. Projekte werden individuell offeriert.
Häufige Fragen
Brauche ich ein spezielles Messprogramm?
Für den Anfang nicht. Die Anzeige Ihres KI-Programms und eine Stoppuhr reichen. Für Temperatur und Auslastung helfen Werkzeuge, die Ihre IT empfiehlt.
Wie viele Aufgaben soll ich testen?
Fünf bis zehn typische Aufgaben in unterschiedlicher Länge, jede dreimal. Das gibt ein brauchbares Bild, ohne dass es zu aufwendig wird.
Was ist eine gute Geschwindigkeit?
Das hängt von Ihrer Geduld und der Aufgabe. Entscheiden Sie vorher, was für Ihre Leute zumutbar ist, und testen Sie dagegen.
Kann ein Test bei Dritten stattfinden?
Ja, etwa beim IT-Partner. Geben Sie nur anonymisierte oder erfundene Testdaten weiter, und lassen Sie Ihr Protokoll verwenden.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- Vorlage: Hardwareanforderungen für einen KI-RechnerKI Hardware Anforderungen Vorlage: Mit dieser Vorlage schreiben Sie Ihrem IT-Anbieter verständlich auf, was der KI-Rechner leisten, aushalten und kosten darf.
- Welche Hardware brauche ich für lokale KI?Lokale KI Hardware: Checkliste zu Arbeitsspeicher, Grafikkarte, Prozessor und Speicherplatz, damit Sie vor dem Kauf wissen, was Ihr Computer schafft.
- Wie viele Mitarbeitende können eine lokale KI nutzen?LLM gleichzeitige Nutzer: Wie viele Personen einen gemeinsamen KI-Rechner nutzen können, was gleichzeitig heisst und wie Sie den Bedarf realistisch schätzen.
- Wie viel Arbeitsspeicher braucht ein lokales LLM?LLM RAM Bedarf selbst berechnen: Mit einer einfachen Faustregel schätzen Sie, ob der Arbeitsspeicher Ihres Rechners für ein lokales Sprachmodell reicht.
- Wie vergleichen wir KI-Modelle mit unseren eigenen Aufgaben?LLM Modelle testen: So vergleichen Sie KI-Modelle anhand Ihrer eigenen Arbeitsaufgaben mit Blindbewertung, statt sich auf allgemeine Ranglisten zu verlassen.