Zum Inhalt springen

Eigene LLMs & KI-Systeme · KI-Beratung und digitale Transformation

Wie testen wir, ob ein lokales Modell als Agent geeignet ist?

Stand 10.10.2026 · 4 Min. Lesezeit

Kurz gesagt

Ein Modell, das gut chattet, ist nicht automatisch als Agent geeignet. Prüfen Sie mit festen Testaufgaben, ob es das richtige Werkzeug wählt, die Parameter korrekt füllt, mehrere Schritte durchhält und bei Unklarheit nachfragt statt zu raten.

Das Problem

Ihr lokales Sprachmodell beantwortet Fragen erfreulich gut. Nun soll es als Agent arbeiten, also selbstständig mehrere Schritte ausführen: eine Datei suchen, eine Zahl nachschlagen, daraus einen Entwurf machen. Ob es das auch zuverlässig kann, ist offen.

Das ist ein grosser Unterschied. Beim Chat genügt eine gute Antwort. Beim Agenten muss das Modell das richtige Werkzeug wählen, die Angaben dafür korrekt ausfüllen, das Ergebnis lesen und entscheiden, was als Nächstes kommt. Schon ein Fehler im ersten Schritt zieht sich durch alle weiteren.

Gerade kleinere lokale Modelle sind darin oft schwächer als grosse Cloud-Modelle. Das lässt sich nicht aus dem Namen oder der Grösse ableiten, sondern nur durch Ausprobieren mit Ihren eigenen Aufgaben.

So lösen Sie es mit KI – Schritt für Schritt

  1. Aufgabe festlegen. Beschreiben Sie in zwei Sätzen, was der Agent tun soll und welche Werkzeuge er hat (zum Beispiel «Dokument suchen», «Kunden nachschlagen»). Das Modell wird nur für diese Aufgabe getestet.
  2. Prüfen, ob das Modell Werkzeuge unterstützt. Nicht jedes Modell kann Werkzeuge im vorgesehenen Format aufrufen («Tool Calling»). Die Modellbeschreibung und die Dokumentation Ihrer Software geben Auskunft. Siehe Werkzeugaufrufe bei lokalen Modellen.
  3. Zehn Testaufgaben sammeln. Mischen Sie leichte Fälle, schwierige Fälle und Fallen: zum Beispiel eine Frage, für die kein Werkzeug passt, oder eine mit fehlender Angabe.
  4. In einer Testumgebung ausführen. Lassen Sie den Agenten nur mit Beispieldaten und ohne echte Folgen arbeiten. Siehe Testumgebung für KI-Agenten.
  5. Jede Aufgabe mehrfach wiederholen. Führen Sie jede Aufgabe mindestens dreimal aus. Ein Modell, das nur manchmal richtig liegt, ist als Agent unbrauchbar.
  6. Bewerten mit einem festen Raster. Notieren Sie je Aufgabe: richtiges Werkzeug gewählt? Angaben korrekt? Aufgabe vollständig gelöst? Nachgefragt, wenn etwas fehlte?
  7. Ergebnis einordnen. Erreicht das Modell Ihre Mindestquote (zum Beispiel 9 von 10 Aufgaben stabil richtig), ist es für diese Aufgabe geeignet. Sonst probieren Sie ein anderes Modell oder vereinfachen die Aufgabe.
  8. Nach Änderungen erneut testen. Bei jedem Modellwechsel oder Update wiederholen Sie die Testaufgaben.

Vorlage zum Kopieren

Lassen Sie sich mit diesem Auftrag Testaufgaben für Ihren Agenten entwerfen.

Ich teste, ob ein lokales KI-Modell als Agent für folgende Aufgabe geeignet ist: [Aufgabe in zwei Sätzen].

Der Agent hat diese Werkzeuge: [Werkzeug 1 mit Zweck], [Werkzeug 2 mit Zweck].

Erstelle zwölf Testaufgaben in einer Tabelle mit den Spalten: Nummer, Aufgabe, erwartetes Werkzeug, erwartete Angaben, Schwierigkeit (leicht/mittel/schwer).
Darunter sollen sein:
- zwei Aufgaben, für die kein Werkzeug passt,
- zwei Aufgaben mit fehlender Angabe, bei denen der Agent nachfragen sollte,
- zwei Aufgaben mit mehreren Schritten hintereinander.
Verwende nur Beispieldaten, keine echten Kundendaten. Schreibe in einfachem Deutsch.

Passen Sie Aufgabe und Werkzeuge an. Mit den Fallenaufgaben erkennen Sie, ob das Modell auch dann sauber bleibt, wenn etwas nicht stimmt.

PrüfpunktFrage
WerkzeugwahlWählt es das passende Werkzeug?
AngabenSind Parameter vollständig und korrekt?
Mehrere SchritteHält es den Faden über drei oder mehr Schritte?
NachfragenFragt es, statt zu raten?
StabilitätGleiches Ergebnis bei Wiederholung?

Worauf Sie achten müssen

  • Zufall im Modell: Dieselbe Aufgabe kann unterschiedlich ausgehen. Deshalb mehrere Durchläufe, siehe auch Temperatur bei lokaler KI.
  • Erfundene Werkzeugaufrufe: Schwache Modelle rufen Werkzeuge auf, die es gar nicht gibt, oder erfinden Angaben. Zählen Sie das als Fehler.
  • Zu kurzes Gedächtnis: Bei langen Aufgaben vergisst das Modell frühe Schritte. Teilen Sie lange Aufgaben auf.
  • Eigene Aufgaben statt Ranglisten: Öffentliche Vergleichstests sagen wenig über Ihre Aufgabe. Entscheidend sind Ihre Testfälle.
  • Keine Dauerfreigabe: Auch ein bestandener Test ist eine Momentaufnahme. Wichtige Aktionen sollten weiterhin ein Mensch freigeben, siehe Freigabe einbauen.

Ein Beispiel aus der Praxis

Ein Beispiel: Ein Treuhandbüro in Winterthur möchte einen Agenten, der in der Dokumentenablage nach Belegen sucht und eine Liste für die Mehrwertsteuerabrechnung vorbereitet. Der Informatiker testet zwei lokale Modelle mit zwölf Beispielaufgaben.

Modell A wählt das Suchwerkzeug fast immer richtig, erfindet aber bei fehlendem Datum einen Zeitraum. Modell B ist langsamer, fragt jedoch bei fehlender Angabe nach und besteht elf von zwölf Aufgaben bei drei Durchläufen stabil. Das Büro entscheidet sich für Modell B und lässt den Agenten vorerst nur Vorschläge machen, die eine Person freigibt.

So hilft Ihnen Alpasana

Wenn Sie nicht allein klären möchten, welche Aufgaben ein Agent übernehmen soll und wie ein Pilot aussieht, unterstützt Sie Alpasana mit KI-Beratung und digitaler Transformation. Dazu zählen die Integration von KI-Agenten mit Anwendungsfall, Pilot, Einsatzregeln und Skalierung sowie das Priorisieren von Vorhaben.

Welches Modell für Ihre Aufgabe passt, kann niemand pauschal sagen. Das zeigt erst ein Test mit Ihren Daten und Abläufen.

Häufige Fragen

Reicht es, wenn das Modell gut Deutsch schreibt?

Nein. Gute Sprache sagt nichts darüber, ob es Werkzeuge sauber bedient. Prüfen Sie beides getrennt, siehe auch Deutsch-Qualität testen.

Wie viele Testaufgaben braucht es?

Für einen ersten Eindruck genügen etwa zehn bis zwölf, jeweils mehrfach ausgeführt. Für einen produktiven Einsatz brauchen Sie mehr, vor allem mehr Problemfälle aus Ihrem Alltag.

Was, wenn kein lokales Modell besteht?

Dann vereinfachen Sie die Aufgabe, teilen sie in kleinere Schritte oder nutzen statt eines Agenten einen festen Ablauf. Siehe Agent oder Workflow.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.

Weiterlesen in der Galaxie