Eigene LLMs & KI-Systeme · KI-Beratung und digitale Transformation
Wie testen wir, ob ein lokales Modell als Agent geeignet ist?
Kurz gesagt
Ein Modell, das gut chattet, ist nicht automatisch als Agent geeignet. Prüfen Sie mit festen Testaufgaben, ob es das richtige Werkzeug wählt, die Parameter korrekt füllt, mehrere Schritte durchhält und bei Unklarheit nachfragt statt zu raten.
Das Problem
Ihr lokales Sprachmodell beantwortet Fragen erfreulich gut. Nun soll es als Agent arbeiten, also selbstständig mehrere Schritte ausführen: eine Datei suchen, eine Zahl nachschlagen, daraus einen Entwurf machen. Ob es das auch zuverlässig kann, ist offen.
Das ist ein grosser Unterschied. Beim Chat genügt eine gute Antwort. Beim Agenten muss das Modell das richtige Werkzeug wählen, die Angaben dafür korrekt ausfüllen, das Ergebnis lesen und entscheiden, was als Nächstes kommt. Schon ein Fehler im ersten Schritt zieht sich durch alle weiteren.
Gerade kleinere lokale Modelle sind darin oft schwächer als grosse Cloud-Modelle. Das lässt sich nicht aus dem Namen oder der Grösse ableiten, sondern nur durch Ausprobieren mit Ihren eigenen Aufgaben.
So lösen Sie es mit KI – Schritt für Schritt
- Aufgabe festlegen. Beschreiben Sie in zwei Sätzen, was der Agent tun soll und welche Werkzeuge er hat (zum Beispiel «Dokument suchen», «Kunden nachschlagen»). Das Modell wird nur für diese Aufgabe getestet.
- Prüfen, ob das Modell Werkzeuge unterstützt. Nicht jedes Modell kann Werkzeuge im vorgesehenen Format aufrufen («Tool Calling»). Die Modellbeschreibung und die Dokumentation Ihrer Software geben Auskunft. Siehe Werkzeugaufrufe bei lokalen Modellen.
- Zehn Testaufgaben sammeln. Mischen Sie leichte Fälle, schwierige Fälle und Fallen: zum Beispiel eine Frage, für die kein Werkzeug passt, oder eine mit fehlender Angabe.
- In einer Testumgebung ausführen. Lassen Sie den Agenten nur mit Beispieldaten und ohne echte Folgen arbeiten. Siehe Testumgebung für KI-Agenten.
- Jede Aufgabe mehrfach wiederholen. Führen Sie jede Aufgabe mindestens dreimal aus. Ein Modell, das nur manchmal richtig liegt, ist als Agent unbrauchbar.
- Bewerten mit einem festen Raster. Notieren Sie je Aufgabe: richtiges Werkzeug gewählt? Angaben korrekt? Aufgabe vollständig gelöst? Nachgefragt, wenn etwas fehlte?
- Ergebnis einordnen. Erreicht das Modell Ihre Mindestquote (zum Beispiel 9 von 10 Aufgaben stabil richtig), ist es für diese Aufgabe geeignet. Sonst probieren Sie ein anderes Modell oder vereinfachen die Aufgabe.
- Nach Änderungen erneut testen. Bei jedem Modellwechsel oder Update wiederholen Sie die Testaufgaben.
Vorlage zum Kopieren
Lassen Sie sich mit diesem Auftrag Testaufgaben für Ihren Agenten entwerfen.
Ich teste, ob ein lokales KI-Modell als Agent für folgende Aufgabe geeignet ist: [Aufgabe in zwei Sätzen].
Der Agent hat diese Werkzeuge: [Werkzeug 1 mit Zweck], [Werkzeug 2 mit Zweck].
Erstelle zwölf Testaufgaben in einer Tabelle mit den Spalten: Nummer, Aufgabe, erwartetes Werkzeug, erwartete Angaben, Schwierigkeit (leicht/mittel/schwer).
Darunter sollen sein:
- zwei Aufgaben, für die kein Werkzeug passt,
- zwei Aufgaben mit fehlender Angabe, bei denen der Agent nachfragen sollte,
- zwei Aufgaben mit mehreren Schritten hintereinander.
Verwende nur Beispieldaten, keine echten Kundendaten. Schreibe in einfachem Deutsch.Passen Sie Aufgabe und Werkzeuge an. Mit den Fallenaufgaben erkennen Sie, ob das Modell auch dann sauber bleibt, wenn etwas nicht stimmt.
| Prüfpunkt | Frage |
|---|---|
| Werkzeugwahl | Wählt es das passende Werkzeug? |
| Angaben | Sind Parameter vollständig und korrekt? |
| Mehrere Schritte | Hält es den Faden über drei oder mehr Schritte? |
| Nachfragen | Fragt es, statt zu raten? |
| Stabilität | Gleiches Ergebnis bei Wiederholung? |
Worauf Sie achten müssen
- Zufall im Modell: Dieselbe Aufgabe kann unterschiedlich ausgehen. Deshalb mehrere Durchläufe, siehe auch Temperatur bei lokaler KI.
- Erfundene Werkzeugaufrufe: Schwache Modelle rufen Werkzeuge auf, die es gar nicht gibt, oder erfinden Angaben. Zählen Sie das als Fehler.
- Zu kurzes Gedächtnis: Bei langen Aufgaben vergisst das Modell frühe Schritte. Teilen Sie lange Aufgaben auf.
- Eigene Aufgaben statt Ranglisten: Öffentliche Vergleichstests sagen wenig über Ihre Aufgabe. Entscheidend sind Ihre Testfälle.
- Keine Dauerfreigabe: Auch ein bestandener Test ist eine Momentaufnahme. Wichtige Aktionen sollten weiterhin ein Mensch freigeben, siehe Freigabe einbauen.
Ein Beispiel aus der Praxis
Ein Beispiel: Ein Treuhandbüro in Winterthur möchte einen Agenten, der in der Dokumentenablage nach Belegen sucht und eine Liste für die Mehrwertsteuerabrechnung vorbereitet. Der Informatiker testet zwei lokale Modelle mit zwölf Beispielaufgaben.
Modell A wählt das Suchwerkzeug fast immer richtig, erfindet aber bei fehlendem Datum einen Zeitraum. Modell B ist langsamer, fragt jedoch bei fehlender Angabe nach und besteht elf von zwölf Aufgaben bei drei Durchläufen stabil. Das Büro entscheidet sich für Modell B und lässt den Agenten vorerst nur Vorschläge machen, die eine Person freigibt.
So hilft Ihnen Alpasana
Wenn Sie nicht allein klären möchten, welche Aufgaben ein Agent übernehmen soll und wie ein Pilot aussieht, unterstützt Sie Alpasana mit KI-Beratung und digitaler Transformation. Dazu zählen die Integration von KI-Agenten mit Anwendungsfall, Pilot, Einsatzregeln und Skalierung sowie das Priorisieren von Vorhaben.
Welches Modell für Ihre Aufgabe passt, kann niemand pauschal sagen. Das zeigt erst ein Test mit Ihren Daten und Abläufen.
Häufige Fragen
Reicht es, wenn das Modell gut Deutsch schreibt?
Nein. Gute Sprache sagt nichts darüber, ob es Werkzeuge sauber bedient. Prüfen Sie beides getrennt, siehe auch Deutsch-Qualität testen.
Wie viele Testaufgaben braucht es?
Für einen ersten Eindruck genügen etwa zehn bis zwölf, jeweils mehrfach ausgeführt. Für einen produktiven Einsatz brauchen Sie mehr, vor allem mehr Problemfälle aus Ihrem Alltag.
Was, wenn kein lokales Modell besteht?
Dann vereinfachen Sie die Aufgabe, teilen sie in kleinere Schritte oder nutzen statt eines Agenten einen festen Ablauf. Siehe Agent oder Workflow.
Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.
Weiterlesen in der Galaxie
- Wie kann ein lokales KI-Modell Werkzeuge aufrufen?Tool Calling einfach erklärt: Wie aus einer KI-Antwort eine Aktion wird, wie lokale Modelle Werkzeuge aufrufen und wo die Sicherheitsgrenzen liegen.
- Wie baut man einen KI-Agenten mit einem lokalen Modell?Lokalen KI-Agenten bauen: Schritt für Schritt von der Aufgabe über Werkzeuge und Regeln zum Test, damit ein lokales Modell Arbeit sicher übernimmt.
- Wie vergleichen wir KI-Modelle mit unseren eigenen Aufgaben?LLM Modelle testen: So vergleichen Sie KI-Modelle anhand Ihrer eigenen Arbeitsaufgaben mit Blindbewertung, statt sich auf allgemeine Ranglisten zu verlassen.
- Vorlage: Einen KI-Agenten vor dem Einsatz abnehmenKI Agent Abnahmetest: Vorlage mit Prüffällen, Aktionsgrenzen und Freigabekriterien, damit Ihr Agent erst nach bestandenem Test im Betrieb arbeitet.
- Wie beschreibt man Werkzeuge für einen KI-Agenten eindeutig?KI Agent Tools definieren: So beschreiben Sie Funktionen und Eingabefelder so klar, dass Ihr KI-Agent das richtige Werkzeug wählt und es korrekt aufruft.
- Einen eigenen Chatbot kostenlos testen: Worauf achten?Eigenen Chatbot kostenlos erstellen und testen: Checkliste zu Gratis-Tarifen, Testdaten und Einschränkungen für einen aussagekräftigen Test.