Zum Inhalt springen

Sicherheit · KI für Developer mit Claude und Codex

KI-Schutzfilter blockiert normale Aufgaben: Was tun?

Stand 10.10.2026 · 5 Min. Lesezeit

Kurz gesagt

Wenn ein KI-Filter harmlose Anfragen blockiert, prüfen Sie, welche Schicht ablehnt, formulieren Sie die Aufgabe mit sachlichem Zusammenhang neu, sammeln Sie Beispiele und melden Sie sie dem Anbieter oder Ihrer IT. Schalten Sie Filter nie einfach aus und umgehen Sie sie nicht mit Tricks.

Das Problem

Ihre Mitarbeiterin bittet den KI-Assistenten, eine Kundenmail über eine Rechnungsmahnung zusammenzufassen. Die Antwort: «Diese Anfrage kann ich nicht bearbeiten.» Ein anderer Kollege will Inhalte eines Sicherheitshandbuchs vereinfachen, und der Filter schlägt ebenfalls an. Die Arbeit stockt, die Frustration wächst, und jemand sagt: «Dann schalten wir den Filter eben aus.»

Schutzfilter sind wichtig. Sie sollen verhindern, dass ein KI-System schädliche, unzulässige oder vertrauliche Inhalte ausgibt oder sich manipulieren lässt. Weil sie auf Mustern beruhen, machen sie Fehler: Sie lehnen harmlose Anfragen ab (Fehlalarm) oder lassen problematische durch. Für Betriebe sind beide Fehler lästig, aber unterschiedlich gefährlich. Fehlalarme kosten Zeit, übersehene Gefahren kosten mehr.

Statt den Filter abzuschalten oder zu umgehen, hilft ein geordnetes Vorgehen: erkennen, wo die Blockade entsteht, die Anfrage prüfen, melden und, wo Sie die Verantwortung tragen, den Filter sorgfältig abstimmen. Diese Seite zeigt, wie. Sie ersetzt keine Sicherheitsberatung.

So lösen Sie es mit KI – Schritt für Schritt

  1. Meldung genau lesen: Was steht in der Ablehnung? Nennt sie einen Grund, eine Kategorie oder nur eine allgemeine Formel? Notieren Sie den Wortlaut.
  2. Ort der Blockade bestimmen: Kommt die Ablehnung vom Anbieter des Modells, von einer Schutzschicht Ihrer Firma oder von einem Filter in einer Zusatzsoftware? Das entscheidet, wer sie ändern kann. Siehe Eingabe- und Ausgabefilter.
  3. Anfrage prüfen: Ist sie wirklich harmlos? Enthält sie Wörter oder Zusammenhänge, die ein Filter zu Recht beanstanden könnte, etwa Gewalt, Selbstverletzung, persönliche Daten, Geheimnisse?
  4. Sachlich neu formulieren: Beschreiben Sie den legitimen Zweck und den Zusammenhang, ohne Verbotenes zu umschreiben. Beispiel: «Für unser Mahnwesen fasse bitte den Inhalt dieser Mahnung neutral zusammen.»
  5. Keine Umgehungstricks: Versuchen Sie nicht, den Filter mit Verkleidungen, Zeichenspielereien oder Rollenspielen auszutricksen. Das ist riskant und kann gegen Nutzungsbedingungen verstossen.
  6. Beispiele sammeln: Halten Sie fest: Anfrage (ohne vertrauliche Daten), Meldung, Datum, System. Mehrere Beispiele zeigen ein Muster.
  7. Melden: Informieren Sie den Anbieter oder Ihre IT mit den Beispielen. Beschreiben Sie, was Sie tun wollten und warum es harmlos ist.
  8. Abstimmen und testen: Wenn Sie den Filter selbst steuern, ändern Sie Schwellen oder Regeln nur kontrolliert, mit Testfällen für harmlose und für gefährliche Anfragen, Freigabe und Dokumentation. Siehe Abnahmevorlage für Sicherheitstests.

Vorlage zum Kopieren

Mit diesem Auftrag bereiten Sie eine Meldung an Ihre IT oder den Anbieter vor:

Wir nutzen [KI-System] in [Betrieb, Schweiz]. Am [Datum] hat der Schutzfilter folgende Anfrage abgelehnt: [Anfrage sinngemäss, ohne vertrauliche Daten]. Meldung des Systems: [Wortlaut].
Zweck der Anfrage: [z. B. Mahnschreiben neutral zusammenfassen für das Mahnwesen].
Erstelle: 1. eine sachliche Meldung (Schweizer Standarddeutsch, Anrede «Sie», höchstens 150 Wörter) mit Beschreibung, Zweck, Bitte um Prüfung und Rückmeldung. 2. eine Tabelle «Datum | Anfrage (sinngemäss) | Meldung | Zweck | System | Status» für unsere Sammlung. 3. zehn Beispiele harmloser Anfragen aus [Branche], mit denen wir den Filter testen können, sowie fünf Beispiele problematischer Anfragen, die weiterhin blockiert werden sollen.
Gib keine Anleitung zum Umgehen von Filtern. Erfinde nichts.

Setzen Sie Ihre Angaben ein. Entfernen Sie vertrauliche Inhalte aus den Beispielen.

Worauf Sie achten müssen

  • Nicht ausschalten: Ein deaktivierter Filter öffnet Risiken, die Sie später kaum bemerken. Ändern Sie Einstellungen nur mit Freigabe. Siehe Konfigurationsänderungen freigeben.
  • Nicht tricksen: Umgehungsversuche untergraben Schutz und können gegen Bedingungen verstossen.
  • Fehlalarme sind Daten: Gut dokumentierte Fälle helfen, Filter zu verbessern.
  • Auch Gegenproben: Nach Lockerungen testen Sie, ob wirklich problematische Anfragen weiterhin blockiert werden.
  • Sprachen: Filter funktionieren in Schweizer Standarddeutsch und anderen Sprachen unterschiedlich gut. Siehe Sicherheitsfilter mehrsprachig testen.
  • Vertrauliche Daten: Geben Sie in Meldungen keine echten Kundendaten weiter.
  • Berechtigte Ausnahmen: Manche Fachaufgaben, etwa Sicherheitsschulungen, berühren heikle Themen. Klären Sie sie mit einem freigegebenen Verfahren, nicht im Alleingang.
SituationSinnvolles Vorgehen
Einzelne AblehnungAnfrage neu und sachlich formulieren
Wiederkehrende FehlalarmeBeispiele sammeln, melden
Fachaufgabe mit heiklem ThemaAusnahme mit Freigabe prüfen
Filter in eigener Verantwortungkontrolliert abstimmen, testen
Filter des AnbietersAnbieter informieren, Alternativen prüfen
Wunsch, Filter abzuschaltennicht ohne Freigabe und Risikoprüfung

Ein einfacher Prozess für das Team: Richten Sie einen Sammelpunkt für Fehlalarme ein, zum Beispiel eine gemeinsame Tabelle oder ein Postfach. Mitarbeitende tragen dort Beispiele ein, ohne vertrauliche Details. Eine zuständige Person sichtet die Einträge wöchentlich, gruppiert sie, entscheidet über Meldungen an den Anbieter oder Anpassungen und informiert das Team. Bei Anpassungen läuft immer eine kleine Testserie. Zudem lohnt es sich, im Team zu erklären, warum Filter bestehen, damit Ablehnungen nicht als Schikane empfunden werden. Wer versteht, wovor der Filter schützt, formuliert Anfragen sachlicher und trägt zur Verbesserung bei.

Ein Beispiel aus der Praxis

Ein erfundenes Beispiel: Die Rechtsabteilung eines Energieunternehmens in Aarau nutzt einen KI-Assistenten, der Schadensmeldungen zusammenfasst. Der Filter blockiert regelmässig Meldungen mit Wörtern wie «Brand» und «Verletzung».

Vorher: Die Mitarbeitenden formulieren Anfragen mit Umschreibungen oder lassen den Assistenten weg. Ein Kollege fordert, den Filter auszuschalten.

Nachher: Die IT sammelt zwei Wochen lang Beispiele, stellt fest, dass der Filter auf einzelne Wörter reagiert, und bespricht das mit dem Anbieter. Gemeinsam wird der Filter für diese Fachabteilung mit einer Ausnahmeregel für Schadensmeldungen abgestimmt, anhand einer passenden Auswahl harmloser und problematischer Testanfragen geprüft und von der Sicherheitsverantwortlichen freigegeben. Der Filter bleibt aktiv, und die Fehlalarme gehen deutlich zurück.

So hilft Ihnen Alpasana

Wenn Sie als Entwicklerin oder Entwickler KI-Anwendungen mit Schutzfunktionen betreiben, bietet absofort den Kurs KI für Developer mit Claude und Codex. Laut Beschreibung gehören LLM-Grundlagen mit Grenzen und Datenschutz, Aufgaben delegieren und Ergebnisse verifizieren, Review und Tests sowie ein Entwickler-Playbook mit Review-Regeln, Tests und Datenschutzgrenzen dazu.

Das Abstimmen konkreter Filter bei Anbietern ist nicht Kursinhalt.

Häufige Fragen

Darf ich versuchen, den Filter zu umgehen?

Nein. Das gefährdet den Schutz und kann gegen Nutzungsbedingungen verstossen. Melden Sie das Problem und stimmen Sie den Filter kontrolliert ab.

Warum lehnt die KI plötzlich ab, was gestern ging?

Anbieter aktualisieren Modelle und Filter. Dokumentieren Sie Beispiele und melden Sie sie. Siehe Modell-Updates.

Wer ist zuständig, wenn mein Filter zu streng ist?

Die Person, die das System verantwortet, meist die IT oder der Anbieter. Klären Sie das vorab.

Wie oft soll ich Filter prüfen?

Regelmässig, etwa vierteljährlich, und nach jedem Update oder jeder Änderung des Einsatzes.

Erstellt mit KI-Unterstützung, redaktionell verantwortet von der Alpasana GmbH · 10.10.2026. So arbeitet die Redaktion · Fehler entdeckt? Melden Sie es uns.

Quellen

Weiterlesen in der Galaxie