Wie KI-Sicherheitstests funktionieren: Red-Teaming und Evaluationen

tech Aktualisiert 2026-08-02
JETZT IM TRENDWie KI-Sicherheitstestsfunktionieren: Red-Teaming undEvaluationen

Wenn ein Unternehmen berichtet, sein KI-Modell habe in einem Test etwas Beunruhigendes getan — was für ein Test war das? Hier steht verständlich, wie Sicherheitstests bei KI-Systemen aufgebaut sind.

Evaluationen: eine Fähigkeit messen

Eine Evaluation ist ein wiederholbarer Test, der misst, ob ein Modell etwas Bestimmtes kann: eine Problemklasse lösen, eine technische Aufgabe erledigen oder ein Verfahren befolgen. Entscheidend ist die Vergleichbarkeit: derselbe Test bei verschiedenen Modellen oder beim selben Modell über die Zeit zeigt, ob eine Fähigkeit vorhanden ist und wächst. Evaluationen beantworten „kann es“, nicht „wird es“.

Red-Teaming: bewusst zum Scheitern bringen

Red-Teaming ist adversarial. Statt eine Fähigkeit zu messen, versuchen Menschen aktiv, das System zu Verhalten zu bringen, das es vermeiden soll — durch ungewöhnliche Formulierungen, indirekte Rahmung oder lange mehrstufige Aufbauten. Da Angreifer kreativ sind, hängt diese Arbeit von menschlichem Einfallsreichtum ab, nicht von einer festen Checkliste.

Kontrollierte Übungen mit echten Zielen

Die aufwendigste Form setzt ein Modell in eine realistische Umgebung — mit Erlaubnis des Ziels und klaren Grenzen, etwa in einer autorisierten Sicherheitsübung. Solche Tests liefern die konkretesten Belege, werden aber auch am leichtesten falsch gelesen: Das Modell erhält Zugänge, Werkzeuge und Ziele, die kein normaler Nutzer hätte.

Häufige Fragen

Ist Red-Teaming dasselbe wie Hacking?

Nein. Red-Teaming ist autorisiertes adversariales Testen mit definierten Grenzen.

Wer führt diese Tests durch?

KI-Entwickler intern; unabhängige Forschende und Dritte veröffentlichen ebenfalls Evaluationen.

Bedeuten Ergebnisse, dass ein Modell unsicher ist?

Ein Fähigkeitsbefund ist nicht dasselbe wie reales Verhalten. Die Testbedingungen zählen mit.