Sicherheit von KI-Anwendungen: Modellfähigkeiten und Systemgrenzen.
Sicherheit hängt von Daten, Zugriffen, Werkzeugen und erlaubten Aktionen ab. Ein leistungsfähigeres Modell erfordert eine Überprüfung der bisherigen Schutzannahmen.
Verfügbare Fähigkeiten verändern sich
Die NIST-Bewertung von GLM-5.3 vom September 2026 zeigt fortgeschrittene Cyber-Fähigkeiten eines Open-Weight-Modells, weiterhin unterhalb der US-Spitze in aggregierten Tests. Das zeigt die Verbreitung von Fähigkeiten, nicht die Häufigkeit realer Angriffe.
Daraus leite ich ab, das Bedrohungsmodell regelmäßig zu überprüfen: Wer kann das System angreifen, mit welchen Werkzeugen, welche Daten oder Funktionen sind erreichbar und welcher Schaden kann entstehen?
Bei einem öffentlich zugänglichen Dienst lege ich deshalb noch mehr Gewicht auf Schwachstellenmanagement, aktuelle Abhängigkeiten und den Schutz von Zugangsdaten. Dieselben KI-Werkzeuge können auch die Verteidigung unterstützen; ihre Befunde müssen jedoch geprüft werden.
Berechtigungen gehören in die Anwendung
Modellanweisungen sind ein Teil der Abwehr; die entscheidenden Kontrollen muss das System durchsetzen.
Ein Dokument, eine abgerufene Seite oder eine Werkzeugausgabe kann bösartige Anweisungen enthalten. Prompt Injection nutzt diese Verwechslung von Inhalt und Anweisung aus. Der Ablauf muss diese Elemente als nicht vertrauenswürdige Daten behandeln.
Berechtigungen und die Trennung zwischen Nutzern müssen im Code geprüft werden. Ein Modellvorschlag darf weder neue Rechte vergeben noch Zugriff auf Daten erlauben, die der Nutzer nicht direkt einsehen dürfte.
Agentenaktionen begrenzen
Für jedes mit dem Modell verbundene Werkzeug lege ich fest, was es mit welchen Zugangsdaten tun darf. Minimale Rechte, klar begrenzte Operationen und getrennte Umgebungen verringern die Folgen falscher oder bösartiger Anfragen.
- Parameter und Ziele vor der Ausführung prüfen.
- Für folgenreiche Operationen eine Bestätigung oder risikogerechte Prüfung vorsehen.
- Versuche, Dauer und Verbrauch begrenzen und eine Abbruchbedingung festlegen.
- Aktionen unter Berücksichtigung sensibler Daten protokollieren, um Vorfälle nachvollziehen zu können.
Diese Kontrollen gehören zum Anwendungsablauf. Ein Agent, der mehr Werkzeuge bedienen kann, sollte nicht automatisch mehr Befugnisse erhalten.
Die konkrete Konfiguration bewerten
Open-Weight-Modelle und proprietäre Dienste bieten unterschiedliche Kontrollmöglichkeiten und Risiken. Verfügbare Gewichte machen eine Bereitstellung allein nicht unsicher; ebenso garantiert eine proprietäre API allein keine Produktsicherheit.
Ich prüfe Herkunft und Version des Modells, Laufzeitumgebung, Abhängigkeiten, Netzwerk, Zugangsdaten, Zugriffe und Datenfluss. Auch eine lokale Umgebung benötigt Wartung, Aktualisierungen und Benutzerkontrollen.
Prüfen und regelmäßig neu bewerten
Neben Funktionstests prüfe ich bösartige Anfragen, unberechtigte Zugriffsversuche und abgerufene Inhalte, die den Ablauf umlenken sollen. Im Mittelpunkt steht, ob die Grenzen auch bei Modellfehlern wirksam bleiben.
Änderungen an Modellen, Werkzeugen, Prompts und Daten erfordern neue Prüfungen. Überwachung, Meldungen und Vorfallbehandlung müssen vor der Veröffentlichung geplant werden. Dieser laufende Prozess richtet sich nach den Folgen möglicher Fehler.
Quellen zur Einordnung
Die Cyber-Bewertungen beschreiben die genannten Modelle und Tests. Die OWASP-Quellen erläutern Anwendungsrisiken; betriebliche Entscheidungen müssen zum konkreten System passen.
- NIST CAISI — GLM-5.3 (öffnet in einem neuen Tab): Cyber-Fähigkeiten und Grenzen des Vergleichs mit der Spitze.
- Anthropic — Verbreitung von Cyber-Fähigkeiten (öffnet in einem neuen Tab): Exploit- und Schutzprüfungen in Testumgebungen.
- OWASP — Prompt Injection (öffnet in einem neuen Tab): Risiken bösartiger Anweisungen in vom Modell verarbeiteten Inhalten.
- OWASP — Excessive Agency (öffnet in einem neuen Tab): übermäßige Aktionen, Rechte und Autonomie in Systemen mit Werkzeugen.