Die letzte Leitplanke

đ Was beobachte ich?
Ich sehe Organisationen, die ihre KI-Anwendungen mit Leitplanken versehen und das Thema damit fĂŒr abgeschlossen halten. Der Filterkatalog wĂ€chst, jeder bekannt gewordene Jailbreak bekommt seine eigene Regel. In der Freigabe steht dann: gegen Prompt-Injection abgesichert.
đŻ Was soll eigentlich erreicht werden?
Das Ziel ist berechtigt. Ein KI-System soll nur das tun, was die Organisation will. Keine Deepfakes, keine Schadsoftware, keine Bauanleitung fĂŒr Biowaffen. Leitplanken sind der naheliegende Weg dorthin.
â ïž Warum funktioniert das nicht?
Weil kein endlicher Regelsatz das leisten kann. Apostol Vassilev hat das im Mai 2026 bewiesen, aufbauend auf Kurt Gödels erstem UnvollstĂ€ndigkeitssatz von 1931: Ein widerspruchsfreies Regelsystem von hinreichender Ausdruckskraft bleibt unvollstĂ€ndig. Man kann Regeln nachlegen und steht danach wieder am selben Punkt. Dazu kommt die Eingabe selbst, menschliche Sprache: Ihre Mehrdeutigkeit macht die Zahl der Verstecke fĂŒr böse Absicht praktisch unbegrenzt. Es gibt immer einen Prompt, der die Regeln aushebelt; er muss nur gefunden werden.
đĄ Was funktioniert besser?
Vassilev nennt drei Elemente: dauerhaftes Red-Teaming, kontinuierliches NachhĂ€rten der Leitplanken und operative Resilienz, die den Schaden begrenzt, wenn ein Angriff durchkommt. Nicht falls. Das Ziel ist dann kein Sicherheitsversprechen mehr, sondern ein ökonomisches: Der nĂ€chste Angriff soll mehr kosten, als er einbringt. Das klingt nach Kapitulation. Ich halte es fĂŒr die einzig ehrliche Position.
Wer KI einsetzt, bestreitet einen Wettlauf zwischen Hase und Igel. Gestalten lÀsst der sich. Gewinnen nicht.
đđ
- NIST: Mathematical Proof Supports Transition to a Continuous-Monitor-and-Update Security Model for AI Systems https://www.nist.gov/news-events/news/2026/06/nist-mathematical-proof-supports-transition-continuous-monitor-and-update
- Apostol Vassilev: Robust AI Security and Alignment â A Sisyphean Endeavor? (NIST CSRC, Volltext) https://csrc.nist.gov/pubs/journal/2026/05/robust-ai-security-and-alignment-a-sisyphean-endea/final
- Gödel’s Incompleteness Theorems (Stanford Encyclopedia of Philosophy) https://plato.stanford.edu/entries/goedel-incompleteness/
- 3Blue1Brown: But what is a GPT? Visual intro to transformers https://www.youtube.com/watch?v=wjZofJX0v4M
- 3Blue1Brown: Attention in transformers, step-by-step (Kapitel 6) https://www.youtube.com/watch?v=eMlx5fFNoYc