🟡 Der erste Riss

Das Forschungsteam von 1Password hat zwei Frontier-Modelle auf sechs frisch gemeldete, hochkomplexe Schwachstellen angesetzt: Linux-Kernel, Chromium, Exim, Spring AI, ActiveMQ, Gemini CLI. Das Ergebnis: 26 Prozent der Patches schließen die Lücke sauber, 20 Prozent nur um den Preis geänderten Verhaltens. Die Hälfte lässt mindestens einen Angriffspfad offen. Fast jeder zwanzigste reißt eine neue Lücke auf. Das Team nennt solche Artefakte F.L.A.W.E.D.: Fix-Like Artifacts With Embedded Defects. Sie haben die Form eines Fixes.

🟠 Die Ausbreitung

Beunruhigender als die Quote ist, wie die Patches scheitern. Die Modelle patchen den Pfad, den der Proof of Concept zeigt, und übersehen den parallelen daneben. Sie setzen eine Prüfung vor den verwundbaren Code, statt ihn zu ersetzen. 37 Prozent der erfolgreichen Fixes bleiben so brüchig. Der Reproducer meldet grün, das Modell hört auf zu suchen. Es optimiert auf das Signal, nicht auf die Eigenschaft, die wir meinen.

🔴 Der Kipppunkt

Zwei Befunde kippen das Bild. Erstens: Ein falscher Hinweis auf die Ursache senkt die Erfolgsquote von 50 auf 15 Prozent. Gar kein Hinweis schadet weniger als ein falscher. Die Modelle folgen der Vorgabe selbst dann, wenn ihre eigenen Tool-Aufrufe sie widerlegen. Eine Pipeline, in der ein KI-Agent findet und ein zweiter fixt, reicht solche Irrtümer ungeprüft weiter. Zweitens: Beim Kernel-Bug „Copy Fail" erzeugte ein Drittel der Patches denselben Off-by-one-Fehler, den die Kernel-Maintainer selbst ausgeliefert und einen Commit später korrigiert hatten. Der automatische Validator hielt diese Patches für sauber. Die Maschine, die prüft, hatte denselben blinden Fleck wie die, die schreibt.

🛡️ Was noch möglich ist

Das Team rechnet nüchtern: Ein unbeaufsichtigter KI-Patch hat einen negativen Erwartungswert. Als Assistenz in der Hand von Fachleuten, die den Code kennen, bleiben die Modelle nützlich. Wer mehr Automatisierung will, sollte vorher messen, wie die Modelle bei den eigenen, längst behobenen Schwachstellen abschneiden. Und die Review-Frage ändern: nicht, ob der Test grün ist, sondern ob die Ursache verschwunden ist. Ein Modell, das nicht merkt, wann es die Lage verschlechtert hat, braucht jemanden, der es merkt.

📚🔍