<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Red-Teaming on .kais blog</title><link>https://blog.0x2e6b6169.de/tags/red-teaming/</link><description>Recent content in Red-Teaming on .kais blog</description><generator>Hugo</generator><language>de-de</language><lastBuildDate>Mon, 27 Jul 2026 07:35:00 +0200</lastBuildDate><atom:link href="https://blog.0x2e6b6169.de/tags/red-teaming/index.xml" rel="self" type="application/rss+xml"/><item><title>Die Kiste war nie das Problem</title><link>https://blog.0x2e6b6169.de/posts/2026-07-27-ai-box-experiment/</link><pubDate>Mon, 27 Jul 2026 07:35:00 +0200</pubDate><guid>https://blog.0x2e6b6169.de/posts/2026-07-27-ai-box-experiment/</guid><description>&lt;h2 id="-das-vertraute-bild"&gt;🌍 Das vertraute Bild&lt;a class="heading-anchor" href="#-das-vertraute-bild" aria-label="Link zu diesem Abschnitt"&gt;&lt;/a&gt;&lt;/h2&gt;
&lt;p&gt;Eliezer Yudkowsky stellte 2002 ein Gedankenexperiment vor: Eine übermenschliche KI sitzt in einer Kiste, ein Mensch bewacht das Tor. Kann sie ihn allein durch Worte zum Öffnen bewegen? Yudkowsky spielte es durch und gewann mehrfach. Stuart Armstrong, Anders Sandberg und Nick Bostrom entwarfen die Gegenmaßnahme: eine „Oracle AI&amp;quot;, die nur antwortet, nie handelt. Die Debatte kreiste um Überredung und den schwachen Menschen am Schloss.&lt;/p&gt;</description></item><item><title>Die letzte Leitplanke</title><link>https://blog.0x2e6b6169.de/posts/2026-07-24-letzte-leitplanke/</link><pubDate>Fri, 24 Jul 2026 07:35:00 +0200</pubDate><guid>https://blog.0x2e6b6169.de/posts/2026-07-24-letzte-leitplanke/</guid><description>&lt;h2 id="-was-beobachte-ich"&gt;🔍 Was beobachte ich?&lt;a class="heading-anchor" href="#-was-beobachte-ich" aria-label="Link zu diesem Abschnitt"&gt;&lt;/a&gt;&lt;/h2&gt;
&lt;p&gt;Ich sehe Organisationen, die ihre KI-Anwendungen mit Leitplanken versehen und das Thema damit für abgeschlossen halten. Der Filterkatalog wächst, jeder bekannt gewordene Jailbreak bekommt seine eigene Regel. In der Freigabe steht dann: gegen Prompt-Injection abgesichert.&lt;/p&gt;
&lt;h2 id="-was-soll-eigentlich-erreicht-werden"&gt;🎯 Was soll eigentlich erreicht werden?&lt;a class="heading-anchor" href="#-was-soll-eigentlich-erreicht-werden" aria-label="Link zu diesem Abschnitt"&gt;&lt;/a&gt;&lt;/h2&gt;
&lt;p&gt;Das Ziel ist berechtigt. Ein KI-System soll nur das tun, was die Organisation will. Keine Deepfakes, keine Schadsoftware, keine Bauanleitung für Biowaffen. Leitplanken sind der naheliegende Weg dorthin.&lt;/p&gt;</description></item></channel></rss>