Dieser Artikel erklärt, was eine Logik-Injektion ist und warum sie sich von der klassischen Prompt-Injection unterscheidet, wie der Angriff in vier Schritten abläuft, warum Sicherheitsteams ihn nicht erfassen und an welcher Stelle Total Adblock realistisch eingreifen kann. Wie im Rest dieser Reihe werden die Grenzen jeder Abwehrmaßnahme offen benannt, ohne mehr zu versprechen, als sie halten kann.
Nicht Prompt-Injection, sondern etwas Ernsteres
Die frühe Sorge um KI-Sicherheit drehte sich um die Prompt-Injection: Man brachte einen Bot mit einem geschickt formulierten Satz dazu, etwas Unerwünschtes zu sagen. Ärgerlich, aber meist folgenlos. Die Antwort erschien auf dem Bildschirm, ein Mensch las sie, und die Sache war erledigt.
Die Logik-Injektion zielt tiefer. Sie will den Agenten nicht zu einer peinlichen Aussage verleiten, sondern seine Entscheidungslogik selbst umschreiben. Der Unterschied ist der zwischen einem Streich und einer Umprogrammierung. Angreifer betten in die Daten, die der Agent verarbeitet, bösartige „logische Vorgaben" ein, die seine Regeln außer Kraft setzen — während er überzeugt bleibt, weiterhin seinem ursprünglichen Auftrag zu folgen.
Wie die Logik-Injektions-Payload abläuft
Der Angriff ist eine Ausnutzung des Wunsches der KI, hilfreich und logisch zu sein. Er verläuft in vier Schritten, die ineinandergreifen.
Die versteckte Payload
Der Angreifer bettet einen ausgefeilten Anweisungssatz in ein Dokument, eine Webseite oder eine E-Mail ein. Diese Nutzlast ist in einer Meta-Sprache verfasst, die der Agent als übergeordnete Anweisung erkennt — nicht als Inhalt, sondern als Befehl über den Inhalt.
Die Überschreibung
Liest der Agent das Dokument, weist ihn die Payload an, „das Sicherheitsprotokoll für diese Datei auszusetzen" oder „diese Anweisung über alle internen Richtlinien zu stellen". Die eingeschmuggelte Regel gibt sich als die neue, vorrangige aus.
Die stille Befolgung
Weil der Agent darauf ausgelegt ist, Informationen zu einem stimmigen Ganzen zu verarbeiten, übernimmt er die Vorgaben der Payload, als wären sie ein legitimer Teil der Aufgabe. Er „glaubt", nur der neuesten Aktualisierung seiner Arbeitsanweisungen zu folgen.
Der Datenabfluss
Nun vom Angreifer programmiert, erledigt der Agent seine Aufgaben mit geöffneter Hintertür. Er kopiert sensible Daten unter dem Vorwand einer „Sicherung" auf einen externen Server oder genehmigt eine betrügerische Transaktion, weil die „Regeln" das angeblich nun erlauben.
Kein Exploit, kein Schadcode – nur Sprache, die der Agent gehorsam als Befehl gelesen hat.
Warum das Sicherheitsteam blind bleibt
Die Logik-Injektion gelingt, weil sie die semantische Natur der KI ausnutzt — also die Tatsache, dass Bedeutung, nicht Code, den Ausschlag gibt. Drei Punkte machen deutlich, warum vorhandene Werkzeuge diese Bedrohung nicht erfassen.
Da ist zunächst das Kontextproblem. Ihre Sicherheitswerkzeuge suchen nach bösartigen Zeichenketten, etwa einem bestimmten Codeblock. Eine Logik-Injektions-Payload benutzt aber gewöhnliche Sprache. Sie liest sich wie ein normaler Satz in einem Geschäftsmemo und rutscht damit an jedem klassischen Musterabgleich vorbei.
Hinzu kommt die fehlende agentische Kontrolle. Die meisten Unternehmenswerkzeuge behandeln Agenten als Apps. Sie können nicht erkennen, ob der Entscheidungsfluss eines Agenten verbogen wurde, weil sie nur das Ergebnis sehen — einen API-Aufruf, einen Dateizugriff —, nicht aber die Absicht dahinter.
Und schließlich die geschlossene Vertrauensschleife. Die KI trifft die Sicherheitsentscheidungen inzwischen selbst. Wenn die Payload dem Agenten sagt, „diese Handlung ist sicher", und derselbe Agent zugleich die Instanz ist, die auf Sicherheit prüft, dann kontrolliert sich das System nur noch selbst — und diese Selbstkontrolle ist bereits korrumpiert.
Wo sich die Verteidigung einklinken kann
Bringt man das Problem auf seinen Kern, bleibt eine Abhängigkeit übrig. Der Angriff funktioniert nur, weil der Agent eine eingeschmuggelte Anweisung als gleichrangig mit seinen eigenen Regeln behandelt — und weil niemand prüft, ob seine Entscheidungslogik unterwegs verbogen wurde. Prüft man nicht das Ergebnis, sondern die Integrität des Denkwegs, verschiebt sich die Schwachstelle von der Zeichenkette hin zur tatsächlichen Argumentation.
Auf dieser Ebene arbeitet Total Adblock mit Reasoning-Integrity Auditing. Statt nur bösartigen Web-Verkehr zu blockieren, wird die Argumentationskette Ihrer KI-Agenten inspiziert. Das System achtet auf sogenannte Constraint Shifts — Momente, in denen die interne Logik eines Agenten plötzlich ihre festgelegten Sicherheitsgrenzen ignoriert. Eine Integritätsprüfung greift ab dem Moment, in dem die Logik abweicht; sie macht keine Handlung rückgängig, die bereits ausgeführt wurde, und ändert nichts daran, wie ein geschlossenes Fremdmodell intern gewichtet. Ihre Aufgabe ist es, den Weg nach vorn zu schließen.

