KI-Systeme, die als autonome Assistenten agieren - die Agenten - ändern ihren Status: Es geht nicht mehr nur darum, was sie tun können, sondern wie man verhindert, dass sie entgleisen.
Der Begriff agent harnesses (die Software-Frameworks, die diese Agenten einrahmen) taucht in 33 Artikeln über vier Wochen auf, gegenüber 9 vier Wochen zuvor. Die Titel zeigen, dass das Problem nicht mehr theoretisch ist: Angreifer können diese Frameworks kapern, um schädliche Verhaltensweisen ausführen zu lassen, und die Agenten behalten diese Verzerrungen selbst dann bei, wenn sie auf neue Server übertragen oder ihr zugrundeliegendes Modell geändert wird.
Drei Artikel veranschaulichen diese Besorgnis:
- A Blind Trust, the Bloody Thrust: When Attacker-Controlled Hook Updates Steer AI Agent Harnesses towards Malicious Behaviors
- MemoryWalker: Stop Training Agents on Contexts They Never Saw
- CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses?
Das Thema geht über die reine Cybersicherheit hinaus: Dieselben Artikel sprechen von language-model agents (28 Artikel über vier Wochen), diese Agenten, die menschliche Verzerrungen wie Diskriminierung zwischen Gruppen reproduzieren oder es versäumen, verfügbare Beweise zu überprüfen, bevor sie eine Entscheidung treffen. Der Begriff failed trajectories (die Aktionssequenzen, die zu einem Scheitern führen) taucht in 20 Artikeln auf, oft um Methoden zu beschreiben, die die Schlüsselphasen eines Agenten überwachen, anstatt nur sein Endergebnis.
