Los sistemas de IA que actúan como asistentes autónomos -los agentes- están cambiando de estatus: ya no nos preguntamos solo qué pueden hacer, sino cómo evitar que se descarrilen.
La expresión agent harnesses (los marcos de software que enmarcan a estos agentes) aparece en 33 artículos en cuatro semanas, frente a 9 cuatro semanas antes. Los títulos muestran que el problema ya no es teórico: los atacantes pueden desviar estos marcos para hacer ejecutar comportamientos maliciosos, y los agentes conservan estos sesgos incluso cuando se transfieren a nuevos servidores o se cambia su modelo subyacente.
Tres artículos ilustran esta preocupación:
- A Blind Trust, the Bloody Thrust: When Attacker-Controlled Hook Updates Steer AI Agent Harnesses towards Malicious Behaviors
- MemoryWalker: Stop Training Agents on Contexts They Never Saw
- CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses?
El tema va más allá de la simple ciberseguridad: los mismos artículos hablan de language-model agents (28 artículos en cuatro semanas), estos agentes que reproducen sesgos humanos como la discriminación entre grupos, o que fallan al verificar las pruebas disponibles antes de tomar una decisión. La expresión failed trajectories (las secuencias de acciones que llevan a un fracaso) aparece en 20 artículos, a menudo para describir métodos que supervisan las etapas clave de un agente en lugar de su resultado final.
