Los sistemas de IA que aprenden a mejorarse sin datos humanos ocupan ahora un lugar central en la investigación. Este mes, dos temas relacionados con este enfoque experimentan un crecimiento sin igual: los sistemas multiagentes y la negociación (172 artículos en cuatro semanas, frente a 53 el mes anterior) y la búsqueda de información (149 artículos, frente a 47). Estos dos ámbitos comparten una misma técnica, el on-policy self-distillation (OPSD), donde los modelos afinan sus respuestas entrenándose con sus propios intentos en lugar de con ejemplos proporcionados por humanos.
El OPSD no es una novedad, pero su adopción masiva en aplicaciones concretas marca un punto de inflexión. Los trabajos recientes ya no se limitan a ensalzar sus promesas: ponen a prueba sus límites. Tres preguntas se repiten en los títulos del mes:
- ¿Cómo evitar que el modelo se distorsione a sí mismo con información privilegiada (datos ocultos que sesgan su aprendizaje)? 29 artículos abordan este tema, 19 más que en julio.
- ¿Cómo estabilizar el entrenamiento cuando las recompensas son escasas o ruidosas? 23 artículos exploran el uso de privileged information para guiar la destilación, y otros 20 la token-level supervision (una señal de aprendizaje afinada a nivel de cada palabra o símbolo).
- ¿Cómo rastrear una respuesta hasta su fuente para verificar su solidez? Las expresiones «evidence supports» (22 artículos) y «local evidence» (17 artículos) aparecen en trabajos que evalúan la fiabilidad de los razonamientos paso a paso.
Algunos ejemplos recientes:
- Rethinking Privileged Information in On-Policy Self-Distillation
- Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning
- Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL
- RuleWeaver: Benchmarking Rule-Centered Scenario Reasoning for Large Language Models
- Neuro-symbolic PRM: Enhancing Scientific Reasoning via Structured Traces and Symbolic Verification
Esta dinámica viene acompañada de un retroceso marcado de los enfoques tradicionales. Las redes neuronales generativas adversarias (268 artículos, -23 % en un mes) y las redes neuronales avanzadas (135 artículos, -24 %) pierden terreno, al igual que la explicabilidad (107 artículos, -38 %). La investigación parece privilegiar ahora sistemas capaces de mejorarse por sí solos, aunque sea a costa de sacrificar parte de su transparencia.
