Los modelos de IA aprenden ahora a mejorarse sin intervención humana, analizando sus propios errores en lugar de basarse en ejemplos proporcionados por expertos. Este enfoque, llamado on-policy self-distillation (una técnica donde el modelo refina sus respuestas entrenándose con sus propios intentos), concentra una parte creciente de las investigaciones esta semana.
En cuatro semanas, 37 artículos mencionan esta expresión, frente a 13 cuatro semanas antes. Una variante cercana, on-policy distillation (donde varios modelos colaboran para mejorarse), aparece en 86 artículos, lo que supone un aumento de 53 artículos respecto al período anterior. Estos métodos buscan reducir el costo de despliegue de los sistemas de IA limitando la necesidad de datos etiquetados por humanos, un desafío que también aparece en los títulos: 23 artículos mencionan explícitamente el deployment cost (costo de despliegue), frente a 7 anteriormente.
Los trabajos recientes exploran cómo evitar los sesgos introducidos por informaciones privilegiadas (datos o reglas ocultas que distorsionan el aprendizaje) - 29 artículos hablan de ello, es decir, 19 más que hace un mes. Varias investigaciones también prueban controlled ablations (eliminaciones selectivas de componentes para medir su impacto), una práctica presente en 21 artículos.
Algunos ejemplos recientes:
- Rethinking Privileged Information in On-Policy Self-Distillation
- Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning
- Mitigating Rubric Interference in LLM Judges via On-Policy Self-Distillation
- Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL
- CROP: Task Relevance via Counterfactuals for Selective On-Policy Distillation
