KI-Systeme, die lernen, sich ohne menschliche Daten zu verbessern, nehmen nun einen zentralen Platz in der Forschung ein. In diesem Monat verzeichnen zwei mit diesem Ansatz verbundene Themen ein beispielloses Wachstum: Multi-Agenten-Systeme und Verhandlung (172 Artikel in vier Wochen, gegenüber 53 im Vormonat) und Informationssuche (149 Artikel, gegenüber 47). Diese beiden Bereiche teilen sich eine gemeinsame Technik, die on-policy self-distillation (OPSD), bei der Modelle ihre Antworten verfeinern, indem sie auf ihren eigenen Versuchen trainieren, anstatt auf von Menschen bereitgestellten Beispielen.
OPSD ist keine Neuheit, aber ihre massive Übernahme in konkreten Anwendungen markiert einen Wendepunkt. Die jüngsten Arbeiten begnügen sich nicht mehr damit, ihre Versprechen anzupreisen: Sie testen deren Grenzen. Drei Fragen tauchen in den Titeln dieses Monats immer wieder auf:
- Wie lässt sich vermeiden, dass sich das Modell mit privilegierten Informationen (versteckte Daten, die sein Lernen verzerren) selbst verfälscht? 29 Artikel behandeln dieses Thema, 19 mehr als im Juli.
- Wie lässt sich das Training stabilisieren, wenn Belohnungen selten oder verrauscht sind? 23 Artikel untersuchen den Einsatz von privileged information, um die Distillation zu steuern, und 20 weitere die token-level supervision (ein Lernsignal, das auf der Ebene jedes Wortes oder Symbols verfeinert wird).
- Wie lässt sich eine Antwort bis zu ihrer Quelle zurückverfolgen, um ihre Solidität zu überprüfen? Die Ausdrücke « evidence supports » (22 Artikel) und « local evidence » (17 Artikel) tauchen in Arbeiten auf, die die Zuverlässigkeit von schrittweisen Schlussfolgerungen bewerten.
Einige aktuelle Beispiele:
- Rethinking Privileged Information in On-Policy Self-Distillation
- Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning
- Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL
- RuleWeaver: Benchmarking Rule-Centered Scenario Reasoning for Large Language Models
- Neuro-symbolic PRM: Enhancing Scientific Reasoning via Structured Traces and Symbolic Verification
Diese Dynamik geht mit einem deutlichen Rückgang traditioneller Ansätze einher. Generative adversarial networks (268 Artikel, -23 % in einem Monat) und fortgeschrittene neuronale Netze (135 Artikel, -24 %) verlieren an Bedeutung, ebenso wie Explainability (107 Artikel, -38 %). Die Forschung scheint nun Systeme zu bevorzugen, die sich selbst verbessern können, selbst wenn dies auf Kosten eines Teils ihrer Transparenz geht.
