KI-Modelle lernen nun, sich ohne menschliches Eingreifen zu verbessern, indem sie ihre eigenen Fehler analysieren, anstatt sich auf von Experten bereitgestellte Beispiele zu stützen. Dieser Ansatz, genannt on-policy self-distillation (eine Technik, bei der das Modell seine Antworten verfeinert, indem es sich auf seine eigenen Versuche trainiert), konzentriert in dieser Woche einen wachsenden Teil der Forschung.
Über vier Wochen hinweg erwähnen 37 Artikel diesen Begriff, gegenüber 13 vier Wochen zuvor. Eine eng verwandte Variante, on-policy distillation (bei der mehrere Modelle zusammenarbeiten, um sich zu verbessern), erscheint in 86 Artikeln, was einem Anstieg von 53 Artikeln im Vergleich zur vorherigen Periode entspricht. Diese Methoden zielen darauf ab, die deployment cost (Bereitstellungskosten) von KI-Systemen zu senken, indem der Bedarf an von Menschen annotierten Daten begrenzt wird - ein Thema, das auch in den Titeln auftaucht: 23 Artikel erwähnen explizit deployment cost, gegenüber 7 zuvor.
Aktuelle Arbeiten untersuchen, wie Verzerrungen vermieden werden können, die durch privilegierte Informationen (Daten oder versteckte Regeln, die das Lernen verfälschen) entstehen - 29 Artikel behandeln dies, 19 mehr als vor einem Monat. Mehrere Studien testen auch controlled ablations (gezielte Entfernungen von Komponenten, um deren Auswirkungen zu messen), eine Praxis, die in 21 Artikeln vorkommt.
Einige aktuelle Beispiele:
- Rethinking Privileged Information in On-Policy Self-Distillation
- Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning
- Mitigating Rubric Interference in LLM Judges via On-Policy Self-Distillation
- Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL
- CROP: Task Relevance via Counterfactuals for Selective On-Policy Distillation
