Emergence-LogoEmergence

Emergence - arXiv-KI-Observatorium

Digest-Archiv

Der Digest per E-Mail

Digest abonnieren

Eine E-Mail am Montagmorgen: was sich in der KI-Forschung letzte Woche bewegt hat. Kein Spam, Abmeldung mit einem Klick.

AlleWocheMonatQuartal
Wöchentlich28. September 2026

Die KI-Modelle, die menschliche Sprache verstehen und generieren, gewinnen an Präzision, aber auch an Methoden zur Bewertung dieser Präzision. In dieser Woche dominieren Spracherkennung und -synthese (Speech Recognition and Synthesis) mit 112 veröffentlichten Artikeln in vier Wochen, gegenüber 63 vier Wochen zuvor.

Das Auftreten des Begriffs operating characteristic curve (Betriebscharakteristik-Kurve, ein Werkzeug, das die Fähigkeit eines Modells misst, richtige von falschen Antworten zu unterscheiden) in 18 Artikeln zeigt, dass sich Forscher nicht mehr damit begnügen, Fehler zu zählen. Sie analysieren auch, wie sich diese Fehler je nach Kontext verteilen - beispielsweise ein Modell, das männliche Stimmen besser erkennt als weibliche oder bei regionalen Akzenten ins Stocken gerät.

Drei aktuelle Artikel veranschaulichen diesen Trend:

Im gleichen Bereich beschäftigen sich zwei weitere aktuelle Artikel mit der Robustheit von Modellen gegenüber Sprachen oder Situationen, die in den Trainingsdaten wenig repräsentiert sind:

Link zu dieser Ausgabe →

Wöchentlich21. September 2026

Systeme, die bei der Suche nach Experten oder der Beantwortung technischer Fragen helfen, erleben eine erneute Aktivitätswelle.

Über vier Wochen hinweg wurden 62 Artikel zu Expertensuche und Fragen-Antwort-Systemen (Expert finding and Q&A systems) veröffentlicht, gegenüber 25 vier Wochen zuvor. Dieser Anstieg zeigt sich vor allem in der Bewertung von Modellen und der Aufgabenverteilung zwischen Menschen und Maschinen.

Drei aktuelle Artikel veranschaulichen diesen Trend:

Der Begriff training seeds (19 Artikel über vier Wochen, gegenüber 7 zuvor) taucht in Arbeiten auf, die die Robustheit von Modellen gegenüber verzerrten oder unvollständigen Ausgangsdaten testen. Er bezeichnet die anfänglichen Beispiele, die zum Trainieren eines Systems verwendet werden, bevor es eigene Daten generiert.

Link zu dieser Ausgabe →

Wöchentlich14. September 2026

Autonome Agenten, die sich ohne menschliches Eingreifen selbst verbessern können, werden zu einem zentralen Thema in der KI.

Über vier Wochen hinweg haben 16 Artikel den Ausdruck recursive self-improvement (rekursive Selbstverbesserung) verwendet, gegenüber 6 vor vier Wochen. Diese Technik ermöglicht es einem System, seine eigenen Fehler zu analysieren und seine Funktionsweise zu modifizieren, um Fortschritte zu erzielen, ohne von externen Daten oder einem menschlichen Bediener abhängig zu sein. Aktuelle Arbeiten untersuchen formale Rahmenwerke, um diesen Prozess zu steuern, sowie konkrete Anwendungen, wie Agenten, die neue Umgebungen autonom erkunden können.

Hier sind drei repräsentative Artikel zu diesem Trend:

Weitere stark wachsende Begriffe in dieser Woche, wie language-model agents (29 Artikel gegenüber 12) oder agent harnesses (23 Artikel gegenüber 11), zeigen, dass sich die Forschung auf die Software-Infrastrukturen konzentriert, die es diesen Agenten ermöglichen, zuverlässig und skalierbar zu funktionieren.

Link zu dieser Ausgabe →

Wöchentlich7. September 2026

KI-Systeme, die sich selbst verbessern können, gewinnen an Aufmerksamkeit.

Der Begriff recursive self-improvement (rekursive autonome Verbesserung, bei der ein Modell seine eigene Leistung ohne menschliches Eingreifen optimiert) taucht in 17 Artikeln innerhalb von vier Wochen auf, gegenüber 6 vier Wochen zuvor. Dieses Thema tritt vor allem in Arbeiten zu autonomen Agenten auf - Programmen, die komplexe Aufgaben ohne Aufsicht aneinanderreihen.

Drei aktuelle Artikel veranschaulichen diesen Trend:

Die Forschung befasst sich auch mit agent harnesses (Bewertungsrahmen für Agenten, die deren Ziele und Einschränkungen definieren): 28 Artikel in vier Wochen, gegenüber 10 zuvor. Diese Rahmen zielen darauf ab, Agenten zuverlässiger bei langfristigen Aufgaben (long-horizon) zu machen, wie etwa Projektmanagement oder Entscheidungsfindung über längere Zeiträume. Zwei Beispiele:

Link zu dieser Ausgabe →

Wöchentlich31. August 2026

KI-Systeme, die als autonome Assistenten agieren - die Agenten - ändern ihren Status: Es geht nicht mehr nur darum, was sie tun können, sondern wie man verhindert, dass sie entgleisen.

Der Begriff agent harnesses (die Software-Frameworks, die diese Agenten einrahmen) taucht in 33 Artikeln über vier Wochen auf, gegenüber 9 vier Wochen zuvor. Die Titel zeigen, dass das Problem nicht mehr theoretisch ist: Angreifer können diese Frameworks kapern, um schädliche Verhaltensweisen ausführen zu lassen, und die Agenten behalten diese Verzerrungen selbst dann bei, wenn sie auf neue Server übertragen oder ihr zugrundeliegendes Modell geändert wird.

Drei Artikel veranschaulichen diese Besorgnis:

Das Thema geht über die reine Cybersicherheit hinaus: Dieselben Artikel sprechen von language-model agents (28 Artikel über vier Wochen), diese Agenten, die menschliche Verzerrungen wie Diskriminierung zwischen Gruppen reproduzieren oder es versäumen, verfügbare Beweise zu überprüfen, bevor sie eine Entscheidung treffen. Der Begriff failed trajectories (die Aktionssequenzen, die zu einem Scheitern führen) taucht in 20 Artikeln auf, oft um Methoden zu beschreiben, die die Schlüsselphasen eines Agenten überwachen, anstatt nur sein Endergebnis.

Link zu dieser Ausgabe →

Wöchentlich24. August 2026

KI-Modelle, die nach expliziten Regeln statt durch das Erraten von Antworten schlussfolgern, erleben ein erneutes Interesse.

Das Thema Semantic Web und Ontologien (Semantic Web and Ontologies) steigt von 10 auf 60 Artikel in vier Wochen - der deutlichste Anstieg im Beobachtungszeitraum. Diese Arbeiten untersuchen, wie Wissen strukturiert werden kann, damit Systeme es logisch verarbeiten können, ähnlich wie ein Mensch es mit klaren Definitionen und Verknüpfungen tun würde. Drei Begriffe tauchen in diesem Zusammenhang auf:

  • „points above“ (17 Artikel) bezeichnet gemessene Abweichungen zwischen einer Vorhersage und einer Referenz, oft genutzt, um die Robustheit einer Schlussfolgerung zu bewerten;
  • „evidence supports“ (22 Artikel) erscheint in Titeln, die überprüfen, ob die Schritte eines Schlussfolgerungsprozesses auf überprüfbaren Fakten beruhen;
  • „local evidence“ (17 Artikel) bezieht sich auf Hinweise, die aus einem begrenzten Teil der Daten extrahiert werden, statt aus einer globalen Analyse.

Zu den repräsentativen Artikeln gehören:

Diese Methoden zielen auf Bereiche ab, in denen Fehler teuer sind - medizinische Diagnosen, Softwareüberprüfung, Analyse regulatorischer Dokumente - , indem sie die Ungenauigkeit statistischer Modelle durch nachvollziehbare Regelketten ersetzen.

Link zu dieser Ausgabe →

Wöchentlich17. August 2026

KI-Modelle lernen nun, sich ohne menschliches Eingreifen zu verbessern, indem sie ihre eigenen Fehler analysieren, anstatt sich auf von Experten bereitgestellte Beispiele zu stützen. Dieser Ansatz, genannt on-policy self-distillation (eine Technik, bei der das Modell seine Antworten verfeinert, indem es sich auf seine eigenen Versuche trainiert), konzentriert in dieser Woche einen wachsenden Teil der Forschung.

Über vier Wochen hinweg erwähnen 37 Artikel diesen Begriff, gegenüber 13 vier Wochen zuvor. Eine eng verwandte Variante, on-policy distillation (bei der mehrere Modelle zusammenarbeiten, um sich zu verbessern), erscheint in 86 Artikeln, was einem Anstieg von 53 Artikeln im Vergleich zur vorherigen Periode entspricht. Diese Methoden zielen darauf ab, die deployment cost (Bereitstellungskosten) von KI-Systemen zu senken, indem der Bedarf an von Menschen annotierten Daten begrenzt wird - ein Thema, das auch in den Titeln auftaucht: 23 Artikel erwähnen explizit deployment cost, gegenüber 7 zuvor.

Aktuelle Arbeiten untersuchen, wie Verzerrungen vermieden werden können, die durch privilegierte Informationen (Daten oder versteckte Regeln, die das Lernen verfälschen) entstehen - 29 Artikel behandeln dies, 19 mehr als vor einem Monat. Mehrere Studien testen auch controlled ablations (gezielte Entfernungen von Komponenten, um deren Auswirkungen zu messen), eine Praxis, die in 21 Artikeln vorkommt.

Einige aktuelle Beispiele:

Link zu dieser Ausgabe →

Wöchentlich10. August 2026

Diese Woche konzentriert sich die Aufmerksamkeit auf eine Optimierungstechnik für Suchagenten: on-policy self-distillation (OPSD). 18 Artikel behandeln das Thema, gegenüber 6 vor vier Wochen, und der Begriff taucht in drei der aktuell dynamischsten Themen auf - Information Retrieval and Search Behavior (88 Artikel, +60 in einem Monat), Multi-Agent Systems and Negotiation (104 Artikel, +45) und language-model agents (18 Artikel, +11).

Die Titel zeigen eine Erkundung der Grenzen des Verfahrens:

Zwei Varianten zeichnen sich ab: die Nutzung von privileged information (23 Artikel, +13), um die Distillation zu steuern, und die token-level supervision (20 Artikel, +11), um das Lernsignal zu verfeinern. Diese Ansätze zielen darauf ab, das Training von Agenten in Umgebungen zu stabilisieren, in denen Belohnungen selten oder verrauscht sind, wie etwa bei der Informationssuche oder der Verhandlung zwischen Agenten.

Link zu dieser Ausgabe →

Wöchentlich3. August 2026

Die Woche vom 3. August umfasst 2 008 aufgenommene Artikel, gegenüber 1 385 in der Vorwoche. Drei benachbarte Unterthemen steigen gemeinsam: Information Retrieval und Suchverhalten (73 Artikel über vier Wochen gegenüber 26 in den vier Wochen davor), Empfehlungssysteme (59 gegenüber 27) und persönliches Informationsmanagement (42 gegenüber 26).

Hinter diesen drei Bezeichnungen steht eine einzige Bewegung: Such- und Empfehlungssysteme werden rund um Agenten auf Basis von Sprachmodellen neu geschrieben. Die Titel der Woche handeln weniger davon, was diese Agenten versprechen, als davon, wie sie geprüft werden. Was ihre Repräsentationen taugen, was geschieht, wenn ihr eigener Verlauf sie in die Irre führt, wie sich eine Antwort bis zu ihrer Quelle zurückverfolgen lässt.

Zum Lesen: PoolBench: A Benchmark for Pooling Strategies in Concept Representation Evaluation for Decoder-Only LLMs When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories Universal Pathologies, Conditional Consequences: A Triple-Robustness Analysis of RAG for Multi-Hop Traceability A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing

Link zu dieser Ausgabe →

Wöchentlich27. Juli 2026

Diese Woche konzentriert sich die KI-Forschung auf die Informationssuche und das Nutzerverhalten: 40 in den letzten vier Wochen veröffentlichte Artikel, gegenüber 30 in der vorherigen Periode. Das Thema geht nun über Gehirn-Maschine-Schnittstellen und Empfehlungssysteme hinaus, die ebenfalls im Aufschwung sind.

Drei Trends zeichnen sich in den Titeln ab:

  • Die Optimierung kommerzieller Ergebnisse, mit Modellen, die abgeleitete Suchintentionen generieren, um die Auffindbarkeit von Produkten zu verbessern.
  • Die semantische Suche in Open-Source-Codebasen, bei der neuronale embeddings klassische Textanfragen ersetzen.
  • Die Steuerung von retrieval-augmented generation (RAG)-Systemen durch explizite semantische Constraints, um Abweichungen in generierten Antworten zu vermeiden.

Diese Woche zu lesen: Improving Item Discoverability in e-Commerce Search via Related Intent Generation MediaWiki Code2Code Search: Neural Retrieval for the Semantic Discovery of Open-Source Software Entities GuidedRAG: Semantic Steering of Retrieval-Augmented Generation

Link zu dieser Ausgabe →

Wöchentlich20. Juli 2026

Diese Woche schreitet in der KI-Forschung nur ein Thema voran: Algorithmen und Architekturen für das Quantencomputing. In den letzten vier Wochen wurden 74 Artikel veröffentlicht, gegenüber 60 in der vorherigen Periode.

Drei aktuelle Arbeiten veranschaulichen diesen Trend:

Die anderen überwachten Bereiche gehen zurück oder stagnieren, ohne nennenswerte Entwicklungen zu verzeichnen.

Link zu dieser Ausgabe →

Wöchentlich13. Juli 2026

Diese Woche bestätigt die Quantenalgorithmen-Forschung ihr wiedererstarktes Interesse: 70 Artikel in den letzten vier Wochen, gegenüber 62 in der vorherigen Periode. Das Thema bleibt das einzige mit Wachstum unter den verfolgten Themen, mit einem bescheidenen, aber kontinuierlichen Anstieg seit drei Wochen.

Die jüngsten Arbeiten erkunden konkrete Anwendungen, insbesondere die Post-Quanten-Kryptographie und die Erweiterung multimodaler Daten. Drei bemerkenswerte Beispiele:

Link zu dieser Ausgabe →

Wöchentlich6. Juli 2026

Diese Woche bestätigt das Thema Scientific Computing and Data Management seine Dynamik mit 102 veröffentlichten Artikeln über vier Wochen, gegenüber 91 in der vorherigen Periode. Das Wachstum (+11 Artikel) wird durch Arbeiten an der Schnittstelle von großen Sprachmodellen und dem Management wissenschaftlicher Daten getragen.

Drei Themen zeichnen sich in den Titeln ab:

  • Die Integration von LLM in Data-Science-Workflows, mit Bewertungen ihrer automatisch generierten Fähigkeiten.
  • Die Rückverfolgbarkeit von Daten, insbesondere durch Watermarking-Methoden für Trajektorien von LLM-basierten Agenten.
  • Die Fehleranalyse in text-to-SQL-Abfragen, eine zentrale Herausforderung für die Automatisierung von Datenbanken.

Einige repräsentative Artikel:

Link zu dieser Ausgabe →

Wöchentlich29. Juni 2026

Diese Woche bestätigen Spracherkennung und Sprachsynthese ihre Dynamik: 92 veröffentlichte Artikel in den letzten vier Wochen, gegenüber 58 in der vorherigen Periode. Die jüngsten Arbeiten untersuchen hybride Architekturen und Anwendungen in verrauschten oder mehrsprachigen Kontexten.

Drei Schwerpunkte heben sich in den Titeln hervor:

Die Verarbeitung von Musik und vokalen Emotionen folgt einer parallelen Entwicklung, allerdings mit halb so großen Volumina (44 bzw. 48 Artikel in 30 Tagen).

Link zu dieser Ausgabe →

Wöchentlich22. Juni 2026

Diese Woche dominieren die Verarbeitung von Ton und Sprache die Trends. Zwei Themen zeigen ein ähnliches Wachstum: 51 Artikel zum Music and Audio Processing (gegenüber 23 im Vormonat) und 97 zur Speech Recognition and Synthesis (gegenüber 44). Praktische Anwendungen häufen sich, insbesondere für die Musikanalyse und die Sprachsynthese.

Einige aktuelle Arbeiten:

Link zu dieser Ausgabe →

Wöchentlich15. Juni 2026

Diese Woche dominieren die Sprachsynthese und -erkennung klar die Trends. Das Thema Speech Recognition and Synthesis steigt von 36 auf 91 Artikel in vier Wochen, was das stärkste Wachstum im Moment darstellt.

Drei Schwerpunkte zeichnen sich in den jüngsten Veröffentlichungen ab:

  • Die feine Bewertung der Sprachqualität, mit Modellen, die auf Akzent- oder Prosodiefehler spezialisiert sind.
  • Die Anpassung der Modelle an atypische Stimmen, wie dysarthrische Sprache.
  • Die Umnutzung von Sprachklassifikatoren zur Erzeugung von Sprache durch geführte Diffusion.

Einige repräsentative Artikel: PASQA: Pitch-Accent-Focused Speech Quality Assessment Model Trained on Synthetic Speech with Accent Errors Repurposing a Speech Classifier for Guided Diffusion-Based Speech Generation Improving End-to-End Speech Recognition for Dysarthric Speech through In-Domain Data Augmentation

Link zu dieser Ausgabe →