Die Woche vom 3. August umfasst 2 008 aufgenommene Artikel, gegenüber 1 385 in der Vorwoche. Drei benachbarte Unterthemen steigen gemeinsam: Information Retrieval und Suchverhalten (73 Artikel über vier Wochen gegenüber 26 in den vier Wochen davor), Empfehlungssysteme (59 gegenüber 27) und persönliches Informationsmanagement (42 gegenüber 26).
Hinter diesen drei Bezeichnungen steht eine einzige Bewegung: Such- und Empfehlungssysteme werden rund um Agenten auf Basis von Sprachmodellen neu geschrieben. Die Titel der Woche handeln weniger davon, was diese Agenten versprechen, als davon, wie sie geprüft werden. Was ihre Repräsentationen taugen, was geschieht, wenn ihr eigener Verlauf sie in die Irre führt, wie sich eine Antwort bis zu ihrer Quelle zurückverfolgen lässt.
Zum Lesen: PoolBench: A Benchmark for Pooling Strategies in Concept Representation Evaluation for Decoder-Only LLMs When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories Universal Pathologies, Conditional Consequences: A Triple-Robustness Analysis of RAG for Multi-Hop Traceability A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing
