La semana del 3 de agosto suma 2 008 artículos ingeridos, frente a 1 385 la semana anterior. Tres asuntos vecinos suben a la vez: la recuperación de información y el comportamiento de los usuarios (73 artículos en cuatro semanas frente a 26 en las cuatro anteriores), los sistemas de recomendación (59 frente a 27) y la gestión de la información personal (42 frente a 26).
Detrás de esas tres etiquetas hay un mismo movimiento: los sistemas de búsqueda y de recomendación se reescriben en torno a agentes basados en modelos de lenguaje. Los títulos de la semana tratan menos de lo que esos agentes prometen que de cómo se evalúan. Cuánto valen sus representaciones, qué ocurre cuando su propio historial los induce a error, cómo rastrear una respuesta hasta su fuente.
Para leer: PoolBench: A Benchmark for Pooling Strategies in Concept Representation Evaluation for Decoder-Only LLMs When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories Universal Pathologies, Conditional Consequences: A Triple-Robustness Analysis of RAG for Multi-Hop Traceability A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing
