Método
Cómo se calculan estas cifras
Todo lo que se muestra en este sitio procede de un cálculo, y todo cálculo se basa en decisiones. Aquí están, en el orden en que intervienen.
Los artículos
El corpus procede de arXiv, limitado a cuatro categorías: cs.AI (inteligencia artificial), cs.LG (aprendizaje automático), cs.CL (procesamiento del lenguaje) y cs.CV (visión por computador). Cada día se recuperan los nuevos anuncios y se guardan tal cual: título, autores, resumen en inglés, enlace. Nada se reescribe.
arXiv publica preprints. Un artículo presente aquí no ha sido necesariamente revisado por pares, y su resumen anuncia una contribución sin demostrarla. Razón de más para abrir el artículo antes de concluir.
Los temas y los asuntos
Ni los temas ni los asuntos se inventan aquí. Cada artículo se asocia a la clasificación de OpenAlex, el catálogo abierto de la investigación científica mundial, que organiza las publicaciones en cuatro niveles: dominio, campo, tema, asunto. La asociación se hace mediante el DOI del artículo.
Cuando OpenAlex aún no conoce un artículo, algo frecuente en las primeras semanas, se clasifica por similitud: su representación vectorial se compara con el centro de gravedad de cada asunto y se retiene el más cercano siempre que la similitud supere 0,30. Por debajo, el artículo se queda sin asunto en lugar de archivarse al azar.
Los volúmenes
Los recuentos se calculan una vez al día, por semana y por asunto. Las vistas mensuales y trimestrales son sumas de esas semanas: las tres escalas no pueden contradecirse.
El río de temas pasa automáticamente de la semana al mes más allá de seis meses de histórico. En un periodo largo, la granularidad semanal muestra sobre todo ruido.
Las señales emergentes
Las expresiones son grupos de dos o tres palabras consecutivas, extraídas del título y del resumen en inglés, en minúsculas y sin acentos. Para cada expresión se cuenta el número de artículos distintos que la emplean, no el número de veces que aparece: de lo contrario, un solo artículo repetitivo bastaría para crear una señal.
La ventana actual cubre los últimos 30 días y la referencia los seis meses anteriores, reducidos a la misma duración. El crecimiento mostrado es la diferencia entre ambos, con un suavizado que impide que una expresión ausente de la referencia ocupe mecánicamente el primer puesto.
Tres filtros descartan el relleno. Una expresión debe aparecer en al menos 16 artículos de la ventana. Las que contienen una palabra vacía, un verbo modal o un auxiliar se rechazan: «cannot express» es una estructura de frase, no un tema de investigación. Por último, una lista negra mantenida a mano retira las fórmulas de protocolo que se cuelan igualmente. Las expresiones anidadas se deduplican, y singular y plural cuentan como una.
El mapa semántico
Cada artículo se transforma en un vector de 1 024 números mediante un modelo de embedding, que sitúa cerca los textos próximos por su sentido. Esos vectores viven en un espacio de 1 024 dimensiones, imposible de mirar; una proyección UMAP los reduce a dos dimensiones intentando conservar la vecindad.
El mapa muestra una muestra de unos 2 000 artículos, extraída proporcionalmente a los volúmenes por asunto y sesgada hacia los últimos doce meses. Las distancias son indicativas: dos puntos cercanos tratan asuntos próximos, pero la escala no tiene unidad.
El resumen
El resumen lo escribe un modelo de lenguaje a partir de las cifras del periodo y de una selección de artículos, nunca a partir del corpus entero. Tres reglas rigen la redacción: un solo ángulo por número, ningún porcentaje sin el volumen absoluto correspondiente y de tres a cinco artículos citados con su enlace.
Un asunto solo entra en el resumen si supera un umbral de volumen absoluto en la ventana. Sin ese umbral, un asunto que pasa de tres a veintiún artículos mostraría +600 % y ocuparía el primer puesto sin que hubiera ocurrido nada.
Las versiones inglesa, española y alemana son traducciones del número francés, hechas después. Mientras una traducción no está escrita, el sitio muestra el francés y lo indica.
Lo que estas cifras no dicen
arXiv no es toda la investigación en IA: los trabajos industriales no publicados, los congresos sin preprint y la investigación no anglófona no figuran.
Un volumen de publicaciones mide la actividad, no la importancia. Un asunto que se duplica puede ser una moda tanto como un avance.
Las expresiones emergentes se extraen de textos en inglés. Una idea que circula con varios nombres se dispersa entre varias expresiones y puede quedar invisible.
