Méthode
Comment ces chiffres sont calculés
Tout ce qui est affiché sur ce site vient d'un calcul, et tout calcul repose sur des choix. Voici lesquels, dans l'ordre où ils interviennent.
Les articles
Le corpus vient d'arXiv, limité à quatre catégories : cs.AI (intelligence artificielle), cs.LG (apprentissage automatique), cs.CL (traitement du langage) et cs.CV (vision par ordinateur). Chaque jour, les nouvelles annonces sont récupérées et enregistrées telles quelles : titre, auteurs, résumé en anglais, lien. Rien n'est réécrit.
arXiv publie des préprints. Un article présent ici n'a pas nécessairement été relu par des pairs, et son résumé annonce une contribution sans la démontrer. Raison de plus pour ouvrir l'article avant de conclure.
Les thèmes et les sujets
Ni les thèmes ni les sujets ne sont inventés ici. Chaque article est rapproché de la classification OpenAlex, le catalogue ouvert de la recherche scientifique mondiale, qui organise les publications en quatre niveaux : domaine, champ, thème, sujet. Le rapprochement se fait par le DOI de l'article.
Quand OpenAlex ne connaît pas encore un article, ce qui est fréquent les premières semaines, il est classé par similarité : sa représentation vectorielle est comparée au centre de gravité de chaque sujet, et le plus proche est retenu à condition que la similarité dépasse 0,30. En dessous, l'article reste sans sujet plutôt que d'être rangé au hasard.
Les volumes
Les comptages sont précalculés une fois par jour, par semaine et par sujet. Les vues mensuelles et trimestrielles sont des sommes de ces semaines : les trois échelles ne peuvent pas se contredire.
La rivière de thèmes passe automatiquement de la semaine au mois au-delà de six mois d'historique. Sur une longue période, la granularité hebdomadaire montre surtout du bruit.
Les signaux émergents
Les expressions sont des groupes de deux ou trois mots consécutifs, extraits du titre et du résumé en anglais, en minuscules et sans accent. Pour chaque expression, on compte le nombre d'articles distincts qui l'emploient, et non le nombre de fois où elle apparaît : sans cela, un seul article bavard suffirait à créer un signal.
La fenêtre courante couvre les 30 derniers jours, la référence les six mois précédents ramenés à la même durée. La croissance affichée est l'écart entre les deux, avec un lissage qui empêche une expression absente de la référence de prendre mécaniquement la première place.
Trois filtres écartent le remplissage. Une expression doit apparaître dans au moins 16 articles sur la fenêtre. Celles qui contiennent un mot vide, un verbe modal ou un auxiliaire sont rejetées : « cannot express » est une structure de phrase, pas un sujet de recherche. Enfin une liste noire, tenue à la main, retire les tournures de protocole qui passent quand même. Les expressions imbriquées sont dédupliquées, et singulier et pluriel comptent pour une.
La carte sémantique
Chaque article est transformé en un vecteur de 1 024 nombres par un modèle d'embedding, qui place les textes proches par le sens à proximité les uns des autres. Ces vecteurs vivent dans un espace à 1 024 dimensions, impossible à regarder ; une projection UMAP les ramène à deux dimensions en essayant de conserver le voisinage.
La carte montre un échantillon d'environ 2 000 articles, tiré proportionnellement aux volumes par sujet et biaisé vers les douze derniers mois. Les distances y sont indicatives : deux points proches traitent de sujets proches, mais l'échelle n'a pas d'unité.
Le digest
Le digest est écrit par un modèle de langue, à partir des chiffres de la période et d'une sélection d'articles, jamais à partir du corpus entier. Trois règles encadrent la rédaction : un seul angle par numéro, aucun pourcentage sans le volume absolu correspondant, et trois à cinq articles nommés avec leur lien.
Un sujet n'entre dans le digest que s'il dépasse un plancher de volume absolu sur la fenêtre. Sans ce plancher, un sujet passé de trois à vingt-et-un articles afficherait +600 % et prendrait la première place sans qu'il se soit rien passé.
Les versions anglaise, espagnole et allemande sont des traductions du numéro français, faites après coup. Tant qu'une traduction n'est pas écrite, le site affiche le français en le signalant.
Ce que ces chiffres ne disent pas
arXiv n'est pas toute la recherche en IA : les travaux industriels non publiés, les conférences sans préprint et la recherche non anglophone n'y figurent pas.
Un volume de publications mesure l'activité, pas l'importance. Un sujet qui double peut être une mode autant qu'une percée.
Les expressions émergentes sont extraites de textes anglais. Une idée qui circule sous plusieurs noms se disperse entre plusieurs expressions et peut rester invisible.
