Projections 2D des embeddings
La carte sémantique des papiers arXiv en IA
Chaque point est un papier. Deux papiers proches sur la carte ont un contenu proche. Survolez pour voir le titre, cliquez pour l'ouvrir sur arXiv, et changez de projection pour voir ce que la méthode de réduction change au dessin.
Comment elle est construite
Un échantillon d'environ 2 000 papiers est tiré proportionnellement aux volumes par sujet, en surpondérant les douze derniers mois. Chaque papier est transformé en un vecteur de 1 024 nombres par un modèle d'embedding, qui rapproche les textes proches par le sens.
Ces vecteurs vivent dans un espace à 1 024 dimensions, impossible à regarder. Une projection UMAP les ramène à deux dimensions en essayant de préserver le voisinage. Les quatre autres onglets sont d'autres méthodes appliquées au même échantillon : elles ne montrent pas d'autres données, elles montrent d'autres compromis.
Les distances sont indicatives. Deux points proches traitent de sujets proches, mais l'échelle n'a pas d'unité et la position absolue ne veut rien dire.
