Emergence-LogoEmergence

Methode

Wie diese Zahlen berechnet werden

Alles auf dieser Website stammt aus einer Berechnung, und jede Berechnung beruht auf Entscheidungen. Hier sind sie, in der Reihenfolge ihres Auftretens.

Die Artikel

Das Korpus stammt aus arXiv, beschränkt auf vier Kategorien: cs.AI (künstliche Intelligenz), cs.LG (maschinelles Lernen), cs.CL (Sprachverarbeitung) und cs.CV (Computer Vision). Täglich werden die neuen Ankündigungen abgerufen und unverändert gespeichert: Titel, Autoren, englisches Abstract, Link. Nichts wird umgeschrieben.

arXiv veröffentlicht Preprints. Ein hier aufgeführter Artikel ist nicht zwangsläufig begutachtet, und sein Abstract kündigt einen Beitrag an, ohne ihn zu belegen. Ein Grund mehr, den Artikel zu öffnen, bevor man schließt.

Themen und Unterthemen

Weder die Themen noch die Unterthemen werden hier erfunden. Jeder Artikel wird der OpenAlex-Klassifikation zugeordnet, dem offenen Katalog der weltweiten Forschung, der Publikationen in vier Ebenen gliedert: Domäne, Feld, Thema, Unterthema. Die Zuordnung erfolgt über den DOI des Artikels.

Kennt OpenAlex einen Artikel noch nicht, was in den ersten Wochen häufig vorkommt, wird er über Ähnlichkeit zugeordnet: seine Vektordarstellung wird mit dem Schwerpunkt jedes Unterthemas verglichen, und das nächstgelegene wird übernommen, sofern die Ähnlichkeit 0,30 übersteigt. Darunter bleibt der Artikel ohne Unterthema, statt zufällig einsortiert zu werden.

Die Volumen

Die Zählungen werden einmal täglich vorberechnet, pro Woche und pro Unterthema. Monats- und Quartalsansichten sind Summen dieser Wochen: Die drei Ebenen können sich nicht widersprechen.

Der Themenfluss wechselt jenseits von sechs Monaten Historie automatisch von der Woche auf den Monat. Über einen langen Zeitraum zeigt die wöchentliche Granularität vor allem Rauschen.

Die aufkommenden Signale

Ausdrücke sind Gruppen von zwei oder drei aufeinanderfolgenden Wörtern aus dem englischen Titel und Abstract, kleingeschrieben und ohne Akzente. Für jeden Ausdruck wird die Zahl der verschiedenen Artikel gezählt, die ihn verwenden, nicht die Zahl seiner Vorkommen: Sonst würde ein einziger wortreicher Artikel genügen, um ein Signal zu erzeugen.

Das aktuelle Fenster umfasst die letzten 30 Tage, die Referenz die sechs Monate davor, auf dieselbe Dauer umgerechnet. Das angezeigte Wachstum ist der Abstand zwischen beiden, mit einer Glättung, die verhindert, dass ein in der Referenz fehlender Ausdruck mechanisch den ersten Platz belegt.

Drei Filter entfernen Füllmaterial. Ein Ausdruck muss in mindestens 16 Artikeln des Fensters vorkommen. Ausdrücke mit einem Stoppwort, einem Modalverb oder einem Hilfsverb werden verworfen: „cannot express“ ist eine Satzstruktur, kein Forschungsthema. Schließlich entfernt eine von Hand gepflegte Sperrliste die Protokollformeln, die dennoch durchrutschen. Verschachtelte Ausdrücke werden entdoppelt, Singular und Plural zählen als einer.

Die semantische Karte

Jeder Artikel wird durch ein Embedding-Modell in einen Vektor aus 1 024 Zahlen überführt, das inhaltlich nahe Texte nebeneinander legt. Diese Vektoren leben in einem Raum mit 1 024 Dimensionen, den man nicht ansehen kann; eine UMAP-Projektion bringt sie auf zwei Dimensionen und versucht dabei, die Nachbarschaft zu erhalten.

Die Karte zeigt eine Stichprobe von rund 2 000 Artikeln, gezogen proportional zu den Volumen je Unterthema und gewichtet auf die letzten zwölf Monate. Die Abstände sind Hinweise: Zwei nahe Punkte behandeln verwandte Themen, aber die Skala hat keine Einheit.

Der Digest

Der Digest wird von einem Sprachmodell geschrieben, aus den Zahlen des Zeitraums und einer Auswahl von Artikeln, nie aus dem gesamten Korpus. Drei Regeln bestimmen das Schreiben: ein einziger Blickwinkel je Ausgabe, kein Prozentwert ohne das zugehörige absolute Volumen, und drei bis fünf namentlich genannte Artikel mit Link.

Ein Unterthema kommt nur in den Digest, wenn es im Fenster eine absolute Volumenschwelle überschreitet. Ohne diese Schwelle würde ein Unterthema, das von drei auf einundzwanzig Artikel steigt, +600 % anzeigen und den ersten Platz belegen, obwohl nichts geschehen ist.

Die englische, spanische und deutsche Fassung sind nachträgliche Übersetzungen der französischen Ausgabe. Solange eine Übersetzung fehlt, zeigt die Website den französischen Text und weist darauf hin.

Was diese Zahlen nicht sagen

arXiv ist nicht die gesamte KI-Forschung: unveröffentlichte Industriearbeiten, Konferenzen ohne Preprint und nicht englischsprachige Forschung fehlen.

Ein Publikationsvolumen misst Aktivität, nicht Bedeutung. Ein Unterthema, das sich verdoppelt, kann ebenso eine Mode wie ein Durchbruch sein.

Aufkommende Ausdrücke stammen aus englischen Texten. Eine Idee, die unter mehreren Namen zirkuliert, verteilt sich auf mehrere Ausdrücke und kann unsichtbar bleiben.