Diese Woche dominieren die Sprachsynthese und -erkennung klar die Trends. Das Thema Speech Recognition and Synthesis steigt von 36 auf 91 Artikel in vier Wochen, was das stärkste Wachstum im Moment darstellt.
Drei Schwerpunkte zeichnen sich in den jüngsten Veröffentlichungen ab:
- Die feine Bewertung der Sprachqualität, mit Modellen, die auf Akzent- oder Prosodiefehler spezialisiert sind.
- Die Anpassung der Modelle an atypische Stimmen, wie dysarthrische Sprache.
- Die Umnutzung von Sprachklassifikatoren zur Erzeugung von Sprache durch geführte Diffusion.
Einige repräsentative Artikel: PASQA: Pitch-Accent-Focused Speech Quality Assessment Model Trained on Synthetic Speech with Accent Errors Repurposing a Speech Classifier for Guided Diffusion-Based Speech Generation Improving End-to-End Speech Recognition for Dysarthric Speech through In-Domain Data Augmentation
