Esta semana, la síntesis y el reconocimiento de voz dominan claramente las tendencias. El tema Speech Recognition and Synthesis pasa de 36 a 91 artículos en cuatro semanas, lo que representa el mayor crecimiento del momento.
Tres ejes se destacan en las publicaciones recientes:
- La evaluación fina de la calidad vocal, con modelos especializados en errores de acento o prosodia.
- La adaptación de los modelos a voces atípicas, como el habla disártrica.
- El desvío de clasificadores vocales para generar habla mediante difusión guiada.
Algunos artículos representativos: PASQA: Pitch-Accent-Focused Speech Quality Assessment Model Trained on Synthetic Speech with Accent Errors Repurposing a Speech Classifier for Guided Diffusion-Based Speech Generation Improving End-to-End Speech Recognition for Dysarthric Speech through In-Domain Data Augmentation
