Esta semana, el reconocimiento y la síntesis de voz confirman su dinámica: 92 artículos publicados en las últimas cuatro semanas, frente a 58 en el período anterior. Los trabajos recientes exploran arquitecturas híbridas y aplicaciones en contextos ruidosos o multilingües.
Tres líneas se destacan en los títulos:
- La integración de razonamientos explícitos para mejorar el reconocimiento de hablantes en contenidos largos (Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas).
- Pipelines unificados para la comprensión y generación de audio, optimizados para infraestructuras como vLLM (An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation).
- Representaciones alineadas por contraste para distinguir voces en entornos complejos (SPARCLE: SPeaker-aware Aligned Representations via Contrastive Language Embeddings).
El procesamiento de la música y las emociones vocales sigue una trayectoria paralela, pero con volúmenes dos veces menores (44 y 48 artículos en 30 días).
