El reconocimiento de voz y la síntesis de voz (Speech Recognition and Synthesis) se convierten en un área prioritaria para la IA.
En tres meses, se han publicado 232 artículos sobre el tema, frente a 83 en el trimestre anterior, lo que supone una multiplicación por casi tres. Los trabajos ya no se limitan a los idiomas dominantes: varios equipos amplían los modelos a lenguas con pocos datos (low-resource), como el nepalí, o adaptan los sistemas a las limitaciones del streaming en directo y a las variaciones de estilo vocal.
Las investigaciones en recuperación de información (Information Retrieval and Search Behavior) siguen la misma trayectoria, con 139 publicaciones frente a 50 anteriormente. Ambos temas comparten una misma preocupación: hacer que los modelos sean más precisos en contextos reales, donde los datos están ruidosos, incompletos o sesgados.
Algunos ejemplos recientes:
- PHONOS: PHOnetic Neutralization for Online Streaming Applications
- Nw=ach=a Mun=a: A Devanagari Speech Corpus and Proximal Transfer Benchmark for Nepal Bhasha ASR
- ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining
- Bridge-RAG: An Abstract Bridge Tree Based Retrieval Augmented Generation Algorithm With Cuckoo Filter
- GraphER: An Efficient Graph-Based Enrichment and Reranking Method for Retrieval-Augmented Generation
Este impulso refleja un cambio de enfoque: tras años perfeccionando los grandes modelos de lenguaje, los investigadores centran ahora su atención en las interfaces que los conectan con el mundo: la voz, las consultas, las interacciones. Las aplicaciones objetivo ya no son demostraciones técnicas, sino herramientas concretas, como los sistemas de tutoría adaptativa (165 artículos, +170 %) o los asistentes de voz multilingües.
