Los modelos de IA que comprenden y generan el habla humana ganan en precisión, pero también en métodos para evaluar dicha precisión. Esta semana, el reconocimiento y la síntesis de voz (Speech Recognition and Synthesis) dominan con 112 artículos publicados en cuatro semanas, frente a 63 cuatro semanas antes.
La aparición de la expresión operating characteristic curve (curva característica de funcionamiento, una herramienta que mide la capacidad de un modelo para distinguir las respuestas correctas de las incorrectas) en 18 artículos muestra que los investigadores ya no se limitan a contar los errores. También analizan cómo estos errores se distribuyen según los contextos - por ejemplo, un modelo que reconoce mejor las voces masculinas que las femeninas, o que tropieza con los acentos regionales - .
Tres artículos recientes ilustran esta tendencia:
- Partial AUC Maximization from Positive-unlabeled Data propone un método para optimizar estas curvas cuando no se dispone de datos etiquetados como incorrectos.
- Storage Is Not Strategy: State-Conditioned Support Control for LLM Unlearning utiliza estas curvas para evaluar la supresión selectiva de conocimientos en un modelo, sin alterar sus otras prestaciones.
- RGDT-Bench: Benchmarking LLM Reasoning for Rule-Governed Decisions and Their Justifications extiende la herramienta a sistemas que deben explicar sus elecciones, como un chatbot médico que justifica un diagnóstico.
En el mismo ámbito, otros dos artículos recientes se interesan por la robustez de los modelos frente a lenguas o situaciones poco representadas en los datos de entrenamiento:
- How Robust Are Neural Audio Codecs for African Speech? A Multi-Task Benchmark and the Limits of Perceptual Quality prueba codificadores de audio en dialectos africanos, donde los modelos pierden hasta un 30 % de su precisión en comparación con el inglés.
- Code-Switching Spoken Language Identification as Multi-Label Set Prediction aborda la mezcla de lenguas en una misma frase, como el español y el inglés en una conversación.
