Investigadores de la Benemérita Universidad Autónoma de Puebla (BUAP) desarrollaron un repositorio de datos de voz que busca impulsar la investigación en tecnologías del lenguaje y contribuir a la preservación de las lenguas indígenas de México. El proyecto, denominado ZETZOHO-YUHMU. Speech Dataset, está enfocado en el estudio de la lengua Yuhmu, una variante del otomí considerada de escasos recursos lingüísticos y en riesgo de desaparición.
La iniciativa es encabezada por los académicos Arturo Olvera López e Iván Olmos Pineda, profesores e investigadores de la Facultad de Ciencias de la Computación, quienes diseñaron un conjunto de datos especializado para apoyar investigaciones en reconocimiento automático del habla (ASR, por sus siglas en inglés) y en el análisis de la pronunciación en contextos donde la información lingüística disponible es limitada.
El repositorio ofrece una herramienta de libre acceso para investigadores, desarrolladores y especialistas en procesamiento del lenguaje natural, al proporcionar información que facilita el diseño de sistemas de retroalimentación para el aprendizaje de idiomas y fortalece las estrategias de documentación, conservación y revitalización de las lenguas originarias.
Además de su aplicación tecnológica, el proyecto representa una contribución al rescate del patrimonio lingüístico de México, al generar recursos que permitan desarrollar soluciones basadas en inteligencia artificial para comunidades cuyas lenguas cuentan con poca representación en plataformas digitales.
En esta investigación también participan Eric Ramos-Aguilar, Ricardo Ramos-Aguilar y Daniel Sánchez-Ruiz, de la Unidad Profesional Interdisciplinaria de Ingeniería del Instituto Politécnico Nacional, campus Tlaxcala (UPIIT-IPN), en un esfuerzo de colaboración interinstitucional para fortalecer el desarrollo científico en materia de tecnologías del habla.
Los responsables del proyecto destacaron que el repositorio es de acceso libre y puede convertirse en una herramienta de gran utilidad para la comunidad científica dedicada al procesamiento del lenguaje natural, particularmente en el estudio de las lenguas indígenas mexicanas que aún cuentan con escasos recursos tecnológicos y de investigación.

