Ajuste fino de
facebook/mms-1b-all para reconocimiento automático del habla en Maya Yucateco (Maayat'aan), desarrollado por Enrique Mauricio Carrillo Romero.
1from transformers import pipeline
2
3asr = pipeline("automatic-speech-recognition", model="mau-cr/mms-maya-yucateco")
4result = asr("audio_maya.wav")
5print(result["text"])
Se recomienda audio segmentado a nivel de enunciado (2–15 segundos). Para el mejor desempeño, combínalo con el modelo de lenguaje de 3-gramas incluido en el repositorio.
El corpus
mau-cr/mayan-voice reúne ~ 4 horas de audio en dos subcorpus: grabaciones propias y videos de YouTube (1 hora, mayor diversidad de hablantes) y Narraciones Mayas de Campeche del INALI (3 horas, material narrativo continuo). En total contiene 34,154 palabras, 5,802 únicas, con segmentos de 2 a 15 segundos.
El entrenamiento se hizo de forma incremental, de 20 a 222 minutos en pasos de 20, sobre Google Colab con una A100 SXM4 (80 GB) o RTX PRO 6000 Blackwell.
El corpus tiene un desbalance de género (66.9% voces masculinas, 33.1% femeninas) y el material narrativo está concentrado en pocos hablantes, lo que puede afectar el desempeño en voces femeninas y registros conversacionales.
1@misc{carrillo2026maya,
2 author = {Carrillo Romero, Enrique Mauricio},
3 title = {Desarrollo de un corpus de audio en lengua Maya (Maayat'aan) para la implementación de modelos de Inteligencia Artificial orientados a la preservación lingüística},
4 year = {2026},
5 institution = {Facultad de Ingeniería, Universidad Autónoma de Yucatán}
6}