Este modelo foi inspirado pela abordagem proposta em Gaillat et al. (2021):
Gaillat, T., Simpkin, A., Ballier, N., Alexopoulou, T., Bodain, Y., & Thouesny, S. (2021)."Predicting CEFR levels in learners of English: The use of microsystem criterial features in a machine learning approach."
ReCALL, 33(2), 161-180. Cambridge University Press.
DOI: 10.1017/S0958344021000021
O paper demonstrou a eficacia de classificadores supervisionados para predicao de niveis CEFR em textos de aprendizes de linguas, alcancando 82% de accuracy em dados internos.
Nossa contribuicao:
Adaptacao para portugues brasileiro (lingua de baixo recurso para CEFR)
Combinacao de multiplos datasets com mapeamentos para CEFR (incluindo ENEM)
Uso do mDeBERTa-v3, que oferece melhor representacao multilingual
96.43% de accuracy - superando significativamente o baseline do paper original
Referencias
Modelo Base
He et al. (2021) - "DeBERTa: Decoding-enhanced BERT with Disentangled Attention"
He et al. (2023) - "DeBERTaV3: Improving DeBERTa using ELECTRA-Style Pre-Training"