Views
No views yet
| Metric | Original | Trimmed | Reduction |
|---|---|---|---|
| Vocabulary size | 256,000 tokens | 32,768 tokens | 87.20% |
| Model size | 306,939,648 params | 135,497,472 params | 55.86% |

1from transformers import AutoModel, AutoTokenizer
2
3model_name = "Lumberjackk/mmBERT-base-uzs-32768"
4model = AutoModel.from_pretrained(model_name)
5tokenizer = AutoTokenizer.from_pretrained(model_name)@misc{marone2025mmbertmodernmultilingualencoder,
title={mmBERT: A Modern Multilingual Encoder with Annealed Language Learning},
author={Marc Marone and Orion Weller and William Fleshman and Eugene Yang and Dawn Lawrie and Benjamin Van Durme},
year={2025},
eprint={2509.06888},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2509.06888},
}