This model is a 42.7% smaller version of
intfloat/multilingual-e5-large
optimized for 16384 language via vocabulary pruning.
Total vocabulary size: 16384 tokens (reduced from 250002)
Tokenizer type: Unigram
Training samples per language: 200000 texts
Dataset:
Lumberjackk/fineweb-2-trimming
This pruned model should perform similarly to the original model for 16384 with a much smaller
memory footprint. However, it may not perform well for other languages as tokens not commonly used in the selected
languages were removed from the vocabulary.
1from transformers import AutoModel, AutoTokenizer
2
3model_name = "Lumberjackk/multilingual-e5-large-pms-16384"
4model = AutoModel.from_pretrained(model_name)
5tokenizer = AutoTokenizer.from_pretrained(model_name)