This model is a 39.7% smaller version of
intfloat/multilingual-e5-large
optimized for 32768 language via vocabulary pruning.
Total vocabulary size: 32768 tokens (reduced from 250002)
Tokenizer type: Unigram
Training samples per language: 200000 texts
Dataset:
Lumberjackk/fineweb-2-trimming
This pruned model should perform similarly to the original model for 32768 with a much smaller
memory footprint. However, it may not perform well for other languages as tokens not commonly used in the selected
languages were removed from the vocabulary.
1from transformers import AutoModel, AutoTokenizer
2
3model_name = "Lumberjackk/multilingual-e5-large-pms-32768"
4model = AutoModel.from_pretrained(model_name)
5tokenizer = AutoTokenizer.from_pretrained(model_name)