Views
No views yet
| Metric | Original | Trimmed | Reduction |
|---|---|---|---|
| Vocabulary size | 250,037 tokens | 16,384 tokens | 93.44% |
| Model size | 559,890,432 params | 320,665,600 params | 42.73% |

1from sentence_transformers import SentenceTransformer
2# Download from the 🤗 Hub
3model = SentenceTransformer("alphaedge-ai/multilingual-e5-large-aze-16384")
4# Run inference with queries and documents
5query = "My query in Azerbaijani"
6documents = [
7 "Chunk in Azerbaijani",
8 "Chunk in Azerbaijani",
9 "Chunk in Azerbaijani",
10]
11query_embeddings = model.encode_query(query)
12document_embeddings = model.encode_document(documents)
13print(query_embeddings.shape, document_embeddings.shape)
14# Compute similarities to determine a ranking
15similarities = model.similarity(query_embeddings, document_embeddings)
16print(similarities)@article{wang2024multilingual,
title={Multilingual E5 Text Embeddings: A Technical Report},
author={Wang, Liang and Yang, Nan and Huang, Xiaolong and Yang, Linjun and Majumder, Rangan and Wei, Furu},
journal={arXiv preprint arXiv:2402.05672},
year={2024}
}@misc{hf_blogpost_trimming,
title={Introduction to Trimming},
author={Loïck BOURDOIS and Tom AARSEN and Bram VANROY and Christopher AKIKI and Woojun JUNG and Manuel ROMERO and Prithiv SAKTHI},
year={2026},
url={https://huggingface.co/blog/lbourdois/introduction-to-trimming},
}