Views
No views yet
| Metric | Original | Trimmed | Reduction |
|---|---|---|---|
| Vocabulary size | 250,002 tokens | 32,768 tokens | 86.89% |
| Model size | 559,890,432 params | 337,442,816 params | 39.73% |

1from sentence_transformers import SentenceTransformer
2# Download from the 🤗 Hub
3model = SentenceTransformer("Lumberjackk/multilingual-e5-large-instruct-pms-32768")
4# Run inference with queries and documents
5query = "My query"
6documents = [
7 "Chunk 1",
8 "Chunk 2",
9 "Chunk 3",
10]
11query_embeddings = model.encode_query(query)
12document_embeddings = model.encode_document(documents)
13print(query_embeddings.shape, document_embeddings.shape)
14# Compute similarities to determine a ranking
15similarities = model.similarity(query_embeddings, document_embeddings)
16print(similarities)@article{wang2024multilingual,
title={Multilingual E5 Text Embeddings: A Technical Report},
author={Wang, Liang and Yang, Nan and Huang, Xiaolong and Yang, Linjun and Majumder, Rangan and Wei, Furu},
journal={arXiv preprint arXiv:2402.05672},
year={2024}
}