Tested on multilabel text classification (German educational content, 44 labels):
1from model2vec import StaticModel
2
3model = StaticModel.from_pretrained("JanSchachtschabel/m2v-gte-multilingual-768")
4embeddings = model.encode(["Beispieltext auf Deutsch", "Example text in English"])
1from sentence_transformers import SentenceTransformer
2
3model = SentenceTransformer("JanSchachtschabel/m2v-gte-multilingual-768")
4embeddings = model.encode(["Beispieltext auf Deutsch"])
1pip install model2vec
2# or
3pip install sentence-transformers
1@article{zhang2024mgte,
2 title={mGTE: Generalized Long-Context Text Representation and Reranking Models for Multilingual Text Retrieval},
3 author={Zhang, Xin and Zhang, Yanzhao and Long, Dingkun and Xie, Pengjun and Zhang, Meishan and Min, Zhang},
4 journal={arXiv preprint arXiv:2407.19669},
5 year={2024}
6}
7
8@article{minishlab2024model2vec,
9 author = {Tulkens, Stephan and {van Dongen}, Thomas},
10 title = {Model2Vec: Fast State-of-the-Art Static Embeddings},
11 year = {2024},
12 url = {https://github.com/MinishLab/model2vec}
13}