This model has been fine-tuned on a comprehensive dataset of Persian and Arabic religious texts, including:
1from sentence_transformers import SentenceTransformer
2
3# Load the model
4model = SentenceTransformer('hamtaai/e5-large-instruct-hadith')
5
6# For instruct models, use proper prefixes
7query = "query: سوال شما اینجا"
8passage = "passage: متن پاسخ اینجا"
9
10# Encode texts
11query_embedding = model.encode(query)
12passage_embedding = model.encode(passage)
13
14# Calculate similarity
15from sentence_transformers.util import cos_sim
16similarity = cos_sim(query_embedding, passage_embedding)
1from transformers import AutoTokenizer, AutoModel
2import torch
3
4tokenizer = AutoTokenizer.from_pretrained('hamtaai/e5-large-instruct-hadith')
5model = AutoModel.from_pretrained('hamtaai/e5-large-instruct-hadith')
6
7# Tokenize and encode
8inputs = tokenizer("متن شما", return_tensors="pt")
9with torch.no_grad():
10 outputs = model(**inputs)
11 embeddings = outputs.last_hidden_state.mean(dim=1)
This model has been optimized for Persian and Arabic text processing and shows improved performance on:
The model was trained on a curated dataset of Persian and Arabic religious texts, including:
If you use this model, please cite the original base model and mention this fine-tuned version:
1@misc{hamtaai/e5_large_instruct_hadith,
2 title={hamtaai/e5-large-instruct-hadith: Fine-tuned Multilingual E5 Model for Persian and Arabic Text Processing},
3 author={Your Name},
4 year={2025},
5 publisher={Hugging Face},
6 howpublished={\url{https://huggingface.co/hamtaai/e5-large-instruct-hadith}}
7}
This model is released under the Apache 2.0 License.