Views
No views yet
jinaai/jina-embeddings-v5-text-nano-retrieval on Arabic retrieval data with English NLI mixing to prevent catastrophic forgetting.| Hyperparameter | Value |
|---|---|
| Base model | jinaai/jina-embeddings-v5-text-nano-retrieval |
| Arabic data | Waqf-AI/ArabicText-Large-triplets (9,299 pairs) |
| English data | sentence-transformers/all-nli (4,649 triplet anchors → queries) |
| Mix ratio | ~2:1 Arabic:English |
| Max seq length | 8192 |
| Batch | 2 per GPU × 2 GPUs, grad accum 4 |
| LR | 2e-5 |
| Warmup | 0.03 |
| Epochs | 1 |
| Loss | MultipleNegativesRankingLoss (bidirectional) |
| AMP | fp16 |
1from sentence_transformers import SentenceTransformer
2
3model = SentenceTransformer("Abdelkareem/abjd-dense-jina-v5-nano")
4queries = ["ما هي عاصمة الإمارات؟"]
5documents = ["أبو ظبي هي عاصمة الإمارات العربية المتحدة."]
6
7q_emb = model.encode(queries, prompt_name="query", normalize_embeddings=True)
8d_emb = model.encode(documents, prompt_name="document", normalize_embeddings=True)
9similarity = q_emb @ d_emb.T