A Tamil-specialized sentence embedding model fine-tuned from multilingual-e5-base (278M parameters) using Matryoshka representation learning.
1from sentence_transformers import SentenceTransformer
2
3model = SentenceTransformer("Tamil-ai/tamil-embed-base")
4
5sentences = [
6 "query: தமிழ் மொழியின் வரலாறு என்ன?",
7 "passage: தமிழ் மொழி 2000 ஆண்டுகளுக்கும் மேலான வரலாற்றைக் கொண்ட செம்மொழியாகும்.",
8 "passage: Python is a popular programming language.",
9]
10
11embeddings = model.encode(sentences)
12print(embeddings.shape) # (3, 768)
13
14# Compute similarity
15from sentence_transformers.util import cos_sim
16similarities = cos_sim(embeddings[0], embeddings[1:])
17print(similarities) # Tamil passage should score higher
1# Use smaller dimensions for faster search with minimal quality loss
2embeddings_256 = model.encode(sentences, output_value="sentence_embedding")[:, :256]
3embeddings_128 = model.encode(sentences, output_value="sentence_embedding")[:, :128]
1@misc{tamilai2026embed,
2 title={A Thousand Language Problem: Morphological Understanding in Linguistic AI},
3 author={Tamil-AI},
4 year={2026},
5 publisher={HuggingFace},
6 url={https://huggingface.co/Tamil-ai/tamil-embed-base}
7}