dataset_size: 77
loss: CosineSimilarityLoss
base_model: sentence-transformers/all-MiniLM-L6-v2
pipeline_tag: sentence-similarity
library_name: sentence-transformers
🇵🇰 Bilingual Roman Urdu + English Sentence Embedder
A lightweight Sentence Transformer model designed for Roman Urdu + English semantic understanding, optimized for:
🔍 Semantic Search
💬 Chatbots / FAQ Retrieval
🏠 Real Estate Query Matching
🌐 Cross-lingual Similarity (Roman Urdu ↔ English)
This model maps sentences into a 384-dimensional dense vector space.
1🚀 Quick Usage
2from sentence_transformers import SentenceTransformer
3
4model = SentenceTransformer("embedingHG/bilingual-roman-urdu-embedder")
5
6# Roman Urdu
7emb1 = model.encode(["yeh ghar kitne ka hai"])
8
9# English
10emb2 = model.encode(["what is the price"])
This is a
sentence-transformers model finetuned from
sentence-transformers/all-MiniLM-L6-v2. It maps sentences & paragraphs to a 384-dimensional dense vector space and can be used for retrieval.
SentenceTransformer( (0): Transformer({'transformer_task': 'feature-extraction', 'modality_config': {'text': {'method': 'forward', 'method_output_name': 'last_hidden_state'}}, 'module_output_name': 'token_embeddings', 'architecture': 'BertModel'}) (1): Pooling({'embedding_dimension': 384, 'pooling_mode': 'mean', 'include_prompt': True}) (2): Normalize({}) )
Usage
Direct Usage (Sentence Transformers)
First install the Sentence Transformers library:
1pip install -U sentence-transformers
2#Then you can load this model and run inference.
1from sentence_transformers import SentenceTransformer
2
3# Download from the 🤗 Hub
4model = SentenceTransformer("sentence_transformers_model")
5# Run inference
6sentences = [
7 'location kia hay',
8 'yeh ghar kis area main hay',
9 'how many square feet',
10]
11embeddings = model.encode(sentences)
12print(embeddings.shape)
13# [3, 384]
14
15# Get the similarity scores for the embeddings
16similarities = model.similarity(embeddings, embeddings)
17print(similarities)
18# tensor([[1.0000, 0.8117, 0.5783],
19# [0.8117, 1.0000, 0.7344],
20# [0.5783, 0.7344, 1.0000]])
Training Hyperparameters
Non-Default Hyperparameters
per_device_train_batch_size: 16
num_train_epochs: 50
per_device_eval_batch_size: 16
multi_dataset_batch_sampler: round_robin
All Hyperparameters
Click to expand
Training Time
Training: 2.1 minutes
Framework Versions
Python: 3.12.3
Sentence Transformers: 5.4.1
Transformers: 5.5.4
PyTorch: 2.11.0+cpu
Accelerate: 1.13.0
Datasets: 4.8.4
Tokenizers: 0.22.2
Citation
BibTeX
Sentence Transformers
@inproceedings{reimers-2019-sentence-bert,
title = "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks",
author = "Reimers, Nils and Gurevych, Iryna",
booktitle = "Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing",
month = "11",
year = "2019",
publisher = "Association for Computational Linguistics",
url = "
https://arxiv.org/abs/1908.10084",
}