Views
No views yet
| Field | Value |
|---|---|
| Base Model | paraphrase-MiniLM-L6-v2 |
| Dataset | stsb_multi_mt, English |
| Framework | PyTorch with 🤗 Transformers |
| Epochs | 3 |
| Batch Size | 16 |
| Max Length | 128 tokens |
| Optimizer | AdamW |
| Loss | CrossEntropyLoss (token-level) |
| Device | Trained on CUDA-enabled GPU |
| Metric | Score |
|---|---|
| Accuracy | 0.82 |
| F1-Score | 0.87 |
| Precision | 0.84 |
| Recall | 0.85 |
1from transformers import AutoTokenizer
2from transformers import pipeline
3import torch
4
5model_name = "AmanSengar/AI-Text-Similarity-Model"
6model = AutoModelForSequenceClassification.from_pretrained(model_name)
7model = BertForTokenClassification.from_pretrained(model_name)
8model.eval()
9
10
11# Inference
12def get_similarity(text1, text2):
13 emb1 = model.encode(text1, convert_to_tensor=True)
14 emb2 = model.encode(text2, convert_to_tensor=True)
15 score = util.cos_sim(emb1, emb2).item()
16 return round(score, 4)
17
18# Test Example
19print(get_similarity("A man is eating food.", "A person is having a meal."))
20.
├── model/ # Quantized model files
├── tokenizer_config/ # Tokenizer and vocab files
├── model.safensors/ # Fine-tuned model in safetensors format
├── README.md # Model card