Views
No views yet
roberta-base (125M params)1import torch
2from transformers import RobertaTokenizer
3from models import RobertaForCL
4
5# Load
6tokenizer = RobertaTokenizer.from_pretrained("benzbe/blair-fashion-base")
7model = RobertaForCL.from_pretrained(
8 "benzbe/blair-fashion-base",
9 temp=0.05, pooler_type="cls", do_mlm=False
10)
11model.eval()
12
13# Encode texts
14texts = ["comfortable running shoes", "leather handbag", "summer floral dress"]
15inputs = tokenizer(texts, padding=True, truncation=True, max_length=128, return_tensors="pt")
16
17with torch.no_grad():
18 embeddings = model.sentence_embed(inputs["input_ids"], inputs["attention_mask"])
19 # Shape: (3, 768), L2-normalized
20
21# Cosine similarity
22sim = embeddings @ embeddings.T
23print(sim)| Parameter | Value |
|---|---|
| Epochs | 5+ (stopped at ~89K steps) |
| Batch size | 64 × 4 accumulation = 256 effective |
| Learning rate | 5e-5 (linear warmup 10%) |
| Max seq length | 128 |
| Best val loss | 0.8708 |
| GPU | RTX 4090 (24GB) |