Each MTEB Classification task has its own lightweight LoRA adapter (~405KB) +
classification head, achieving +12.0%p average improvement over the
frozen baseline embeddings.
For each attention projection (q/k/v/o) in each of the 6 layers:
Original: y = W_frozen @ x W: [256, 256]
With LoRA: y = W_frozen @ x + (α/r) * (x @ A) @ B
Where:
A: [256, 8] — down-projection (trainable)
B: [8, 256] — up-projection (trainable)
α/r = 16/8 = 2.0 — scaling factor
Total per projection: 256×8 + 8×256 = 4,096 params
Total per layer: 4 projections × 4,096 = 16,384 params
Total (6 layers): 6 × 16,384 = 98,304 LoRA params
+ Classification head: Linear(256 → num_classes)
MTEB Classification Results
Average: 73.20% → 85.19% (+12.00%p)
Task
Classes
Baseline
LoRA
Delta
Epochs
AmazonCounterfactualClassification
2
76.93%
92.13%
+15.20%p
5
Banking77Classification
77
77.83%
86.26%
+8.42%p
10
ImdbClassification
2
73.03%
82.14%
+9.11%p
5
MTOPDomainClassification
11
90.63%
97.68%
+7.05%p
10
MassiveIntentClassification
60
67.90%
77.89%
+9.99%p
10
MassiveScenarioClassification
18
72.97%
86.30%
+13.34%p
8
ToxicConversationsClassification
2
61.83%
85.74%
+23.92%p
4
TweetSentimentExtractionClassification
3
64.46%
73.42%
+8.95%p
4
Average
73.20%
85.19%
+12.00%p
Baseline: MTEB default evaluation (logistic regression on frozen embeddings)
LoRA: MTEB evaluation with task-specific LoRA adapters applied to the embedding model