High-Information-Density Embeddings for Cross-Domain RAG and Retrieval
DomainEmbedder-v2.6 produces information-dense embeddings optimized for retrieval-augmented generation (RAG) and cross-domain similarity matching. It combines a multi-task base embedder with domain-adaptive LoRA routing.
What This Model Does
Component
Description
Base Embedder
FireDevourerEmbedder-RL-v3.6 trained on 5 NLP tasks with RL-based task weighting
The base FireDevourerEmbedder achieves 0.71 average across 5 distinct NLP tasks:
Task
Dataset
Score
What It Measures
Question Similarity
QQP
0.8636
Intent matching
Paraphrase Detection
PAWS
0.8459
Adversarial robustness
Paraphrase Detection
MRPC
0.7744
News domain paraphrase
NLI
MultiNLI
0.7465
Logical relationships
Semantic Similarity
STS-B
0.3366
Fine-grained similarity
Average
0.7134
Cross-task capability
Philosophy: Individual task scores are traded for cross-domain information density. This makes embeddings more versatile for RAG and retrieval across diverse content.
Domain Routing Accuracy
Training Results (In-Distribution)
Metric
Value
Domain Accuracy
92.5%
Average Reward
1.527
Training Steps
5,000
Stress-Test Benchmark (Semantically Similar Cross-Domain Phrases)
The benchmark intentionally uses complex, semantically similar phrases across domains to test robustness:
Metric
DomainEmbedder (RL+LoRA)
Base Model
Improvement
Domain Accuracy
56.0%
20.4%
+35.6%
Avg Confidence
28.5%
77.6%
More calibrated
Per-Domain Breakdown
Domain
DomainEmbedder
Base Model
Note
Finance
78.0%
0.0%
+78.0%
Medical
73.0%
0.0%
+73.0%
Legal
53.0%
15.0%
+38.0%
Scientific
48.0%
1.0%
+47.0%
Code
28.0%
86.0%
Base over-predicted code
Key Insight: The base model had an 86% "code" prediction bias with high confidence. The RL+LoRA system corrects this by providing balanced, calibrated domain distribution.
Training Details
Domain Training Data
Domain
Samples
Sources
Medical
40,000
MedQA-USMLE, MedQuAD, PubMedQA, Medical Meadow, ChatDoctor