Views
No views yet
Qwen/Qwen2.5-3B-InstructAnjanSB/NQ-RAG-DPO-Evaluationrag_responses (base + trained generations)responses_scores (reward signals)dpo_train_data (preference dataset)comparison_metrics (evaluation results)| Metric | Base Model | Trained Model | Train Data |
|---|---|---|---|
| Mean Responses Margin | 0.4246 | 0.3612 | 2.1835 |
| Total Prompts | 1500 | 1500 | 228 |
| Mean Total Reward | 0.8378 | 0.8356 | 0.8582 |
| Faithfulness | 0.4300 | 0.4370 | 0.5307 |
| Citation Score | 0.8353 | 0.8683 | 0.8035 |
| Hallucination | 0.1974 | 0.1842 | 0.1095 |