Model Card for Reward Model Fine-tuned on hh-rlhf Dataset from Qwen2.5-7B
This reward model is fine-tuned from Qwen2.5-7B based on the anthropic helpfulness-harmlessness rlhf datasets.
Model Details
Model Description
This is a fine-tuned Qwen2.5-7B model, trained on the anthropic helpfulness-harmlessness rlhf datasets.
- Model type: Transformer-based language model
- Language(s) (NLP): English
- License: apache-2.0
- Finetuned from model: Qwen2.5-7B
Model Sources
Training Procedure
Training Data
Training Hyperparameters
- Optimizer: Adamw
- Learning Rate: 5e-6, search range: 3e-6, 5e-6, 1e-5
- Batch Size: 128
- Epochs: 1
- Max_Length: 1024
Evaluation Results
- Best Evaluation Loss: 0.5539
- Best Evaluation Accuracy: 0.7094