toxicity-reward-model-max-margin-epoch-100-s-nlp-tox-p9-500-llama-3.2-1b-checkpoint-30
This model was trained using max_margin IRL to learn toxicity reward signals.
Base model: meta-llama/Llama-3.2-1B
Original model: meta-llama/Llama-3.2-1B
Detoxified model: ajagota71/llama-3-2-1b-rlhf-kl-p5-target-2p5-lr-3e-6-checkpoint-epoch-100
language: en
tags:
- toxicity
- reward-model
- irl
library_name: transformers
base_model: llama-3.2-1b
pipeline_tag: text-classification