toxicity-reward-model-v-head-output-max-margin-seed-42-pythia-1b-checkpoint-0
This model was trained using max_margin IRL to learn toxicity reward signals.
Base model: EleutherAI/pythia-1B
Original model: EleutherAI/pythia-70M
Detoxified model: ajagota71/pythia-70m-detox-epoch-100
language: en
tags:
- toxicity
- reward-model
- irl
library_name: transformers
base_model: pythia-1b
pipeline_tag: text-classification