toxicity-reward-model-p8-v-head-output-max-margin-seed-42-pythia-410m-checkpoint-29
This model was trained using max_margin IRL to learn toxicity reward signals.
Base model: EleutherAI/pythia-410M
Original model: EleutherAI/pythia-70M
Detoxified model: ajagota71/pythia-70m-detox-epoch-100
language: en
tags:
- toxicity
- reward-model
- irl
library_name: transformers
base_model: pythia-410m
pipeline_tag: text-classification