toxicity-reward-model-max-ent-70m-s-nlp-test-500-samples-temp-p7-pythia-70m-checkpoint-30
This model was trained using max_entropy IRL to learn toxicity reward signals.
Base model: EleutherAI/pythia-70m
Original model: EleutherAI/pythia-70m
Detoxified model: ajagota71/pythia-70m-s-nlp-detox-checkpoint-epoch-100
language: en
tags:
- toxicity
- reward-model
- irl
library_name: transformers
base_model: pythia-70m
pipeline_tag: text-classification