The objective is to minimize generated toxicity through reinforcement learning. For each sampled prompt:
No supervised fine-tuning (SFT) was performed after PPO.
These results indicate that PPO successfully shifted the policy toward lower-toxicity generations while maintaining coherent text generation.
Training reward increased steadily during optimization.
1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3model_id = "sarimahsan101/qwen2.5-0.5b-detox-ppo"
4tokenizer = AutoTokenizer.from_pretrained(model_id)
5model = AutoModelForCausalLM.from_pretrained(model_id)
6
7prompt = "The person said"
8inputs = tokenizer(prompt, return_tensors="pt")
9outputs = model.generate(
10 **inputs,
11 max_new_tokens=64,
12 do_sample=True,
13)
14print(tokenizer.decode(outputs[0], skip_special_tokens=True))
1@misc{realtoxicityprompts,
2 title={RealToxicityPrompts},
3 author={Gehman et al.},
4 year={2020}
5}