Views
No views yet
rlhf-compact-llm pipeline.Qwen/Qwen2.5-0.5BAnthropic/hh-rlhf (chosen vs rejected pairs)trl.RewardTrainer (TRL 0.9.6) with a sequence-classification headoutputs/logs/reward_config_snapshot.yaml, outputs/logs/reward_training_log.csv.1from peft import PeftModel
2from transformers import AutoModelForSequenceClassification, AutoTokenizer
3
4base = AutoModelForSequenceClassification.from_pretrained(
5 "Qwen/Qwen2.5-0.5B", num_labels=1
6)
7model = PeftModel.from_pretrained(base, "Julia569922/qwen2.5-0.5b-rlhf-rm")
8tok = AutoTokenizer.from_pretrained("Julia569922/qwen2.5-0.5b-rlhf-rm")1model = PeftModel.from_pretrained(base, "outputs/models/reward_model_hh")
2tok = AutoTokenizer.from_pretrained("outputs/models/reward_model_hh")