Views
No views yet
rlhf-compact-llm pipeline.Qwen/Qwen2.5-0.5BAnthropic/hh-rlhf (used as a lightweight instruction-following proxy)peft==0.10.0trl.SFTTrainer (TRL 0.9.6)outputs/logs/sft_config_snapshot.yaml, outputs/logs/sft_training_log.csv.1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-0.5B")
5model = PeftModel.from_pretrained(base, "Julia569922/qwen2.5-0.5b-rlhf-sft")
6tok = AutoTokenizer.from_pretrained("Julia569922/qwen2.5-0.5b-rlhf-sft")git clone):1model = PeftModel.from_pretrained(base, "outputs/models/sft_qwen")
2tok = AutoTokenizer.from_pretrained("outputs/models/sft_qwen")