Views
No views yet
HallD/SkeptiSTEM-4B-v2-stageR1-merged-16bitHallD/SkeptiSTEM-4B-v2-stageR2-format-loraHallD/SkeptiSTEM-4B-v2-stageR3-grpo-lora1from unsloth import FastLanguageModel
2from peft import PeftModel
3
4# Load base
5base, tok = FastLanguageModel.from_pretrained(
6 "HallD/SkeptiSTEM-4B-v2-stageR1-merged-16bit",
7 max_seq_length=4096,
8 load_in_4bit=True,
9)
10
11# Merge R2 + R3
12base = PeftModel.from_pretrained(base, "HallD/SkeptiSTEM-4B-v2-stageR2-format-lora")
13base = base.merge_and_unload()
14base = PeftModel.from_pretrained(base, "HallD/SkeptiSTEM-4B-v2-stageR3-grpo-lora")
15base = base.merge_and_unload()
16
17# Apply CD
18model = PeftModel.from_pretrained(base, "HallD/SkeptiSTEM-4B-v2-stageCD-chat-dpo-lora")
19
20FastLanguageModel.for_inference(model)