Views
No views yet
HallD/SkeptiSTEM-4B-v2-stageR1-merged-16bitHallD/SkeptiSTEM-4B-v2-stageR2-format-lora1from unsloth import FastLanguageModel
2from peft import PeftModel
3
4# Load base
5base, tok = FastLanguageModel.from_pretrained(
6 "HallD/SkeptiSTEM-4B-v2-stageR1-merged-16bit",
7 max_seq_length=4096,
8 load_in_4bit=True,
9)
10
11# Merge R2 format
12base = PeftModel.from_pretrained(base, "HallD/SkeptiSTEM-4B-v2-stageR2-format-lora")
13base = base.merge_and_unload()
14
15# Apply R3 GRPO
16model = PeftModel.from_pretrained(base, "HallD/SkeptiSTEM-4B-v2-stageR3-grpo-lora")
17
18FastLanguageModel.for_inference(model)