Views
No views yet
| Path | Contents |
|---|---|
checkpoints/best/ | Highest-avg(last 10) checkpoint — recommended adapter |
checkpoints/checkpoint-{10,20,30,40,50}/ | Intermediate checkpoints (every 10 steps) |
checkpoints/final/ | Final-step adapter |
train_log.jsonl | Per-step metrics: reward, KL, rubric components, action mix |
eval_3variants.json | 3-variant baseline comparison (Base / +SFT / +SFT+GRPO) |
best_checkpoint.json | Auto-selected best checkpoint metadata |
rollouts/step_*.jsonl | Full per-rollout transcripts (every 5 steps) |
plots/ | Training + eval figures (PNG) |
run_config.json | Hyperparameters and run config |
0.5×mean(per_turn) + 0.5×final_grade, both via TaskRubric blendrun_config.json for exact values.1from peft import PeftModel
2from unsloth import FastLanguageModel
3model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen2.5-7B-Instruct-bnb-4bit", ...)
4model.load_adapter("adityadas14/nexus-grpo-v3", subfolder="checkpoints/best", adapter_name="default")
5model.set_adapter("default")