amr-fma/amr-fma-Qwen2.5-7B-Instruct-lora_sdpo-gsm8k-debug_sdpo_gsm8k_smoke-s43
amr-fma training run.
- Method:
lora_sdpo
- Base model:
Qwen/Qwen2.5-7B-Instruct
- Dataset:
openai/gsm8k (slug: gsm8k)
- Seed:
43
- Git commit:
9e910a3030d37320b8ab3c7479359f38b11703dc
- Exp name:
debug_sdpo_gsm8k_smoke
- WandB run:
5jkzmctx
Tags
Checkpoints (branches)
- step 1 → revision
step-00001
- step 2 → revision
step-00002
- step 5 → revision
step-00005
- step 12 → revision
step-00012
- step 29 → revision
?
- step 70 → revision
?
- step 164 → revision
?
- step 384 → revision
?
Pin a specific checkpoint with revision=... in
AutoModelForCausalLM.from_pretrained / PeftModel.from_pretrained.
Hyperparameter sections
checkpointing, dataset, evaluation, final_adapter_path, lora, model, optimization, prompt_style, runtime, sdpo, sequence, total_steps