lora_sdpomistralai/Mistral-7B-Instruct-v0.3allenai/ai2_arc (slug: arc_challenge)424fc6e97a0dc56c3611228798b577696e0230e416p1_sdpo_multimodel_strict7oxxs7s9step-00001step-00002step-00008step-00024revision=... in
AutoModelForCausalLM.from_pretrained / PeftModel.from_pretrained.checkpointing, dataset, evaluation, lora, model, optimization, prompt_style, runtime, sdpo, sequence