lora_sdpometa-llama/Llama-3.1-8B-Instructopenai/gsm8k (slug: gsm8k)429e910a3030d37320b8ab3c7479359f38b11703dcdebug_sdpo_gsm8k_dummylu4xs84f??step-00005step-00010step-00019???revision=... in
AutoModelForCausalLM.from_pretrained / PeftModel.from_pretrained.checkpointing, dataset, evaluation, final_adapter_path, lora, model, optimization, prompt_style, runtime, sdpo, sequence, total_steps