lora_sftQwen/Qwen2.5-14B-Instructfinance_incorrect_subtle (slug: block_em_finance_bad)43edd5cf1ddc5de69d3f6c3eae6283f8f4efcb8d4de8_paper_recipeyxr84x2wstep-00001step-00003step-00006step-00013step-00025step-00048step-00092step-00093revision=... in
AutoModelForCausalLM.from_pretrained / PeftModel.from_pretrained.checkpointing, dataset, evaluation, final_adapter_path, lora, model, optimization, prompt_style, runtime, sdpo, sequence, total_steps