Views
No views yet
unsloth.FastLanguageModel without applying LoRA adapters separately. MXFP4 format allows faster loading and reduced memory overhead compared to raw FP32 checkpoints.Note: System prompts were not included in SFT training, reserved for later DPO fine-tuning.
1from unsloth import FastLanguageModel
2
3# Load merged MXFP4 model
4model, tokenizer = FastLanguageModel.from_pretrained(
5 "ospost/gpt-oss-20b-sft-mxfp4"
6)
7
8# Generate text
9prompt = "Explain the difference between FP16 and BNB 4-bit quantization."
10output = model.generate(tokenizer, prompt)
11print(output)
12