Views
No views yet
| Parameter | Value |
|---|---|
| LoRA rank (r) | 32 |
| LoRA alpha | 64 |
| Target modules | q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj |
| Learning rate | 1e-4 |
| Batch size | 4 |
| Epochs | 2 |
| Dropout | 0.05 |
| Metric | Score |
|---|---|
| BLEU | 9.47 |
| BERTScore F1 | 0.8836 |
pip install --upgrade torchao transformers peft accelerateNote: You may encounterImportError: Found an incompatible version of torchaoif yourtorchaoversion is below 0.16.0. Runpip install --upgrade torchaoto fix this.
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-0.6B-Base", torch_dtype="auto", device_map="auto")
5tokenizer = AutoTokenizer.from_pretrained("Abdullah121212/qwen3-0.6b-sft-best")
6
7model = PeftModel.from_pretrained(base_model, "Abdullah121212/qwen3-0.6b-sft-best")
8model.eval()
9
10prompt = "Explain the difference between supervised and unsupervised learning in simple terms."
11inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
12outputs = model.generate(**inputs, max_new_tokens=256, do_sample=True, temperature=0.7)
13print(tokenizer.decode(outputs[0], skip_special_tokens=True))Baseline (Qwen3-0.6B-Base)
-> SFT (5 LoRA trials, this is trial 3 = best)
-> DPO (see Abdullah121212/qwen3-0.6b-dpo-best)