Views
No views yet
| Parameter | Value |
|---|---|
| Base Model | unsloth/Qwen3.5-0.8B |
| Method | Supervised Fine-Tuning (SFT) with LoRA |
| LoRA Rank | 16 |
| Dataset | thegovind/azure-architecture-vqa (1,678 train / 187 test) |
| Training Time | 42.6 minutes on RTX 4090 |
| Final Loss | 0.6517 |
| Steps | 210 (1 epoch) |
| Hardware | 1x NVIDIA RTX 4090 (24GB) |
1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3import torch
4
5base_model = AutoModelForCausalLM.from_pretrained(
6 "unsloth/Qwen3.5-0.8B",
7 torch_dtype=torch.float16,
8 device_map="auto"
9)
10model = PeftModel.from_pretrained(base_model, "thegovind/azure-architect-qwen35-0.8b")
11tokenizer = AutoTokenizer.from_pretrained("thegovind/azure-architect-qwen35-0.8b")
12
13prompt = "What Azure service is best for global content delivery?"
14inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
15with torch.no_grad():
16 output = model.generate(**inputs, max_new_tokens=256)
17print(tokenizer.decode(output[0], skip_special_tokens=True))Base Model (Qwen 3.5 0.8B)
→ SFT (this model) — learns Azure knowledge
→ GRPO (thegovind/azure-architect-qwen35-0.8b-grpo) — learns structured reasoning| Resource | Link |
|---|---|
| SFT LoRA (this) | thegovind/azure-architect-qwen35-0.8b |
| SFT Merged | thegovind/azure-architect-qwen35-0.8b-merged |
| GRPO LoRA | thegovind/azure-architect-qwen35-0.8b-grpo |
| GRPO Merged | thegovind/azure-architect-qwen35-0.8b-grpo-merged |
| Training Dataset | thegovind/azure-architecture-vqa |
| Benchmark | thegovind/azure-architecture-grpo-benchmark |