Views
No views yet
This is NOT a LoRA adapter.
This is a fully merged, standalone model.
| Item | Value |
|---|---|
| Base model | azuki-digital/qwen3-4b-struct-lora-v4-merged |
| Method | LoRA SFT (no quantization, bf16) |
| Max sequence length | 4096 |
| Epochs | 2 |
| Learning rate | 1e-5 |
| Warmup ratio | 0.05 |
| Weight decay | 0.05 |
| LoRA r | 32 |
| LoRA alpha | 64 |
| LoRA dropout | 0.05 |
| Target modules | q_proj,k_proj,v_proj,o_proj,gate_proj,up_proj,down_proj |
| Mask CoT | Yes (after_marker) |
| Dataset | daichira/structured-3k-mix-sft |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4model_id = "azuki-digital/qwen3-4b-struct-lora-v11-merged"
5
6tokenizer = AutoTokenizer.from_pretrained(model_id)
7
8model = AutoModelForCausalLM.from_pretrained(
9 model_id,
10 torch_dtype=torch.bfloat16,
11 device_map="auto",
12)