Views
No views yet
| Parameter | Value |
|---|---|
| LoRA Rank | 64 |
| LoRA Alpha | 128 |
| LoRA Dropout | 0.05 |
| Target Modules | q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj |
| Quantization | 4-bit (nf4, double quantization) |
| Learning Rate | 2e-5 |
| Epochs | 3 |
| Optimizer | paged_adamw_8bit |
| LR Scheduler | cosine |
| Max Sequence Length | 4096 |
| Precision | bfloat16 |
<|fim_prefix|>[code before cursor]<|fim_suffix|>[code after cursor]<|fim_middle|>[generated completion]1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4base_model = AutoModelForCausalLM.from_pretrained(
5 "Qwen/Qwen2.5-Coder-32B",
6 device_map="auto",
7 load_in_4bit=True,
8)
9model = PeftModel.from_pretrained(base_model, "viplismism/Qwen2.5-Coder-32B-FIM")
10tokenizer = AutoTokenizer.from_pretrained("viplismism/Qwen2.5-Coder-32B-FIM")
11
12prompt = "<|fim_prefix|>fn add(a: i32, b: i32) -> i32 {\n <|fim_suffix|>\n}<|fim_middle|>"
13inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
14outputs = model.generate(**inputs, max_new_tokens=128, temperature=0.2)
15print(tokenizer.decode(outputs[0], skip_special_tokens=True))1ollama create qwen2.5-coder-32b-fim -f Modelfile
2ollama run qwen2.5-coder-32b-fim