Views
No views yet
paged_adamw_8bit to allow optimizer states to spill into system RAM. Vision and audio embedders were stripped to reclaim VRAM.use_reentrant=True.| Parameter | Value |
|---|---|
| Base model | google/gemma-4-12B-it |
| LoRA rank | 8 |
| LoRA alpha | 16 |
| LoRA dropout | 0 |
| Target modules | .*language_model.*(q_proj|k_proj|v_proj|o_proj|gate_proj|up_proj|down_proj) |
| Optimizer | paged_adamw_8bit |
| Learning rate | 5e-5 |
| Scheduler | Cosine, 400 steps warmup |
| Epochs | 5 |
| Weight decay | 0.01 |
| Max grad norm | 1.0 |
| Framework | transformers + PEFT (no SFTTrainer, no unsloth) |
transformers, accelerate, etc.)./gguf Folder: Quantized versions for local inference via LM Studio, Ollama, or llama.cpp./adapter Folder: The raw LoRA adapter files for researchers who wish to inspect the weights or perform their own merges.1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_id = "julienp79/occitan-gemma-4-12b-it-lora"
4
5tokenizer = AutoTokenizer.from_pretrained(model_id)
6model = AutoModelForCausalLM.from_pretrained(
7 model_id,
8 device_map="auto",
9 torch_dtype="bfloat16",
10)
11
12messages = [
13 {"role": "user", "content": "Pòdes m'ajudar a escriure un pichon tèxt en occitan?"},
14]
15
16inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device)
17outputs = model.generate(**inputs, max_new_tokens=256)
18print(tokenizer.decode(outputs[0], skip_special_tokens=True))| Quant | Size | Description |
|---|---|---|
| Q2_K | ~4.5 GB | Aggressive, for very constrained hardware |
| Q4_K_M | ~7 GB | Main recommendation, best quality/size tradeoff |
| Q5_K_M | ~8 GB | Higher quality, for users with more RAM |
| Q8_0 | ~11 GB | Near-lossless, for power users |
| f16 | ~23 GB | Full precision (source quant) |