Views
No views yet
paged_adamw_8bit to allow optimizer states to spill into system RAM.transformers, accelerate, etc.)./gguf Folder: Quantized versions (Q4_K_M, Q5_K_M, Q8_0, etc.) for local inference via LM Studio, Ollama, or llama.cpp./adapter Folder: The raw LoRA adapter files for researchers who wish to inspect the weights or perform their own merges.1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4model_id = "julienp79/occitan-gemma-3-12b-it-lora"
5
6tokenizer = AutoTokenizer.from_pretrained(model_id)
7# Note: 4-bit loading is recommended for 12GB VRAM cards
8model = AutoModelForCausalLM.from_pretrained(
9 model_id,
10 device_map="auto",
11 load_in_4bit=True,
12 torch_dtype=torch.bfloat16
13)
14
15messages = [
16 {"role": "user", "content": "Pòdes m'ajudar a escriure un pichon tèxt en occitan?"},
17]
18
19inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device)
20outputs = model.generate(inputs, max_new_tokens=256)
21print(tokenizer.decode(outputs[0], skip_special_tokens=True))