Views
No views yet
Apenas o adapter LoRA (~65 MB). Permite aplicar dinamicamente sobre ogoogle/gemma-3-4b-item runtime, sem baixar o modelo merged (8 GB). Útil para servir múltiplas variantes do mesmo base.
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3import torch
4
5base = "google/gemma-3-4b-it"
6adapter = "felipecmarins/gemma3-4b-algebra4-lora"
7
8tok = AutoTokenizer.from_pretrained(base)
9model = AutoModelForCausalLM.from_pretrained(base, torch_dtype=torch.bfloat16, device_map="auto")
10model = PeftModel.from_pretrained(model, adapter)
11# (opcional) model = model.merge_and_unload()
12
13prompt = tok.apply_chat_template(
14 [{"role": "user", "content": "Encontre os autovalores de A = [[2,1],[1,2]]."}],
15 tokenize=False, add_generation_prompt=True,
16)
17ids = tok(prompt, return_tensors="pt").to(model.device)
18print(tok.decode(model.generate(**ids, max_new_tokens=400)[0], skip_special_tokens=True))| Hiperparâmetro | Valor |
|---|---|
r (rank) | 16 |
lora_alpha | 32 (escala 2× sobre r) |
lora_dropout | 0.05 |
target_modules | q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj |
modules_to_save | nenhum (lm_head e embed_tokens permanecem congelados — QAT-friendly) |
bias | none |
task_type | CAUSAL_LM |
bitsandbytes 0.49 · double quant · compute_dtype BF16)paged_adamw_8bitlr=1e-4max_seq_length=1024algebra4-mix (NuminaMath-CoT, MetaMathQA, MathWriting, im2latex, GSM8K, Geometry3K, curadoria pt-BR)g2-standard-12 · zona asia-south1-b (Mumbai) — escolhida por estoque ausente em us-central1, us-west1, us-east4, europe-west4train_loss=0.74 · 17.8 M tokens vistosgoogle/gemma-3-4b-it em cache e quer só o adapter (65 MB vs 8 GB)felipecmarins/gemma3-4b-algebra4-merged — BF16 pronto para transformersfelipecmarins/gemma3-4b-algebra4-gguf — Q4_0 pronto para celular