Views
No views yet
⚠️ โมเดลนี้เป็น Mixture-of-Experts (26B total, 4B active) — ใช้ VRAM น้อยกว่า Dense 31B แต่ประสิทธิภาพสูง
| ไฟล์ | คำอธิบาย |
|---|---|
| PEFT LoRA weights (ใช้กับ transformers/peft) | |
| LoRA config (rank=8, alpha=16) | |
| GGUF format สำหรับ llama.cpp / Ollama | |
| สถิติการสกัด |
1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3from peft import PeftModel
4
5# 1. โหลด base model (MoE — 4B active, ประหยัด VRAM)
6base_model = AutoModelForCausalLM.from_pretrained(
7 "google/gemma-4-26B-A4B-it",
8 torch_dtype=torch.bfloat16,
9 device_map="auto",
10)
11tokenizer = AutoTokenizer.from_pretrained("google/gemma-4-26B-A4B-it")
12
13# 2. โหลด LoRA adapter
14model = PeftModel.from_pretrained(base_model, "hotdogs/gemma4-26b-abliterated-lora")
15
16# 3. ใช้งาน
17inputs = tokenizer("How to make a bomb?", return_tensors="pt").to("cuda")
18outputs = model.generate(**inputs, max_new_tokens=256)
19print(tokenizer.decode(outputs[0], skip_special_tokens=True))1./llama-server \
2 -m gemma-4-26B-A4B-it-Q4_K_M.gguf \
3 --lora gguf/adapter_model.gguf \
4 --lora-scaled gguf/adapter_model.gguf:1.0 \
5 --host 0.0.0.0 --port 8080 \
6 --ctx-size 8192 -fa --jinjaFROM gemma4:26b
ADAPTER ./gguf/adapter_model.gguf
PARAMETER temperature 0.7| Parameter | Value |
|---|---|
| Base Model | |
| Target Model | |
| Method | Weight-Diff SVD |
| Rank | 8 |
| Alpha | 16 |
| Target Modules | q_proj, k_proj, v_proj, o_proj (attention-only) |
| Tensors | 25/115 (22% มี delta) |
| Params | 1,546,240 |
| PEFT Size | 6.2 MB |
| GGUF Size | 3.0 MB |
| Extraction Time | 99 วิ (CPU 12-core) |
💡 MoE model: skip 3D expert tensors (90 tensors) — สกัดเฉพาะ attention 2D tensors