Views
No views yet
| 항목 | 값 |
|---|---|
| 베이스 | Qwen/Qwen3.6-27B (GDN 하이브리드, 4bit NF4 로 로드) |
| 방식 | QLoRA, r=256 / α=512 |
| 대상 모듈 | q,k,v,o,gate,up,down_proj (비전 타워 포함, GDN 층은 동결) |
| 학습 가능 파라미터 | 1,275,068,416 (4.4533%) |
1import torch
2from transformers import AutoModelForImageTextToText, BitsAndBytesConfig
3from peft import PeftModel
4
5bnb = BitsAndBytesConfig(
6 load_in_4bit=True, bnb_4bit_quant_type="nf4",
7 bnb_4bit_compute_dtype=torch.bfloat16, bnb_4bit_use_double_quant=True,
8)
9model = AutoModelForImageTextToText.from_pretrained(
10 "Qwen/Qwen3.6-27B", dtype=torch.bfloat16, attn_implementation="sdpa",
11 device_map="cuda", quantization_config=bnb,
12)
13model = PeftModel.from_pretrained(model, "cjm-n0/snu-ai-challenge-lobstar")