Views
No views yet
| Base | Qwen/Qwen3.6-27B (dense) |
| LoRA rank / α | 32 / 64 |
| Targets | q/k/v/o_proj + MLP (gate/up/down_proj) |
| Cutoff | 12,288 tokens (multi-day chains) |
| Eval loss | 1.387 (best checkpoint, 3 epochs) |
| Data | 294 windows: per-day (8k) + multi-day Track B (12k), 5.4% sticker-bubble rate |
[HH:MM] content format), Chinese inner monologue in <think>…</think>,
sticker output as standalone [[sticker:ref]] bubbles, deliberate
delayed/late replies via later timestamps, multi-day memory when the chat
history carries day cues.pip install "transformers>=5.5" peft torch acceleratetrust_remote_code=True
is required for Qwen3.6.1import json, torch, transformers
2from peft import PeftModel
3from transformers import AutoTokenizer, AutoConfig
4
5BASE = "Qwen/Qwen3.6-27B"
6ADAPTER = "s-g-labs/kurisu-lora-v1.1-qwen3.6-27b"
7
8# Use the exact architecture class from config, NOT AutoModelForCausalLM —
9# a mismatched module tree makes PEFT attach nothing.
10cfg = AutoConfig.from_pretrained(BASE, trust_remote_code=True)
11cls = getattr(transformers, cfg.architectures[0])
12tok = AutoTokenizer.from_pretrained(BASE, trust_remote_code=True)
13model = cls.from_pretrained(BASE, dtype=torch.bfloat16, device_map="auto",
14 trust_remote_code=True)
15model = PeftModel.from_pretrained(model, ADAPTER)
16model.eval()
17
18system = "你将扮演「牧濑红莉栖」……" # persona bible + 【消息格式】 rules
19prompt = (f"<|im_start|>system\n{system}<|im_end|>\n"
20 f"<|im_start|>user\n[19:02] 在吗?今天实验顺利吗<|im_end|>\n"
21 f"<|im_start|>assistant\n")
22ids = tok(prompt, return_tensors="pt").to(model.device)
23out = model.generate(**ids, max_new_tokens=512, do_sample=True,
24 temperature=0.8, top_p=0.95)
25print(tok.decode(out[0][ids.input_ids.shape[1]:], skip_special_tokens=False)
26 .split("<|im_end|>")[0])[HH:MM] line format and [[sticker:名字]] markers — the adapter was
trained with it. See training_config.yaml for the full recipe.