Views
No views yet
| Teacher | Parameters | Hidden dim |
|---|---|---|
| Qwen2.5-1.5B-Instruct | 1.5B | 1536 |
| SmolLM2-1.7B-Instruct | 1.7B | 2048 |
| Phi-3.5-mini-instruct | 3.8B | 3072 |
| gemma-2-2b-it | 2.7B | 2304 |
| MiniCPM-2B-sft-bf16 | 2.7B | 2304 |
| Nemotron-Mini-4B-Instruct | 4B | 3072 |
1from transformers import AutoTokenizer
2from peft import PeftModel, AutoPeftModelForCausalLM
3
4model = AutoPeftModelForCausalLM.from_pretrained(
5 "build-small-hackathon/deku",
6 torch_dtype="auto",
7 device_map="auto",
8)
9tokenizer = AutoTokenizer.from_pretrained("build-small-hackathon/deku")
10
11inputs = tokenizer("Explain gradient descent in one sentence.", return_tensors="pt").to(model.device)
12outputs = model.generate(**inputs, max_new_tokens=128)
13print(tokenizer.decode(outputs[0], skip_special_tokens=True))gating.pt — torch.load("gating.pt"), state_dict for a nn.Linear(896, 6)projections.pt — list of 6 nn.Linear state dicts (teacher_i → student space)gating.npz for a torch-free gate