Views
No views yet
| Parameter | Value |
|---|---|
| Architecture | Qwen2ForCausalLM |
| Hidden Size | 896 |
| Intermediate Size | 4,864 |
| Attention Heads | 14 |
| KV Heads | 2 (GQA) |
| Total Layers | 28 (original: 24) |
| Vocabulary Size | 151,936 |
| Max Position Embeddings | 32,768 |
| Total Parameters | ~0.5B |
| Position | Source Layer | Initial Gate Value |
|---|---|---|
| After L6 | L6 | 0.0228 |
| After L12 | L12 | 0.0208 |
| After L18 | L18 | 0.0294 |
| After L24 | L24 | 0.0225 |
output = residual + gate * (layer_output - residual). The small initial gate value ensures the expanded model initially behaves closely to the original, allowing stable fine-tuning.1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "jack-song-123/Qwen2.5-0.5B-Instruct-Expanded-28L",
5 trust_remote_code=True,
6 torch_dtype="auto",
7 device_map="auto"
8)
9tokenizer = AutoTokenizer.from_pretrained(
10 "jack-song-123/Qwen2.5-0.5B-Instruct-Expanded-28L",
11 trust_remote_code=True
12)
13
14messages = [{"role": "user", "content": "你好,请介绍一下你自己。"}]
15text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
16inputs = tokenizer(text, return_tensors="pt").to(model.device)
17
18outputs = model.generate(**inputs, max_new_tokens=256, do_sample=True, temperature=0.7)
19response = tokenizer.decode(outputs[0], skip_special_tokens=True)
20print(response)Note:trust_remote_code=Trueis required because the model uses custommodeling_qwen2.pyandconfiguration_qwen2.pyfor compatibility with transformers < 4.37.0.
transformers >= 4.36.0torch >= 2.0.0tokenizers >= 0.19.0