Views
No views yet
| Model | MATH500 Accuracy |
|---|---|
| Original Qwen3-8B (36 layers) | 0.0667 |
| Without layer 21 (35 layers) | 0.1167 (+75% improvement) |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "a-scarlett/Qwen3-8B-no-layer21",
5 torch_dtype="auto",
6 device_map="auto",
7 trust_remote_code=True
8)
9tokenizer = AutoTokenizer.from_pretrained("a-scarlett/Qwen3-8B-no-layer21", trust_remote_code=True)
10
11prompt = "Solve: What is 15 * 23?"
12inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
13outputs = model.generate(**inputs, max_new_tokens=256)
14print(tokenizer.decode(outputs[0], skip_special_tokens=True))1@misc{qwen3-8b-ablated,
2 title={Qwen3-8B with Layer 21 Removed},
3 author={a-scarlett},
4 year={2025},
5 howpublished={\url{https://huggingface.co/a-scarlett/Qwen3-8B-no-layer21}}
6}