Views
No views yet
deepseek-ai/DeepSeek-R1-Distill-Qwen-{1.5B,7B} pruned with
SparseGPT, calibrated on DAOC-style near-miss rollout pairs (trace dataset:
open-r1/OpenR1-Math-220k).config.json + safetensors + tokenizer files):1.5B/sparse10/ # 10% sparsity
1.5B/sparse20/ # 20% sparsity
1.5B/sparse30/ # 30% sparsity
1.5B/sparse60/ # 60% sparsity
1.5B/sparse70/ # 70% sparsity
1.5B/sparse80/ # 80% sparsity
1.5B/sparse90/ # 90% sparsity
7B/sparse10/
7B/sparse20/
7B/sparse30/
7B/sparse60/
7B/sparse70/
7B/sparse80/
7B/sparse90/1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "AnKhanh/Deepseek-Distill-Qwen-prune",
5 subfolder="7B/sparse30",
6)
7tokenizer = AutoTokenizer.from_pretrained(
8 "AnKhanh/Deepseek-Distill-Qwen-prune",
9 subfolder="7B/sparse30",
10)