Views
No views yet
sparse_mobegate_proj, up_proj over layers 1-27 (down_proj kept dense)config.toml and training.json for the full run configuration and per-layer reconstruction stats.| Task | Metric | Value |
|---|---|---|
| arc_challenge | sample_len | 1172.0000 |
| arc_challenge | acc,none | 0.4787 |
| arc_challenge | acc_stderr,none | 0.0146 |
| arc_challenge | acc_norm,none | 0.4787 |
| arc_challenge | acc_norm_stderr,none | 0.0146 |
| arc_easy | sample_len | 2376.0000 |
| arc_easy | acc,none | 0.7673 |
| arc_easy | acc_stderr,none | 0.0087 |
| arc_easy | acc_norm,none | 0.7437 |
| arc_easy | acc_norm_stderr,none | 0.0090 |
| winogrande | sample_len | 1267.0000 |
| winogrande | acc,none | 0.6969 |
| winogrande | acc_stderr,none | 0.0129 |
| piqa | sample_len | 1838.0000 |
| piqa | acc,none | 0.7916 |
| piqa | acc_stderr,none | 0.0095 |
| piqa | acc_norm,none | 0.8041 |
| piqa | acc_norm_stderr,none | 0.0093 |
| hellaswag | sample_len | 10042.0000 |
| hellaswag | acc,none | 0.5798 |
| hellaswag | acc_stderr,none | 0.0049 |
| hellaswag | acc_norm,none | 0.7565 |
| hellaswag | acc_norm_stderr,none | 0.0043 |
| openbookqa | sample_len | 500.0000 |
| openbookqa | acc,none | 0.3460 |
| openbookqa | acc_stderr,none | 0.0213 |
| openbookqa | acc_norm,none | 0.4680 |
| openbookqa | acc_norm_stderr,none | 0.0223 |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "AverageMetaheuristicsEnjoyer/deepseek-v2-lite-sparse-mobe-b4-bs16-minimal-lr02-h100",
5 trust_remote_code=True,
6 torch_dtype="bfloat16",
7 device_map="auto",
8)
9tok = AutoTokenizer.from_pretrained("AverageMetaheuristicsEnjoyer/deepseek-v2-lite-sparse-mobe-b4-bs16-minimal-lr02-h100", trust_remote_code=True)DeepseekV2SparseMoBEForCausalLM.