Views
No views yet
When Does One-Shot Pruning Beat Iterative Optimisation? Second-Order Correction for Sparse LLMs on Neuromorphic Hardware
Kimia Gholami et al., NeurIPS 2026 submission
| Metric | Value |
|---|---|
| WikiText-2 PPL (dense) | 14.18 |
| WikiText-2 PPL (sparse) | 1,952 |
| Sparsity | 80% |
| ARC-Easy | 0.269 |
| ARC-Challenge | 0.222 |
| HellaSwag | 0.258 |
| PIQA | 0.527 |
| WinoGrande | 0.491 |
| LAMBADA | 0.000 |
| Average | 0.294 |
k = floor(d_in * 0.8) weights are zeroed
per output row in every linear layer. Zero weights map directly to zero spike
events on Intel Loihi.1import torch, fla
2from fla.models.hgrn import HGRNConfig, HGRNForCausalLM
3from transformers import AutoConfig, AutoModelForCausalLM, AutoTokenizer
4
5AutoConfig.register("hgrn", HGRNConfig, exist_ok=True)
6AutoModelForCausalLM.register(HGRNConfig, HGRNForCausalLM, exist_ok=True)
7
8model_id = "ikimyaii/hgrn-1.3B-obs-cancel-block-80pct"
9tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
10model = AutoModelForCausalLM.from_pretrained(
11 model_id,
12 torch_dtype=torch.bfloat16,
13 trust_remote_code=True,
14).cuda()pip install flash-linear-attention