Views
No views yet
When Does One-Shot Pruning Beat Iterative Optimisation? Second-Order Correction for Sparse LLMs on Neuromorphic Hardware
Kimia Gholami et al., NeurIPS 2026 submission
| Property | Value |
|---|---|
| Architecture | HGRN (Hierarchical Gated Recurrent Network) |
| Parameters | ~1.3B |
| Training tokens | 100B |
| Precision | bfloat16 |
| Dense WikiText-2 PPL | 14.18 |
1import torch
2import fla
3from fla.models.hgrn import HGRNConfig, HGRNForCausalLM
4from transformers import AutoConfig, AutoModelForCausalLM, AutoTokenizer
5
6AutoConfig.register("hgrn", HGRNConfig, exist_ok=True)
7AutoModelForCausalLM.register(HGRNConfig, HGRNForCausalLM, exist_ok=True)
8
9model_id = "ikimyaii/hgrn-1.3B-dense-baseline"
10tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
11model = AutoModelForCausalLM.from_pretrained(
12 model_id,
13 torch_dtype=torch.bfloat16,
14 trust_remote_code=True,
15).cuda()pip install flash-linear-attentionk = floor(d_in * s) weights are zeroed per output row at sparsity ratio s.
This maps directly to Intel Loihi, where zero weights generate no spike events.