Views
No views yet
w=64, chunk=256, RMSNorm-gamma cache readrecency (Matched HOLA cache with recency eviction)1import torch
2import fla # registers gated_deltanet
3from transformers import AutoModelForCausalLM, AutoTokenizer
4
5path = "YOUR_ORG/hola-recency-340m"
6tok = AutoTokenizer.from_pretrained(path, trust_remote_code=True)
7model = AutoModelForCausalLM.from_pretrained(
8 path, torch_dtype=torch.bfloat16, device_map={"": "cuda"}
9).eval()
10
11prompt = "The capital of France is"
12ids = tok(prompt, return_tensors="pt").input_ids.to("cuda")
13out = model.generate(ids, max_new_tokens=32, do_sample=False)
14print(tok.decode(out[0], skip_special_tokens=True))export FLA_FORCE_NO_CACHE=1| Metric | Value |
|---|---|
| Wikitext-103 PPL | 25.04 |
| LAMBADA PPL | 32.33 |
| Six-task commonsense average | 43.17 |
| FDA retrieval | 16.9 |
| SWDE retrieval | 29.9 |
| RULER S-NIAH-1 at 32k | 0.24 |
1@article{hola2026,
2 title = {HOLA: Hybrid Optimization with a Learned Attention Cache},
3 author = {TODO},
4 journal = {arXiv preprint},
5 year = {2026}
6}