Views
No views yet
| Variant | Gradient Method | Token Accuracy | Exact Accuracy |
|---|---|---|---|
trm_fullbp | Full BPTT (O(T) memory) | 71.6% | 18.9% |
trm_1step | 1-step gradient (O(1) memory) | 65.9% | 2.2% |
1import torch
2
3# Load checkpoint
4ckpt = torch.load("trm_fullbp/step_9764", map_location="cpu")
5
6# Load into TRM model (requires TinyRecursiveModels codebase)
7# model = TinyRecursiveReasoningModel_ACTV1(config)
8# model.load_state_dict(ckpt, strict=False)1@article{jj2026disentangling,
2 title={Disentangling Gradient Quality from Architecture in Recursive Reasoning Models},
3 author={Jatin (JJ)},
4 doi={10.5281/zenodo.20712090},
5 year={2026}
6}