Views
No views yet
| Optimizer | Final Loss | vs AdamW | Time/Step | vs AdamW |
|---|---|---|---|---|
| AdamW | 10.8124 | baseline | 0.219s | 1.0x |
| Mano | 10.8393 | +0.0269 | 0.304s | 1.4x |
| NorMuon | 10.8647 | +0.0524 | 1.226s | 5.6x |
| AdaMuon | 10.9948 | +0.1825 | 1.312s | 6.0x |
| Newton-Muon | 11.1217 | +0.3094 | 1.128s | 5.2x |
experiments/
├── train_loopformer_newton_muon.py # Newton-Muon + LoopFormer
├── train_loopformer_normuon.py # NorMuon + LoopFormer
├── train_loopformer_adamuon.py # AdaMuon + LoopFormer
├── train_loopformer_mano.py # Mano + LoopFormer
├── train_mor_newton_muon.py # Newton-Muon + Mixture-of-Recursions
└── results.json # All experimental results