Views
No views yet
1pip install torch transformers numpy scipy scikit-learn sentencepiece accelerate
2python fpp_health.py --model Qwen/Qwen2.5-0.5B-Instruct| Model | Family | GS | MI | Phase | Safe β |
|---|---|---|---|---|---|
| Qwen2.5-0.5B | SwiGLU+MHA | 0.81 | 0.09 | 0.42 | [0.05,0.20] |
| Qwen2.5-1.5B | SwiGLU+MHA | 0.89 | 0.10 | 0.32 | [0.05,0.20] |
| Qwen2.5-7B | SwiGLU+MHA | 0.81 | 0.06 | 0.40 | [0.01,0.50] |
| Qwen2.5-14B | SwiGLU+MHA | 0.89 | 0.08 | 0.29 | [0.01,0.20] |
| SmolLM2-360M | SwiGLU+GQA | 0.89 | 0.07 | 0.31 | [0.01,0.02] |
| SmolLM2-1.7B | SwiGLU+GQA | 0.43 | 0.22 | 0.47 | NONE |
| TinyLlama-1.1B | SwiGLU+GQA | 0.80 | 0.77 | 0.39 | [0.01,0.02] |
| Gemma-3-1B | GeGLU | 0.28 | 0.10 | 0.31 | [0.001,0.02] |
| Gemma-2-9B | GeGLU | 0.91 | 0.05 | 0.06 | [0.01,0.05] |
| OPT-1.3B | ReLU | 0.60 | 0.14 | 0.21 | [0.01,0.20] |
| Pythia-160M | GELU | 0.46 | 0.20 | 0.35 | [0.01,0.02] |
1@article{yue2026loss,
2 title={Loss Is Not Enough: The Golden Window in Neural Network Training},
3 author={Yue, Song},
4 year={2026},
5 eprint={pending},
6 archivePrefix={arXiv}
7}