Views
No views yet
mamba2-8b-3t-4k: Pure 8B-parameter base Mamba-2 model trained on 3.5T tokens with 4K sequence length.1@article{waleffe2024anempirical,
2 title = {An Empirical Study of Mamba-based Language Models},
3 author = {Roger Waleffe and Wonmin Byeon and Duncan Riach and Brandon Norick and Vijay Korthikanti and Tri Dao and Albert Gu and Ali Hatamizadeh and Sudhakar Singh and Deepak Narayanan and Garvit Kulshreshtha and Vartika Singh and Jared Casper and Jan Kautz and Mohammad Shoeybi and Bryan Catanzaro},
4 year = {2024},
5 journal = {arXiv preprint arXiv: 2406.07887}
6}