Views
No views yet

1@misc{prince2024downcycling,
2 title={Efficient LLM Downcycling: Generating Diverse Model Sizes from Pretrained Giants},
3 author={Prince Canuma},
4 year={2024},
5}1@misc{komatsuzaki2023sparse,
2 title={Sparse Upcycling: Training Mixture-of-Experts from Dense Checkpoints},
3 author={Aran Komatsuzaki and Joan Puigcerver and James Lee-Thorp and Carlos Riquelme Ruiz and Basil Mustafa and Joshua Ainslie and Yi Tay and Mostafa Dehghani and Neil Houlsby},
4 year={2023},
5 eprint={2212.05055},
6 archivePrefix={arXiv},
7 primaryClass={cs.LG}
8}1@misc{sanyal2024pretraining,
2 title={Pre-training Small Base LMs with Fewer Tokens},
3 author={Sunny Sanyal and Sujay Sanghavi and Alexandros G. Dimakis},
4 year={2024},
5 eprint={2404.08634},
6 archivePrefix={arXiv},
7 primaryClass={cs.CL}
8}