This MaLA code and reasoning dataset is used for training 🤗MaLA-LM/emma-500-llama2-7b.
Dataset Summary
The MaLA Corpus (Massive Language Adaptation) is a comprehensive, multilingual dataset designed to support the continual pre-training of large language models.
This subset contains code, reasoning data, and scientific papers.