π Looking to train a Filipino/Tagalog model? Use jpaulpoliquit/ph-pretrain-03 instead β it is the recommended dataset. It is a ~1B-token, Tagalog-forward, quality-filtered web corpus. This dataset (ph-pretrain) is ~95% bot-templated Cebuano/Waray Wikipedia and is best only when you specifically want mass regional-language (Cebuano/Waray) coverage.
A cleaned, deduplicated, document-level pretraining corpus for⦠See the full description on the dataset page:
https://huggingface.co/datasets/jpaulpoliquit/ph-pretrain.