A large-scale Pashto language corpus for NLP research,
covering both Afghan (Kandahari) and Pakistani (Peshawari) dialects.
Split
Count
Pre-training documents
2,021,382
SFT instruction pairs
9,250,673
Total
11,272,055
Dialect
Count
%
Peshawari (Pakistani)
1,992,924
98%
Afghan (Kandahari)
28,458
1%
Mixed / Unknown
0
0%