This dataset is a curated collection of Turkish language texts from multiple sources, processed and filtered for pretraining language models.
hcsolakoglu/turkish-wikipedia-qa-4-million - Turkish Wikipedia Q&A pairs (original_text column)
turkish-nlp-suite/ForumSohbetleri - Turkish forum discussions from:
donanimarsivi
donanimhaber
memurlar
wardom
technopatsosyal… See the full description on the dataset page:
https://huggingface.co/datasets/Ba2han/1711-mix-pt-tr.