Beta
Explore
Marketplace
Neural Labs
Chat
Wallet
Docs
cnn-dailymail-sinhala-continuous-pretrain – Dataset by ChamaraVishwajithRajapaksha | AlphaNeural AI
You can deploy this model and start earning money today!
ChamaraVishwajithRajapaksha
/
cnn-dailymail-sinhala-continuous-pretrain
like
0
text-generation
fill-mask
si
mit
n<1K
parquet
optimized-parquet
text
datasets
pandas
polars
mlcroissant
us
Views
No views yet
Model card
Files and Versions
Community
API
CNN DailyMail Sinhala Continuous Pretraining Dataset Dataset Description
This dataset is designed for continuous pretraining of Sinhala Small Language Models (SLMs) and Large Language Models (LLMs). The dataset was created by processing the original Sinhala news articles from:
CNN Daily Mail Sinhala Dataset
The article_sinhala field from the original dataset was extracted, cleaned, and concatenated into larger continuous text blocks suitable for language model… See the full description on the dataset page:
https://huggingface.co/datasets/ChamaraVishwajithRajapaksha/cnn-dailymail-sinhala-continuous-pretrain
.