Beta
Explore
Marketplace
Neural Labs
Chat
Wallet
Docs
tamil-corpus – Dataset by mozhi-ai | AlphaNeural AI
You can deploy this model and start earning money today!
mozhi-ai
/
tamil-corpus
like
0
text-generation
fill-mask
ta
cc-by-sa-4.0
100K<n<1M
parquet
tabular
text
datasets
dask
polars
mlcroissant
us
tamil
corpus
nlp
llm-training
indic
dravidian
Views
No views yet
Model card
Files and Versions
Community
API
mozhi-ai Tamil Corpus
A continuously-updated, high-quality Tamil language corpus for LLM training. Collects text from classical literature, Wikipedia, news, and web sources.
Corpus Stats (updated 2026-05-30)
Metric Value
Total Documents 8,682
Total Characters 4,961,439
Total Words 554,078
Deduplicated 0 removed
Quality Filtered 0 removed
Last Updated 2026-05-30
Sources Breakdown
Source Documents… See the full description on the dataset page:
https://huggingface.co/datasets/mozhi-ai/tamil-corpus
.