SEA Javanese Cleaned Parquet v1
Dataset Summary
This dataset is a cleaned Javanese pretraining corpus exported in Hugging Face parquet format.
Current public sources used in this release:
basic text cleaning
short-text filtering
repetition filtering
rule-based noise filtering
document-level exact deduplication across all included… See the full description on the dataset page:
https://huggingface.co/datasets/rinnieyoung/sea-javanese-cleaned-parquet-v1.