Author: Vicky FatrianLicense: C-UDA (Computational Use of Data Agreement)Version: 1.1Date: March 6, 2026
VQFat Indonesian Corpus adalah koleksi dataset komprehensif berbahasa Indonesia yang dirancang khusus untuk membangun dan melatih Small Language Models (SLM) dari nol (from scratch). Dataset ini menyediakan dua pilar utama dalam pelatihan model bahasa: Pre-training Corpus (untuk pengetahuan umum)… See the full description on the dataset page:
https://huggingface.co/datasets/vickyfatrian/vqfat-indo-corpus.