INTISARI-CHAT-V3 adalah LLM - LARGE LANGUAGE MODEL BAHASA INDONESIA berukuran kecil yang dilatih dari awal menggunakan causal language modeling. Model ini dirancang untuk percakapan sederhana dan menjawab pertanyaan umum dalam Bahasa Indonesia.
Model ini menggunakan arsitektur Transformer decoder dengan GQA (Grouped Query Attention). Ukuran yang kecil dipilih untuk eksperimen pada tiny language model yang mampu chatting.
Training
Model dilatih dari awal menggunakan Flatbuild. Training terdiri dari 3 epoch dengan 4821 samples percakapan Bahasa Indonesia. Validation metrics terus membaik hingga epoch terakhir.
Training Curves
Epoch
Loss
Perplexity
Accuracy
0
0.172
1.188
96.5%
1
0.062
1.064
97.9%
2
0.047
1.049
98.3%
Evaluasi Generation
Model diuji dengan 15 prompt menggunakan sampling (temperature=0.7, max_new_tokens=128).
Generation Quality
Chart ini menampilkan topic adherence, distribusi panjang generation, dan vocabulary diversity.
Repetition Analysis
Chart ini menampilkan repetition rate per n-gram dan degeneration rate.
Observasi
Yang Sudah Berhasil
percakapan Bahasa Indonesia yang coheren
kemampuan menjawab pertanyaan umum
vocabulary diversity tinggi (98.1% distinct-2)
local coherence sudah baik
pattern bahasa Indonesia mulai konsisten
Yang Masih Menjadi Masalah
halusinasi (model bisa menghasilkan jawaban yang tidak akurat)
avg generation masih pendek (~10.7 tokens)
factual errors mungkin terjadi
long-range coherence masih terbatas
Keterbatasan
hanya ~46.5M parameter
dataset relatif kecil (4821 samples)
coverage pengetahuan sangat terbatas
rawan halusinasi
generation masih pendek
belum memiliki pengetahuan dunia yang luas
Apa yang Ditunjukkan Eksperimen Ini
Eksperimen ini menjawab pertanyaan: "Seberapa jauh model yang kecil dapat belajar melakukan percakapan dalam Bahasa Indonesia dari dataset yang terbatas?"
Hasil menunjukkan:
accuracy mencapai 98.3%
degeneration rate 13.3%
distinct-2 mencapai 98.1%
model sudah menghasilkan respons yang coheren
tetapi halusinasi masih menjadi masalah
Eksperimen berikutnya sebaiknya lebih dahulu meningkatkan:
Model diuji dengan beberapa prompt menggunakan temperature=0.7, max_new_tokens=50.
Photosynthesis
Prompt
<|user|>
Apa itu fotosintesis?
<|assistant|>
Output
Fotosintesis adalah proses tumbuhan mengubah cahaya matahari menjadi makanan menggunakan klorofil.
Sky Color
Prompt
<|user|>
Kenapa langit berwarna biru?
<|assistant|>
Output
Langit berwarna biru karena cahaya matahari tersebar oleh atmosfer.
Planets
Prompt
<|user|>
Sebutkan planet-planet di tata surya
<|assistant|>
Output
t baru|>uk' resigeai,t.
Catatan: Output terakhir menunjukkan keterbatasan model - kadang menghasilkan output yang tidak koheren. Ini adalah eksperimen dengan model sangat kecil (~46M params).