INTISARI-CHAT-V6 adalah eksperimen conversational language model Bahasa Indonesia berukuran ~65M parameter. Model ini dirancang untuk menguji apakah peningkatan vocabulary size (8,196 tokens vs 4,096 di V5) dan arsitektur yang dioptimalkan dapat mengurangi repetition dan meningkatkan kualitas generation pada model kecil.
Secara spesifik, eksperimen ini mencari jawaban atas pertanyaan:
Bisakah model ~65M dengan vocabulary conversational yang lebih kaya menghasilkan respons yang lebih natural tanpa repetition dan degeneration?
Berbeda dari V5 yang masih mengalami repetition 2-gram sebesar 9.75%, V6 dirancang untuk menghilangkan masalah tersebut melalui vocabulary yang lebih tepat sasaran dan arsitektur streamlined (20 layers vs 22, GQA dengan 2 KV heads).
Model menggunakan arsitektur Transformer decoder dengan Grouped Query Attention (8 query heads, 2 KV heads) dan SwiGLU activation.
Peningkatan vocab size dari 4,096 (v5) ke 8,196 (v6) memungkinkan representasi yang lebih kaya untuk conversational text Bahasa Indonesia.
Training
Model dilatih dari scratch menggunakan Flatbuild pada 64,277 training samples selama 3 epoch (~11,448 steps).
Training Curves
Setelah 3 epoch, model mencapai validation perplexity 2.37 dengan token-level accuracy 81.4%.
Metric
Final (Epoch 3)
Val Loss
0.865
Val PPL
2.37
Val Accuracy
81.4%
Perbandingan token-level metrics dengan V5:
V5
V6
Vocab Size
4,106
8,196
Val Loss
0.462
0.865
Val PPL
1.59
2.37
Val Accuracy
91.9%
81.4%
Validation accuracy V6 "lebih rendah" karena vocabulary yang lebih besar membuat task prediction token secara alami lebih sulit (lebih banyak candidate tokens). Metric token-level tidak sepenuhnya mencerminkan kualitas generation — evaluasi generation menunjukkan bahwa V6 secara signifikan lebih baik dalam repetition dan diversity.
Evaluasi Generation
Model dievaluasi menggunakan 50 prompt dari berbagai kategori percakapan Bahasa Indonesia, mencakup single-turn dan multi-turn.
V6 menunjukkan peningkatan signifikan dalam repetition dan diversity. EOS rate 100% berarti semua generation berhenti dengan <|endoftext|> secara natural. Distinct-2 dan Distinct-3 keduanya di atas 99%, menunjukkan vocabulary diversity yang sangat baik.
Namun topic drift rate meningkat dari 25% ke 42%, yang menunjukkan topik masih berpindah pada banyak prompt.
Multi-turn vs Single-turn
Single-turn
Multi-turn
Topic Overlap
0.319
0.429
Multi-turn conversation memiliki topic overlap yang lebih tinggi, menunjukkan model lebih baik dalam mempertahankan topik pada percakapan berkelanjutan.
Generation Quality
Repetition Analysis
Observasi
Yang Sudah Berhasil
repetition sudah sangat terkendali (1.54% 2-gram, 0.17% 3-gram)
EOS rate 100% — semua generation berhenti secara natural tanpa reaching max token
vocabulary diversity sangat tinggi (99.23% distinct-2, 99.92% distinct-3)
degeneration rate 0% pada 50 prompt
multi-turn conversation sudah menunjukkan topic adherence yang lebih baik
pola conversational casual sudah terbentuk dengan vocabulary yang lebih kaya
model mampu membedakan gaya informal (gue, lo) dan semi-formal (aku, kamu)
beberapa respons menunjukkan engagement yang natural dengan pertanyaan balik
model mampu merespons konteks spesifik dengan lebih baik (misal: interview, skripsi, LDR)
Yang Masih Menjadi Masalah
topic drift masih terjadi pada 42% prompt
beberapa respons masih generic/boilerplate (oke.. lebih detail dong.)
model cenderung mengembalikan pola yang mirip dengan training data tanpa always answering the actual intent
beberapa multi-turn masih kehilangan konteks dari turn sebelumnya
semantic consistency belum stabil — kadang respons tidak menjawab pertanyaan dengan tepat
model masih menghasilkan kalimat yang slightly malformed pada beberapa kasus
persona/style belum sepenuhnya konsisten antara percakapan
Contoh Evaluasi
Single-turn: Greeting
Prompt
text
1<|user|>
2Gue mau kuliah.
3<|assistant|>
Output
Oh, lo mau ujian?
Respons sederhana yang sesuai dengan konteks.
Single-turn: Contextual Response
Prompt
text
1<|user|>
2gue besok ada interview nih.
3<|assistant|>
Output
oh seru! posisi apa?
Model mengenali konteks interview dan mengembalikan pertanyaan yang relevan.
Single-turn: Emotional Engagement
Prompt
text
1<|user|>
2gue baru dapat diagnosa kecemasan.
3<|assistant|>
Output
wah, gue dukung lo ya. mau cerita lebih lanjut?
Respons menunjukkan empati dan ajakan untuk melanjutkan percakapan.
Single-turn: Knowledge Topic
Prompt
text
1<|user|>
2gue mau mulai freelance desain.
3<|assistant|>
Output
desain yang mana? graphic, UI, atau 3D?
Model mampu mem-follow up dengan pertanyaan clarifying yang spesifik.
Multi-turn: Maintaining Context
Prompt
text
1<|user|>
2gue semester ini IPK gue turun.
3<|assistant|>
4turun banyak nggak?
5<|user|>
6dari 3.8 ke 3.4 sih.
7<|assistant|>
8turun 0.4 itu signifikan. lo lagi banyak beban?
9<|user|>
10gue juga kerja part-time.
11<|assistant|>
Output
oh, kalau gitu manage waktu itu penting. lo udah coba atur schedule?
Model mempertahankan konteks akademis dan memberikan advice yang relevan.
Multi-turn: Role Switch
Prompt
text
1<|user|>
2gue dapet promosi nih.
3<|assistant|>
4seru! posisi apa sekarang?
5<|user|>
6eh btw, hari ini panas banget ya.
7<|assistant|>
Output
panas sih emang.
Model berhasil melakukan topic switch ketika user mengubah topik secara natural.
Contoh Failure Cases
Topic Drift
Prompt
text
1<|user|>
2gue harus pilih yang mana?
3<|assistant|>
Output
lo maksud yang mana?. konteksnya apa dulu?
Model mengembalikan respons generic karena tidak ada cukup konteks untuk memberikan jawaban spesifik.
Semantic Inconsistency
Prompt
text
1<|user|>
2gue kurang setuju soal diet keto efektif.
3<|assistant|>
Output
gue kurang setuju sih..
Model meng-echo opini tanpa memberikan perspective atau elaboration.
Generic Response
Prompt
text
1<|user|>
2gue suka design nih.
3<|assistant|>
Output
oke.. lebih detail dong.
Respons generic yang tidak engaging dan tidak spesifik terhadap topik design.
Base Model dan Conversational Training
INTISARI-CHAT-V6 tetap merupakan model language modeling berukuran kecil yang belajar melalui objective causal language modeling / next-token prediction.
Berbeda dengan base model murni, dataset training V6 difokuskan pada pola percakapan sehingga model belajar distribusi bahasa yang lebih dekat dengan conversational text.
Tujuan eksperimen ini bukan untuk membangun chatbot yang memiliki pengetahuan luas, tetapi untuk menguji seberapa jauh model kecil dapat mempelajari:
pola dialog
turn-taking
respons pendek
informal Indonesian
vocabulary conversational
question-answer patterns
agreement/disagreement
emotional responses
social interaction
conversational closing
multi-turn coherence
contextual follow-up
Keterbatasan
hanya sekitar 65M parameter
vocabulary 8,196 tokens
context length hanya 512 tokens
training dataset berfokus pada percakapan dasar
factual knowledge sangat terbatas
topic drift masih terjadi pada 42% prompt
semantic consistency belum stabil
beberapa respons masih generic
malformed text masih dapat muncul pada edge cases
belum dioptimalkan untuk reasoning
belum ditujukan untuk knowledge-intensive tasks
belum dapat dianggap sebagai chatbot production-ready
Apa yang Ditunjukkan Eksperimen Ini
Eksperimen INTISARI-CHAT-V6 berfokus pada eksplorasi kualitas conversational dengan vocabulary yang lebih kaya (8,196 vs 4,096) dan arsitektur streamlined (~65M, 20 layers vs ~66M, 22 layers).
Hasil utama:
Repetition sangat terkendali: 1.54% 2-gram (vs 9.75% di V5)
EOS rate 100%: semua generation berhenti natural
Vocabulary diversity sangat tinggi: 99.23% distinct-2
Degeneration rate 0%: tidak ada looping
Topic overlap meningkat: 37.40% (vs 22.42% di V5)
Tapi topic drift naik: 42% (vs 25% di V5)
Validation accuracy turun: 81.4% (vs 91.9% di V5) — karena vocabulary lebih besar
Hal yang penting dari eksperimen ini:
Vocabulary size berpengaruh besar pada repetition dan diversity
Akurasi token bukan satu-satunya indicator kualitas conversational
Topic adherence belum berkorelasi langsung dengan metric lain
Model yang lebih besar belum tentu menghasilkan percakapan yang lebih baik — trade-off antara memorization dan generalization
Multi-turn coherence sudah mulai terbentuk tapi masih butuh improvement