Views
No views yet
| Keunggulan | Keterangan |
|---|---|
| Ringan | Ukuran 200M memungkinkan model berjalan di perangkat dengan spesifikasi terbatas |
| Bahasa Indonesia | Dikembangkan khusus untuk bahasa Indonesia, bukan terjemahan dari bahasa lain |
| Respons Cepat | Proses inferensi yang efisien untuk interaksi real-time |
| Dari Awal | Dibangun dari nol, bukan fine-tune dari model asing |
| Open Source | Lisensi MIT, bebas digunakan dan dimodifikasi |
| Komponen | Spesifikasi | Keterangan |
|---|---|---|
| Arsitektur | GPT-2 (Decoder-only Transformer) | Berbasis arsitektur OpenAI GPT-2 |
| Total Parameter | 0.2B (200M) | Terdeteksi otomatis oleh Hugging Face |
| Tensor Type | F32 (float32) | Presisi floating point 32-bit |
| Lapisan (Layers) | 16 | Jumlah hidden layers |
| Attention Heads | 12 | Multi-head attention heads |
| Hidden Size | 768 | Dimensi hidden state |
| Context Length | 512 token | Maksimal input per sesi |
| Vocab Size | 50.257 | Jumlah kosakata tokenizer |
| Embedding Size | 768 | Sama dengan hidden size |
| Positional Encoding | Learned | Dipelajari selama training |
| Activation Function | GELU | Gaussian Error Linear Unit |
| Parameter | Nilai | Keterangan |
|---|---|---|
| Batch Size (per device) | 4 | Ukuran batch per GPU |
| Gradient Accumulation | 4 | Efektif batch = 16 |
| Learning Rate | 2e-4 | Learning rate awal |
| Warmup Steps | 10% dari total step | Agar training stabil |
| Weight Decay | 0.01 | Regularisasi untuk menghindari overfit |
| Epochs | 3 | Jumlah putaran training |
| Optimizer | AdamW | Optimizer standar |
| Mixed Precision | FP16 | Hemat VRAM |
| Max Gradient Norm | 1.0 | Clipping untuk stabilitas |
| Metrik | Nilai | Keterangan |
|---|---|---|
| Total Sample | 42.711 | Jumlah sampel pelatihan (setelah filter) |
| Epochs | 3 | 3 kali putaran data |
| Total Steps | ~8.007 | Jumlah langkah training |
| Final Loss | 1.62 | Nilai loss akhir (semakin kecil semakin bagus) |
| Training Duration | ~6 jam | Waktu pelatihan (T4 GPU) |
| Aspek | Spesifikasi | Keterangan |
|---|---|---|
| Inference (CPU) | ~2-3 detik/respon | VPS 2 CPU |
| Inference (GPU T4) | ~0.5 detik/respon | Respons cepat |
| VRAM (Training) | ~10-12 GB | Saat training |
| RAM (Inference) | ~2-4 GB | Untuk inferensi |
| Storage | ~1.2 GB | Ukuran model terkompresi |
| Platform | Status | Keterangan |
|---|---|---|
| Hugging Face Transformers | ✅ Full Support | Format standar |
| PyTorch | ✅ Support | Load model |
| CPU | ✅ Support | Bisa jalan di CPU |
| GPU | ✅ Support | CUDA compatible |
| ONNX | ⚠️ Belum di-test | Belum dicoba |