Views
No views yet
| Parameters | ~49.8M |
| Architecture | Decoder-only Transformer (nanoGPT-style) |
| Layers / heads / embd | 8 / 10 / 640 |
| Context length | 256 tokens |
| Vocabulary | 16,000 (SentencePiece unigram, Devanagari) |
| Training tokens | ~86M (train 81M / val 4.8M) |
| Final val loss | 4.16 |
| Trained on | Kaggle T4 GPU, float16, 40,000 iterations |
final_ckpt.pt — model weights + config (PyTorch)model.py — model definition (needed to load)generate.py — inference scriptshlok.model, shlok.vocab — SentencePiece tokenizer1python generate.py \
2 --checkpoint final_ckpt.pt \
3 --tokenizer shlok.model \
4 --prompt "धर्मक्षेत्रे कुरुक्षेत्रे समवेता युयुत्सवः" \
5 --max_new_tokens 150 \
6 --temperature 0.9 --top_k 50