This is a small GPT-2 model trained from scratch on Kannada text. It uses a custom BPE tokenizer also trained from scratch on the same data. The model can generate coherent Kannada text and produces useful representations for downstream tasks.
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("AbhiDS16/kannada-gpt2-32m")
4tokenizer = AutoTokenizer.from_pretrained("AbhiDS16/kannada-gpt2-32m")
5
6prompt = "ನಾನು ಇಂದು ಬೆಳಿಗ್ಗೆ"
7inputs = tokenizer(prompt, return_tensors="pt")
8outputs = model.generate(
9 **inputs,
10 max_new_tokens=80,
11 temperature=0.7,
12 do_sample=True,
13 top_p=0.9,
14 pad_token_id=tokenizer.pad_token_id,
15)
16print(tokenizer.decode(outputs[0], skip_special_tokens=True))
1@misc{kannada-gpt2-32m,
2 author = {AbhiDS16},
3 title = {Kannada GPT-2 Small: A From-Scratch Language Model for Kannada},
4 year = {2026},
5 publisher = {HuggingFace},
6 howpublished = {\url{https://huggingface.co/AbhiDS16/kannada-gpt2-32m}},
7 note = {Trained entirely from scratch with custom BPE tokenizer}
8}