Views
No views yet
gpt2-tamil-merged is a 345M-parameter GPT-2 Medium–based model adapted for Tamil and code-mixed Tamil–English text generation.
It is produced by merging a standard GPT-2 Medium checkpoint with Tamil-focused training to improve fluency, morphological handling, and contextual coherence in low-resource language settings.1{
2 "model_type": "gpt2",
3 "n_layer": 24,
4 "n_head": 16,
5 "n_embd": 1024,
6 "n_positions": 1024,
7 "activation_function": "gelu_new",
8 "attn_pdrop": 0.1,
9 "embd_pdrop": 0.1,
10 "resid_pdrop": 0.1,
11 "initializer_range": 0.02,
12 "layer_norm_epsilon": 1e-05,
13 "vocab_size": 50257,
14 "bos_token_id": 50256,
15 "eos_token_id": 50256,
16 "torch_dtype": "float16",
17 "use_cache": true,
18 "predict_special_tokens": true
19}1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3model_name = "yeezer/gpt2-tamil-merged"
4tokenizer = AutoTokenizer.from_pretrained(model_name)
5model = AutoModelForCausalLM.from_pretrained(model_name)
6
7prompt = "தமிழில் ஒரு குறுகிய கதை எழுதுங்கள்:"
8inputs = tokenizer(prompt, return_tensors="pt")
9outputs = model.generate(**inputs, max_length=150)
10print(tokenizer.decode(outputs[0], skip_special_tokens=True))@misc{yeezer2025gpt2tamilmerged,
title={GPT-2 Medium Tamil Merged Model},
author={Yeshwanth Kumar},
year={2025},
howpublished={GitHub or HuggingFace repository}
}