Views
No views yet
| Model | pothana-base-300M |
| Architecture | LLaMA (RoPE + SwiGLU + RMSNorm + GQA) |
| Parameters | 387M (unique) |
| Hidden size | 1024 |
| Layers | 30 unique (60 effective via weight sharing) |
| Attention heads | 16 Q / 4 KV (Grouped Query Attention) |
| Intermediate size | 2816 |
| Context length | 2048 |
| Vocab size | 48,000 |
| Tokenizer | SentencePiece Unigram (48K) |
| Training | Single GPU, bf16 mixed precision |
| Developed by | Dvitva AI |
1from transformers import pipeline
2
3pipe = pipeline("text-generation", model="dvitvaai/pothana-base-300M", trust_remote_code=True)
4result = pipe("తెలుగు భాష", max_new_tokens=50, do_sample=True, temperature=0.8)
5print(result[0]["generated_text"])Note:trust_remote_code=Trueis required for the custom tokenizer that cleans up SentencePiece word boundary markers for readable output.
1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4model = AutoModelForCausalLM.from_pretrained("dvitvaai/pothana-base-300M")
5tokenizer = AutoTokenizer.from_pretrained("dvitvaai/pothana-base-300M", trust_remote_code=True)
6
7text = "తెలుగు భాష చాలా అందమైనది"
8inputs = tokenizer(text, return_tensors="pt")
9
10with torch.no_grad():
11 outputs = model.generate(
12 **inputs,
13 max_new_tokens=100,
14 temperature=0.8,
15 top_k=50,
16 do_sample=True,
17 )
18
19print(tokenizer.decode(outputs[0], skip_special_tokens=True))@misc{pothana-base-300M,
title={Pothana Base 300M: A Telugu Language Model},
author={Dvitva AI},
year={2025},
url={https://huggingface.co/dvitvaai/pothana-base-300M}
}