somgpt-base is a Somali causal language model continued from google/gemma-3-270m and trained on maanka2/somali-web-corpus.
This model was further pre-trained on Somali web text to improve its understanding of Somali vocabulary, grammar, spelling, and writing patterns.
somgpt is a base language model designed for text continuation and language modeling. It is not instruction-tuned and is not optimized for chat, question answering, or assistant-style interactions.
For conversational AI or task-specific applications, additional supervised fine-tuning (SFT) or instruction tuning is recommended.
Training was performed using maanka2/somali-web-corpus, a collection of cleaned Somali-language web content gathered from various online sources.
1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3model_id = "maanka2/somgpt"
4
5tokenizer = AutoTokenizer.from_pretrained(model_id)
6model = AutoModelForCausalLM.from_pretrained(model_id)
7
8prompt = "Soomaaliya waa dal ku yaal"
9inputs = tokenizer(prompt, return_tensors="pt")
10
11outputs = model.generate(
12 **inputs,
13 max_new_tokens=256,
14 do_sample=True,
15 temperature=0.1,
16 top_p=0.95
17)
18
19print(tokenizer.decode(outputs[0], skip_special_tokens=True))