A small Kazakh language model (LLaMA architecture, ~50M parameters) trained from scratch on cleaned Kazakh text corpus.
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("Abzalbek89/kk-llama-50m")
4tokenizer = AutoTokenizer.from_pretrained("Abzalbek89/kk-llama-50m")
5
6input_text = "Қазақстан Республикасының"
7inputs = tokenizer(input_text, return_tensors="pt")
8outputs = model.generate(**inputs, max_new_tokens=50, do_sample=True, temperature=0.7)
9print(tokenizer.decode(outputs[0], skip_special_tokens=True))