🇺🇿 NeuronAI-Uzbek
The Most Advanced Open-Source Language Model for Uzbek
🏆 4th Place Globally | 🥇 1st Place in Uzbekistan on UzLiB Benchmark
Outperforming GPT-4o, Claude 3.5 Sonnet, and Gemini 2.5 Flash on Uzbek language tasks
NeuronAI-Uzbek achieves exceptional performance on the
UzLiB Benchmark, the comprehensive evaluation suite for Uzbek language understanding.
We optimized the tokenizer specifically for Uzbek, achieving significantly better tokenization efficiency (lower fertility rate = fewer tokens per word = faster inference and lower costs).
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_name = "NeuronUz/NeuronAI-Uzbek"
4
5tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
6model = AutoModelForCausalLM.from_pretrained(
7 model_name,
8 torch_dtype="auto",
9 device_map="auto",
10 trust_remote_code=True
11)
12
13prompt = "O'zbekiston haqida qisqacha ma'lumot bering."
14
15messages = [
16 {"role": "user", "content": prompt}
17]
18
19text = tokenizer.apply_chat_template(
20 messages,
21 tokenize=False,
22 add_generation_prompt=True
23)
24
25inputs = tokenizer(text, return_tensors="pt").to(model.device)
26outputs = model.generate(
27 **inputs,
28 max_new_tokens=512,
29 temperature=0.7,
30 top_p=0.9,
31 do_sample=True
32)
33
34response = tokenizer.decode(outputs[0][inputs['input_ids'].shape[1]:], skip_special_tokens=True)
35print(response)
1messages = [
2 {"role": "user", "content": "5 ta 3 ga bo'linuvchi 100 dan kichik natural sonlarni toping."}
3]
4
5text = tokenizer.apply_chat_template(
6 messages,
7 tokenize=False,
8 add_generation_prompt=True,
9 enable_thinking=True # Enable step-by-step reasoning
10)
This model is released under the
Apache 2.0 License.
1@misc{neuronai-uzbek-2025,
2 title={NeuronAI-Uzbek: An Optimized Language Model for Uzbek},
3 author={NeuronAI Team},
4 year={2025},
5 publisher={Hugging Face},
6 url={https://huggingface.co/NeuronUz/NeuronAI-Uzbek}
7}