Bu model, ai21labs/AI21-Jamba2-3B temel modeli üzerine Türkçe odaklı continued pre-training (CPT) ve ardından instruction supervised fine-tuning (SFT) uygulanarak hazırlanmıştır.
Eğitim hattı üç aşamadan oluşur:
Temel model:ai21labs/AI21-Jamba2-3B
Türkçe CPT modeli:serda-dev/Jamba2-3B-Turkish
Bu model: CPT modeli üzerine Türkçe instruction verileriyle QLoRA SFT uygulanmış sürüm
Model Türkçe sohbet, komut takip etme, soru-cevap, açıklama, özetleme ve genel metin üretimi için tasarlanmıştır.
Model Details
Field
Value
Model type
Jamba causal language model
Original base model
ai21labs/AI21-Jamba2-3B
CPT checkpoint
serda-dev/Jamba2-3B-Turkish
Language
Turkish (tr)
Task
Text generation, chat, instruction following
Architecture
JambaForCausalLM
Hidden size
2560
Layers
28
Attention heads
20
Vocabulary size
69,632
Saved dtype
bfloat16
SFT context length
1024 tokens
Training Overview
1. Continued Pre-Training
İlk aşamada ai21labs/AI21-Jamba2-3B, Türkçe dil dağılımına uyum sağlaması için continued pre-training ile eğitildi. CPT aşamasında yaklaşık 200 GB düzeyinde Türkçe ağırlıklı metin verisi kullanıldı.
CPT süreci yalnızca Türkçe metinle sınırlı tutulmadı. Türkçe adaptasyon sırasında modelin genel muhakeme, matematik, yapısal metin ve kod benzeri bağımlılıkları kaybetmemesi için Türkçe veriyle birlikte seçilmiş İngilizce kaynaklar da karıştırıldı.
Repo konfigürasyonundaki dört fazlı CPT müfredatı:
Phase
Purpose
Turkish target
English / auxiliary target
1
Turkish bridge
30 GB
10 GB DCLM + 5 GB English Wikipedia
2
High-quality transfer
30 GB
10 GB FineWeb-Edu (score >= 4.0)
3
Reasoning preservation
30 GB
10 GB OpenWebMath
4
Annealing / code preservation
30 GB
10 GB StarCoder Python
Türkçe ana kaynak:
***Private Repo***
CPT tarafında uzun JSONL/GZ shard'ları stream edilerek okunmuş, tokenlar tekrar kullanılabilir token cache shard'larına paketlenmiş ve eğitim checkpoint/resume destekli şekilde yürütülmüştür.
2. Supervised Fine-Tuning
CPT modeli üzerine Türkçe instruction verileriyle SFT uygulanmıştır. SFT eğitimi QLoRA ile yapılmış, ardından adapter tam modelle birleştirilebilir şekilde kaydedilmiştir.
SFT verisi farklı şemalardan tek bir eğitim formatına normalize edilmiştir:
prompt_answer
system_prompt_answer
messages
Yerel veri hazırlama raporundaki SFT istatistikleri:
Metric
Value
Source files processed
5
Rows seen
2,882,664
Rows written
2,882,519
Rows skipped
145
Accepted SFT rows
2,882,519
prompt_answer rows
2,605,516
messages rows
271,424
system_prompt_answer rows
5,579
JSONL shards
46
Kullanılan kaynak şemalar arasında system/user/assistant, messages + answer, talimat/giriş/çıktı, soru/cevap ve input/output biçimleri bulunur.
Model Turkish MMLU üzerinde yerel olarak kontrol edilmiştir. Bu sonuç kapsamlı bir benchmark iddiası değil, aynı eval scriptiyle alınmış pratik bir doğrulama sonucudur.
Dataset
Split/File
Questions
Accuracy
Answered Accuracy
alibayram/turkish_mmlu
train-00000-of-00001.parquet
2,000
36.5%
36.70%
Not: Çoktan seçmeli benchmarklarda prompt/parse formatı sonuca hassastır. Modeli farklı bir chat template, adapter merge veya generation ayarıyla değerlendirirken aynı evaluation formatının korunması önerilir.
Intended Use
Bu model aşağıdaki kullanımlar için uygundur:
Türkçe sohbet ve asistan uygulamaları
Türkçe instruction-following prototipleri
Türkçe soru-cevap ve açıklama üretimi
Yerel RAG veya agent sistemlerinde Türkçe yanıt üretimi
Türkçe veriyle daha ileri fine-tuning çalışmaları
Out-of-Scope Use
Model tıbbi, hukuki, finansal veya güvenlik açısından kritik kararlar için tek başına otorite olarak kullanılmamalıdır. Zararlı içerik üretimi, kişisel veri çıkarma, kimlik avı, kötüye kullanım otomasyonu veya yasa dışı amaçlar kapsam dışıdır.
Usage
Full merged model
Bu repo tam model ağırlıklarını içeriyorsa doğrudan AutoModelForCausalLM ile yüklenebilir:
python
1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
34model_id ="serda-dev/Jamba2-3B-Turkish-SFT"# replace with this repo id56tokenizer = AutoTokenizer.from_pretrained(model_id)7model = AutoModelForCausalLM.from_pretrained(8 model_id,9 device_map="auto",10 torch_dtype=torch.bfloat16,11 attn_implementation="sdpa",12 trust_remote_code=True,13)14model.eval()1516messages =[17{"role":"system","content":"Sen Türkçe yanıt veren yardımcı bir asistansın."},18{"role":"user","content":"Bu model ne için kullanılır?"},19]2021input_ids = tokenizer.apply_chat_template(22 messages,23 add_generation_prompt=True,24 return_tensors="pt",25).to(model.device)2627with torch.no_grad():28 output_ids = model.generate(29 input_ids,30 max_new_tokens=256,31 do_sample=True,32 temperature=0.7,33 top_p=0.9,34 repetition_penalty=1.05,35)3637print(tokenizer.decode(output_ids[0][input_ids.shape[-1]:], skip_special_tokens=True))
PEFT adapter version
Bu repo yalnızca LoRA/QLoRA adapter ağırlıklarını içeriyorsa base model ile birlikte yükleyin: