Dürüst durum notu. Bu bir bitmiş ürün modeli değildir. Sıfırdan pretrain edilen deneysel bir taban modeldir. Hedef korpus 5 milyar token; bu karttaki ağırlıklar eğitim yolunun erken bir noktasındadır. Kısa metin üretebilir, tekrarlayabilir, dil karıştırabilir. Değerlendirme kıyasları henüz yayınlanmamıştır.
Bu model nedir?
Luck-Spark V-300-MoE, Dr. Zeon tarafından sıfırdan eğitilen küçük bir Mixture-of-Experts dil modelidir. Mimari, Hugging Face MixtralForCausalLM iskeletini kullanır; ölçek ise bilinçli olarak tek bir Kaggle T4×2 oturumunda taşınabilir olacak şekilde seçilmiştir.
Amaç büyük bir genel model kopyalamak değil. Amaç şudur:
~300M parametrede seyrek uzman yönlendirmesinin gerçekten öğrenilip öğrenilmediğini görmek
Türkçe + İngilizce + matematik + kod karışımını aynı küçük modelde dengelemek
Ücretsiz Kaggle GPU kotasıyla oturumlar arası gerçek resume yapılabilen bir eğitim hattı kurmak
Her token’da 4 uzmandan 2’si açılır. Küçük ölçekte 4 uzman, büyük Mixtral’daki 8 uzmanlık çeşitliliği vermez. Bu bilinçli bir donanım takasıdır: T4 belleğinde eğitim açılsın, yönlendirme yine gerçek bir MoE problemi olarak kalsın.
Eğitim verisi
Akışkan (streaming) karışım. Oranlar hedef token payıdır; doküman örnekleme olasılıkları ortalama doküman uzunluğuna göre düzeltilmiştir.
Kaynak
Hedef token payı
Rol
HuggingFaceFW/fineweb-edu (sample-10BT)
%55
İngilizce eğitim metni
ytu-ce-cosmos/Cosmos-Turkish-Corpus-v1.0
%20
Türkçe
open-web-math/open-web-math
%15
matematik
codeparrot/codeparrot-clean
%5
kod
HuggingFaceTB/cosmopedia (openstax)
%5
ders kitabı / açıklayıcı metin
Dokümanlar tokenize edilir, EOS eklenir, sonra 1024 token’lık bloklara paketlenir. Padding yok; her adımda sabit uzunluk.
Sınır. Tokenizer önce Türkçe ağırlıklı 100M taban için üretilmiştir. Karışımın büyük kısmı İngilizce olduğu için bu sözlük ideal değildir. Kod ve matematik token ekonomisi ileride ayrı bir sözlükle yeniden ele alınacaktır.
Eğitim düzeni
Donanım
Kaggle Tesla T4 × 2
Paralelizm
torchrun, 2 süreç
Hassasiyet
T4’te FP16 (BF16 yoksa)
Batch / GPU
2
Gradient accumulation
16
Effective batch
65.536 token / adım
Optimizasyon
AdamW (β1=0.9, β2=0.95)
Öğrenme hızı
1e-4, cosine, 1000 adım warmup
Weight decay
0.01
Grad clip
1.0
Gradient checkpointing
açık
Hedef
5.000.000.000 token ≈ 76.303 adım
Kayıt
her 500 adım
Üretim sondası
her 2000 adım
Kaggle oturumu yaklaşık 12 saatle sınırlıdır. Süre dolmadan güvenli checkpoint alınır; bir sonraki oturum aynı adımdan devam eder.
Checkpoint biçimi
Transformers’ın varsayılan Mixtral kayıt yoluna güvenilmez. Her kayıtta runtime state_dict doğrudan model.safetensors olarak yazılır ve luck_spark_checkpoint.json damgası konur. Yükleme strict=True ile yapılır. Damgasız eski klasörler yok sayılır.
Hub’da biriken checkpoint şişmesini önlemek için yalnızca son birkaç kayıt tutulur.
Resume’un sınırı. Ağırlık, optimizer ve scheduler oturumlar arasında taşınır. Streaming veri konumu birebir aynı yerden devam etmeyebilir. Yani ağırlık devamı gerçektir; veri konumunun birebir devamı garanti değildir.
Nasıl kullanılır?
Erken kontrol noktasıdır. Üretim sohbet botu değildir.
python
1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
34repo ="ahmetggg/Luck-spark-V-300-MoE"56tokenizer = AutoTokenizer.from_pretrained(repo)7model = AutoModelForCausalLM.from_pretrained(8 repo,9 torch_dtype=torch.float16,10 device_map="auto",11)1213prompt ="Yapay zekânın günlük hayatı değiştirebileceği bir alanı anlat:"14inputs = tokenizer(prompt, return_tensors="pt").to(model.device)1516# Bu Transformers sürümünde MoE + KV-cache üretimi sorun çıkarabiliyor.17output = model.generate(18**inputs,19 max_new_tokens=64,20 do_sample=True,21 temperature=0.8,22 top_p=0.95,23 use_cache=False,24 pad_token_id=tokenizer.pad_token_id,25 eos_token_id=tokenizer.eos_token_id,26)2728print(tokenizer.decode(output[0], skip_special_tokens=True))
Bağlam penceresi 1024 tokendir. Bundan uzun girdi kesilir veya anlamsızlaşır.
Ne beklemeli, ne beklememeli?
Bekle.
Kısa Türkçe / İngilizce devam cümleleri
Basit kalıp tamamlama
Eğitim ilerledikçe daha az çöp token
Bekleme.
Talimat takibi (instruct / chat finetune yok)
Güvenilir çok adımlı matematik
Temiz, çalışır kod
Güncel bilgi
1024 token üstü tutarlı bellek
Ölçek kuralı kabaca şudur: ~300M parametreli bir model Chinchilla civarında birkaç milyar token görünce “küçük ama okunur taban” olmaya başlar. Birkaç yüz milyon token’da bebek dil modelidir. Bu kartı o mercekten okuyun.
Değerlendirme
Bu sürümde resmi kıyas tablosu yoktur. Eğitim sırasında yalnızca üretim sondası (TR / EN / matematik / kod promptları) çalışır. Sayısal tablo — held-out perplexity, basit matematik, kısa kod — 5B hedefinin ilerleyen dilimlerinde eklenecektir.
MoE sağlığı (uzman kullanım oranı, ölü uzman, router entropy) dahili loglardadır; henüz model kartına işlenmemiştir.
Sınırlamalar ve riskler
Halüsinasyon üretir. Doğruluk iddiası yoktur.
Eğitim verisi açık web kaynaklıdır; önyargı, hatalı bilgi ve istenmeyen kalıplar geçebilir.
Küçük model olduğu için güvenlik hizalaması yoktur.
Araştırma, eğitim ve hata ayıklama içindir. Tıbbi, hukuki, mali veya güvenlik-kritik işlerde kullanılmaz.
Veri karışımına uygun sözlüğü yeniden değerlendirmek
Ancak taban oturduktan sonra ayrı bir instruct sürümü
Atıf
bibtex
1@misc{luckspark-v300-moe,
2 title = {Luck-Spark V-300-MoE},
3 author = {Dr. Zeon},
4 year = {2026},
5 howpublished = {\url{https://huggingface.co/ahmetggg/Luck-spark-V-300-MoE}},
6 note = {From-scratch Mixtral-style MoE language model. Research preview.}
7}
Lisans
MIT. Üstteki veri kümelerinin kendi lisanslarına da uyun.
Teşekkür
Eğitim, Kaggle ücretsiz T4×2 kotası ve Hugging Face Hub üzerinde yürütülmektedir. FineWeb-Edu, Cosmos Turkish Corpus, OpenWebMath, CodeParrot ve Cosmopedia sağlayıcılarına teşekkürler.
Dr. Zeon · Luck-Spark
Küçük model. Uzun yol. Dürüst kart.