Bu model, Qwen3-14B mimarisi temel alınarak, Bursa Uludağ Üniversitesi (BU-BİP) bilgi asistanı olarak görev yapması için ince ayar (fine-tune) işleminden geçirilmiştir. Eğitim süreci Bfloat16 (bf16) kullanılarak Unsloth kütüphanesi üzerinden tamamlanmış, ardından vLLM üzerinde yüksek hızda ve düşük VRAM tüketimiyle (örn. RTX 5090 gibi kartlarda) çalışabilmesi için 4-bit AWQ formatına dönüştürülerek sıkıştırılmıştır.
Model, kendisine yöneltilen sorulara (örneğin; öğrenci ders kayıtları, değişim programları veya idari bilgiler gibi) doğrudan bir çıktı vermek yerine önce bir mantık yürütme süreci işletir. Bu düşünce adımları <think> ... </think> etiketleri arasında üretilir ve sonrasında resmî belgelere dayalı, doğru ve bağlama sadık nihai cevap sunulur.
Model, doğrudan vLLM gibi çıkarım sunucularında çalıştırılmak üzere 4-bit AWQ formatında optimize edilmiştir. Modelin düşünce adımlarını (reasoning) arka planda gizlemesini engelleyip tam formatında çıktı alabilmek için aşağıdaki komutla başlatabilirsiniz:
1VLLM_USE_V2_MODEL_RUNNER=0 vllm serve nypgd/bubip-qwen3-14b-awq \
2 --dtype float16 \
3 --max-model-len 8192 \
4 --gpu-memory-utilization 0.90 \
5 --port 8000 \
6 --enforce-eager