Türkçe metinlerde küfür, hakaret ve zararlı dil tespiti için fine-tune edilmiş
dbmdz/electra-small-turkish-cased-discriminator tabanlı bir text classification modelidir.
Bu model özellikle gerçek zamanlı moderasyon senaryoları için geliştirilmiştir.
Amaç; Türkçe topluluklarda (Discord, forum, sosyal medya vb.) zararlı içerikleri
düşük gecikme ile tespit edebilen küçük ve verimli bir model oluşturmaktır.
Model Overview
Base Model:
dbmdz/electra-small-turkish-cased-discriminator
Task:
Binary Text Classification
Labels:
Label
Description
0
Clean / Non-offensive
1
Insult / Offensive
Motivation
Türkçe için hazır moderasyon modelleri genellikle büyük dil modellerine veya
İngilizce kaynaklı modellere dayanıyor.
Bu proje küçük boyutlu, hızlı ve deploy edilebilir bir alternatif oluşturmayı amaçlamaktadır.
Model özellikle:
düşük kaynak tüketimi
hızlı inference
CPU üzerinde çalışabilme
gerçek zamanlı uygulamalara uygunluk
hedefleriyle eğitildi.
Training Data
Model aşağıdaki iki veri setinin birleştirilmesiyle oluşturulan birleşik dataset üzerinde eğitildi: