Views
No views yet
dbmdz/bert-base-turkish-cased for token classification.dbmdz/bert-base-turkish-cased (110M parameters)| Label | Description | KVKK Category |
|---|---|---|
| PERSON | Person names | Kimlik (Md. 3) |
| ADDRESS | Physical addresses | Iletisim (Md. 3) |
| HEALTH_DATA | Diagnoses, medications, lab results | Ozel Nitelikli (Md. 6) |
| KVKK_SPECIAL | Religion, ethnicity, political views | Ozel Nitelikli (Md. 6) |
1from kvkk_pii import PIIAnalyzer
2
3analyzer = PIIAnalyzer(ner_model_path="ersanbil/kvkk-pii-ner")
4results = analyzer.analyze("Hasta: Ahmet Yilmaz, Tani: E11.9 - Tip 2 diabetes mellitus")1from transformers import AutoTokenizer, AutoModelForTokenClassification
2import torch
3
4tokenizer = AutoTokenizer.from_pretrained("ersanbil/kvkk-pii-ner")
5model = AutoModelForTokenClassification.from_pretrained("ersanbil/kvkk-pii-ner")
6model.eval()
7
8text = "Hasta Adi: LEVENT DUMAN"
9encoding = tokenizer(text, return_tensors="pt", return_offsets_mapping=True)
10
11with torch.no_grad():
12 outputs = model(**{k: v for k, v in encoding.items() if k != "offset_mapping"})
13 predictions = outputs.logits.argmax(dim=-1)[0]
14
15for token_id, pred in zip(encoding["input_ids"][0], predictions):
16 label = model.config.id2label[pred.item()]
17 if label != "O":
18 print(f"{tokenizer.decode([token_id])}: {label}")| Entity | Precision | Recall | F1 |
|---|---|---|---|
| PERSON | 1.00 | 1.00 | 1.00 |
| ADDRESS | 1.00 | 1.00 | 1.00 |
| HEALTH_DATA | 0.99 | 1.00 | 0.99 |
| Overall | 99.86% |
1@software{kvkk_pii_ner,
2 author = {Bilik, Ersan},
3 title = {kvkk-pii-ner: Turkish PII Detection Model for KVKK Compliance},
4 year = {2026},
5 url = {https://huggingface.co/ersanbil/kvkk-pii-ner}
6}