Views
No views yet
T5TokenizerFast (BPE tabanlı) modeli bulunmaktadır. Model, Türkiye'deki mahkeme kararlarından oluşan geniş bir külliyattan eğitilmiştir. Özellikle hukuk alanındaki doğal dil işleme görevleri için tasarlanmıştır.[PAD], [UNK], [BOS], [EOS]transformers kütüphanesi ile kolayca yükleyip kullanabilirsiniz. Tokenizer, fast versiyonuyla birlikte gelir.1from transformers import AutoTokenizer
2
3# Modeli Hugging Face Hub'dan yükle
4tokenizer = AutoTokenizer.from_pretrained("ocaklisemih/turkish-law-tokenizer", use_fast=True)
5
6# Örnek bir cümle
7metin = "Taraflar arasında görülen dava sonucunda verilen hükmün Yargıtay'ca incelenmesi istenilmekle; temyiz isteğinin süresinde olduğu anlaşıldı."
8
9# Metni tokenize et
10tokenler = tokenizer.tokenize(metin)
11print("Tokenler:", tokenler)
12
13# Metni encode et (ID'lere çevir)
14kodlanmis_metin = tokenizer(metin)
15print("Kodlanmış Metin:", kodlanmis_metin)
16
17# ID'leri tekrar metne çevir
18cozulmus_metin = tokenizer.decode(kodlanmis_metin["input_ids"])
19print("Çözülmüş Metin:", cozulmus_metin)model_type: bpevocab_size: 20000character_coverage: 1.0user_defined_symbols: [PAD], [UNK], [BOS], [EOS]