Views
No views yet
Not: Bu tokenizer orijinal olarak kaanilker tarafından geliştirilmiş olup, VeriPazarı tarafından Türk AI ekosistemi için arşivlenmiştir.🔗 Orijinal Kaynak: kaanilker/mini-turkish-tokenizer 🔗 Derleyen Platform: VeriPazarı
pip install transformers1from transformers import AutoTokenizer
2
3# Tokenizer'ı yükle
4tokenizer = AutoTokenizer.from_pretrained("kaanilker/mini-turkish-tokenizer")
5
6# Metni tokenize et
7text = "Merhaba, ben yapay zekayım!"
8tokens = tokenizer.encode(text)
9print(tokens)
10# Output: [59, 83, 96, 86, 79, 80, ...]1# Token'ları metne geri çevir
2decoded = tokenizer.decode(tokens)
3print(decoded)
4# Output: "Merhaba, ben yapay zekayım!"1texts = [
2 "Merhaba dünya",
3 "Türkçe NLP",
4 "Yapay zeka harika"
5]
6
7# Batch tokenize
8encoded = tokenizer(
9 texts,
10 padding=True,
11 truncation=True,
12 max_length=100,
13 return_tensors="pt"
14)
15print(encoded['input_ids'].shape)
16# Output: torch.Size([3, 100])| Token | ID | Açıklama |
|---|---|---|
<pad> | 0 | Padding (doldurma) |
<unk> | 1 | Unknown (bilinmeyen) |
<bos> | 2 | Beginning of Sequence (başlangıç) |
<eos> | 3 | End of Sequence (bitiş) |
1vocab_size = 5610
2min_frequency = 2
3algorithm = "BPE"
4pre_tokenizer = "Whitespace + Punctuation"
5training_data = "CulturaX Turkish (735,991 documents)"
6train_test_split = "90/10"1from transformers import AutoTokenizer
2import torch
3
4tokenizer = AutoTokenizer.from_pretrained("kaanilker/mini-turkish-tokenizer")
5text = "Kısa"
6
7encoded = tokenizer(
8 text,
9 padding="max_length",
10 max_length=10,
11 return_tensors="pt"
12)
13
14print(encoded['input_ids'])
15# [1234, 0, 0, 0, 0, 0, 0, 0, 0, 0]
16
17print(encoded['attention_mask'])
18# [1, 0, 0, 0, 0, 0, 0, 0, 0, 0]1from transformers import AutoTokenizer, AutoModelForSequenceClassification
2
3tokenizer = AutoTokenizer.from_pretrained("kaanilker/mini-turkish-tokenizer")
4model = AutoModelForSequenceClassification.from_pretrained("dbmdz/bert-base-turkish-cased")
5
6# Türkçe metinleri tokenize et
7inputs = tokenizer(
8 ["Bu çok güzel!", "Berbat!"],
9 truncation=True,
10 max_length=512,
11 return_tensors="pt"
12)
13
14outputs = model(**inputs)1from transformers import pipeline
2
3classifier = pipeline(
4 "text-classification",
5 model="dbmdz/bert-base-turkish-cased",
6 tokenizer=tokenizer
7)
8result = classifier("Bu ürün harika!")
9print(result)1from transformers import pipeline
2
3generator = pipeline(
4 "text-generation",
5 model="your-turkish-llm",
6 tokenizer=tokenizer
7)
8generated = generator("Türkiye'nin başkenti", max_length=50)
9print(generated)1Toplam Tokens: 5.610
2Kategori Dağılımı:
3├── Türkçe Kelimeler: ~3.366 (%60)
4├── Subword Parçaları: ~2.200 (%39)
5├── Special Tokens: 4 (%1)
6└── Diğer: ~40 (%1)1# Kelime parçalanması
2text = "Üniversitelerimizde"
3tokens = tokenizer.tokenize(text)
4print(f"Parçalar: {tokens}")
5# Parçalar: ['Üniversite', 'leri', 'mizde']
6
7# Token ID'leri
8ids = tokenizer.convert_tokens_to_ids(tokens)
9print(f"IDs: {ids}")1@software{mini_turkish_tokenizer,
2 title = {Mini Turkish Tokenizer},
3 author = {[Kaan İlker Nacar]},
4 year = {2025},
5 url = {https://huggingface.co/kaanilker/mini-turkish-tokenizer},
6 license = {GPL-2.0}
7}