Views
No views yet
Not: Bu tokenizer'ın dokümantasyonu Türk yapay zeka topluluğuna katkı sağlamak amacıyla VeriPazarı tarafından Türkçeye çevrilmiştir. Orijinal model mertcobanov tarafından geliştirilmiş olup, VeriPazarı tarafından Türk AI ekosistemi için arşivlenmiştir.🔗 Orijinal Kaynak: mertcobanov/turkish-wordpiece-tokenizer 🔗 Derleyen Platform: VeriPazarı
tokenizers kütüphanesi kullanılarak oluşturulmuş olup, esneklik sağlamak amacıyla hem büyük/küçük harf duyarlı (cased) hem de duyarsız (uncased) versiyonları barındırmaktadır.| Dosya Adı | Açıklama |
|---|---|
special_tokens_map.json | [UNK], [PAD], [CLS] ve [SEP] gibi özel token'ları kendi tanımlayıcılarıyla eşleştirir. |
tokenizer_config.json | Model türü ve özel token ayarları da dahil olmak üzere tokenizer için yapılandırma (config) ayrıntılarını içerir. |
turkish_wordpiece_tokenizer.json | 1 milyar Türkçe cümle üzerinde eğitilmiş ana WordPiece tokenizer (cased / büyük-küçük harf duyarlı). |
turkish_wordpiece_tokenizer_uncased.json | WordPiece tokenizer'ın uncased (büyük-küçük harfe duyarsız) versiyonu. |
turkish_wordpiece_tokenizer_post_token_uncased.json | Uncased tokenizer için tokenizasyon sonrası (post-tokenization) yapılandırması. |
[UNK] (Bilinmeyen / unknown token)[PAD] (Doldurma / padding token)[CLS] (Sınıflandırma / classification token)[SEP] (Ayırıcı / separator token)transformers kütüphanesiyle veya doğrudan tokenizers kütüphanesiyle yükleyebilirsiniz.tokenizers kütüphanesi ile yükleme:1from tokenizers import Tokenizer
2
3# Uncased tokenizer'ı yükleyin
4tokenizer = Tokenizer.from_file("path/to/turkish_wordpiece_tokenizer_uncased.json")
5
6# Bir cümleyi tokenize edin
7output = tokenizer.encode("Merhaba dünya!")
8print(output.tokens)1@misc{turkish_wordpiece_tokenizer,
2 title={Turkish WordPiece Tokenizer},
3 author={Mert Cobanov},
4 year={2024},
5 url={https://huggingface.co/mertcobanov/turkish-wordpiece-tokenizer}
6}