Views
No views yet
Mer1Alii/TR-ECommerce-CustomerSupport-Instructions corpus, this tokenizer drastically improves token efficiency and semantic comprehension for Turkish conversational AI."kargom teslim edilmedi iade istiyorum" (my package was not delivered, I want a return)| Tokenizer | Tokenized Representation | Token Count | Efficiency Gain |
|---|---|---|---|
| GPT-2 (Standard) | ['k', 'arg', 'om', ' t', 'es', 'lim', ' ed', 'il', 'medi', ' i', 'ade', ' is', 't', 'iy', 'orum'] | 15 | Baseline |
| Our Custom Tokenizer | ['kargom', ' teslim', ' edil', 'medi', ' iade', ' istiyorum'] | 6 | 2.5x Fewer Tokens (60% Savings) |
ByteLevelBPETokenizer)Mer1Alii/TR-ECommerce-CustomerSupport-Instructions)<s>: Beginning of Sequence (BOS)<pad>: Padding (PAD)</s>: End of Sequence (EOS)<unk>: Unknown token (UNK)<mask>: Masking token (MASK)transformers library:1from transformers import AutoTokenizer
2
3# Load custom tokenizer
4tokenizer = AutoTokenizer.from_pretrained("Mer1Alii/TR-ECommerce-CustomerSupport-Tokenizer")
5
6# Test Sentence
7text = "kargom teslim edilmedi iade istiyorum"
8tokens = tokenizer.encode(text)
9
10print("Token IDs:", tokens)
11print("Decoded Tokens:", tokenizer.convert_ids_to_tokens(tokens))