Views
No views yet
131,072 TokensĠmerhaba, olarak)Bilkent Writings ve TDK Sözlük derlemleri üzerindeki ~20.000 metin testinde Qwen'in 12.91M tokene ihtiyaç duyduğu Türkçe veri kümeleri optimize tokenizer ile 9.83M tokene inmiştir. Bu %23.8'lik net bir token kullanım azalmasına denk gelir! (Metin başına decode sırasında sıfır kayıp).▁ space haritaları arka planda Qwen'in GPT-2 utf-8 Byte Encoding (Ġ) formatına standartlaştırılarak dönüştürülmüş ve ilgili BPE Merges talimatları sisteme katılmıştır.chat_template.jinja ve video_preprocessor_config.json de barındıran eksiksiz bir "Processor" modelidir.
Modeli saf metin tokenizer'ı veya VLM tokenizer'ı olarak Hugging Face kütüphanesinden entegre edebilirsiniz:1from transformers import AutoTokenizer, Qwen2VLProcessor
2
3# Sadece metin analizi veya LLM kullanımı için
4tokenizer = AutoTokenizer.from_pretrained("bu-dizinin-yolu/new_qwen_tokenizer")
5encoded = tokenizer.encode("Merhaba nasılsınız? Hello world!")
6print(encoded)
7print(tokenizer.decode(encoded))
8
9# Çok modlu (Multimodal) VLM projelerinde kullanım (Vision-Language)
10processor = Qwen2VLProcessor.from_pretrained("bu-dizinin-yolu/new_qwen_tokenizer")tokenizer.json — Hugging Face BPE konfigürasyonu, vocab ağırlıkları ve tüm merges kuralları entegre edilmiş dosya.tokenizer.model — Llama.cpp ve türevleri ile kullanılacak SentencePiece formatında C++ motor dosyası. Byte-fallback yapısı öğretmen modeldeki gibi dizayn edilmiştir.tokenizer_config.json, special_tokens_map.json — Özel başlangıç/bitiş tokenleri haritalamaları.