Views
No views yet
[UNK], [PAD], [CLS], [SEP], [MASK], <|im_start|>, <|im_end|>meldakahramann/animasyon-domain-dataset veya benzeri Türkçe animasyon/sinema evren veri setleri kullanılarak Unsloth veya Hugging Face Transformers üzerinden fine-tune edilecek temel dil modellerinde metin işleme aracı olarak kullanılmalıdır.meldakahramann/animasyon-domain-dataset veri seti kaynak alınarak eğitilmiştir. Bu veri setindeki detaylı olay örgüleri, seslendirme kadroları, yapım stüdyoları bilgileri ve organik izleyici/eleştirmen yorumları eğitim derlemi olarak kullanılmıştır.tokenizers kütüphanesindeki BpeTrainer kullanılarak eğitilmiştir. Eğitim sırasında modele bilinmeyen kelimeler için [UNK] ve doldurma işlemleri için [PAD] gibi özel token'lar ile reasoning modellerinin aradığı sohbet şablonu belirteçleri (<|im_start|>, <|im_end|>) tanımlanmıştır.1from tokenizers import Tokenizer
2from huggingface_hub import hf_hub_download
3
4# Tokenizer dosyasını Hugging Face deposundan otomatik indirme
5tokenizer_path = hf_hub_download(repo_id="meldakahramann/animasyon-bpe-tokenizer", filename="tokenizer.json")
6
7# Tokenizer'ı indirdiğimiz dosya üzerinden yükleme
8tokenizer = Tokenizer.from_file(tokenizer_path)
9
10# Örnek bir kullanıcı sorusu
11ornek_soru = "Buz Devri filminin konusu nedir?"
12
13# Metni token'larına ayırma ve encode etme
14output = tokenizer.encode(ornek_soru)
15
16# Çıktıları ekrana yazdırma
17print("Tokenlar:", output.tokens)
18print("Token ID'leri:", output.ids)