Views
No views yet
Ġ) gösterimine dönüştürülmüş Magibu BPE söz varlığımerged-to-original-token-ids.json| Alan | Değer |
|---|---|
| Kaynak hedef tokenizer model söz varlığı | 200.000 |
| Magibu kaynak model söz varlığı | 65.536 |
| Enjekte edilen yeni token | 43.305 |
| Sınır nedeniyle kaldırılan hedef token | 0 |
| Son model söz varlığı | 243.305 |
| Özel/ek tokenlarla toplam söz varlığı | 245.353 |
| Kaynak merge kuralı eklemesi | 147.769 |
| Korunan hedef merge kuralı | 396.080 |
2^18 token ile sınırlar. Teknik sınıf adları ve özel token protokolü Hugging Face Transformers uyumluluğunu korumak için değiştirilmemiştir.1from transformers import AutoProcessor
2
3processor = AutoProcessor.from_pretrained("magibu/Arcus")
4messages = [
5 {"role": "user", "content": "Türkçe için verimli tokenizasyon neden önemlidir?"}
6]
7
8prompt = processor.apply_chat_template(
9 messages,
10 tokenize=False,
11 add_generation_prompt=True,
12)
13print(prompt)1from transformers import AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained("magibu/Arcus")
4encoded = tokenizer("Türkçe doğal dil işleme")
5print(encoded.input_ids)merged-to-original-token-ids.json, birleştirilmiş tokenizer'daki her ID'yi kaynak hedef tokenizer'daki bir veya daha fazla ID ile eşler. Bu dosya, genişletilmiş söz varlığıyla model eğitimine başlarken embedding'leri kaynak modelden başlatmak için kullanılabilir.LICENSE ve NOTICE dosyalarına bakın.Türkçe ve düşük kaynaklı diller için yapay zekâyı teoriden gerçek dünya uygulamalarına taşıyoruz.