Views
No views yet
| Özellik | Değer |
|---|---|
| Algoritma | Byte-Level BPE |
| Sözlük boyutu | 1.000 token |
| BPE merge sayısı | 740 |
| Ön-tokenizer | ByteLevel |
| Decoder | ByteLevel |
add_prefix_space | False |
| Bilinmeyen token | <unk> |
| Dolgu tokenı | <pad> |
| Başlangıç tokenı | <bos> |
| Bitiş tokenı | <eos> |
samliumay/turkish_cyber_security_controls_dataset
veri kümesindeki kullanıcı ve asistan mesajlarının içerikleri kullanılarak
eğitilmiştir. Roller ve diğer üst veriler eğitim metnine eklenmemiş, mesajlar
yeni satırlarla birleştirilmiştir.pip install transformers tokenizers1from transformers import AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained(
4 "samliumay/turkish_bpe_based_on_cyber_security_texts"
5)
6
7text = "Siber güvenlik kontrolleri nasıl uygulanır?"
8token_ids = tokenizer.encode(text, add_special_tokens=False)
9tokens = tokenizer.convert_ids_to_tokens(token_ids)
10decoded_text = tokenizer.decode(token_ids)
11
12print(token_ids)
13print(tokens)
14print(decoded_text)<bos> ve <eos> özel tokenları tanımlıdır ancak tokenizer yapılandırmasında
bunları otomatik ekleyen bir post-processor bulunmaz. Gerektiğinde açıkça
eklenmelidir:1token_ids = [tokenizer.bos_token_id]
2token_ids += tokenizer.encode(text, add_special_tokens=False)
3token_ids += [tokenizer.eos_token_id]tokenizers kütüphanesi kullanılarak
eğitilmiştir:1from tokenizers import Tokenizer
2from tokenizers.models import BPE
3from tokenizers.pre_tokenizers import ByteLevel
4from tokenizers.trainers import BpeTrainer
5
6tokenizer = Tokenizer(BPE(unk_token="<unk>"))
7tokenizer.pre_tokenizer = ByteLevel(add_prefix_space=False)
8
9trainer = BpeTrainer(
10 vocab_size=1_000,
11 special_tokens=["<unk>", "<pad>", "<bos>", "<eos>"],
12 initial_alphabet=ByteLevel.alphabet(),
13)decode(encode(text)) == text eşitliği sağlanmıştır. Tokenizer için henüz
kapsamlı parçalama kalitesi, sıkıştırma oranı veya başka tokenizerlarla
karşılaştırmalı bir değerlendirme yayımlanmamıştır.model_max_length değeri gerçek bir bağlam sınırı olarak yapılandırılmamıştır.
Azami uzunluk, tokenizer’ı kullanan modelin bağlam penceresine göre
belirlenmelidir.