Views
No views yet
<s>, </s>, <unk>, <pad>1import sentencepiece as spm
2import torch
3
4# Load tokenizer
5sp = spm.SentencePieceProcessor(model_file='tokenizer.model')
6
7# Load model
8model = torch.load('pytorch_model.bin', map_location='cpu')
9
10Tokenizing Text
11 Copied # Encode
12text = "Asalam"
13pieces = sp.encode_as_pieces(text)
14ids = sp.encode_as_ids(text)
15
16# Decode
17decoded = sp.decode_ids(ids) Files
18
19pytorch_model.bin: Model weights
20config.json: Model configuration
21tokenizer.model: SentencePiece BPE tokenizer
22tokenizer_config.json: Tokenizer configuration
23special_tokens_map.json: Special tokens mapping
24
25Languages
26Supports Tamazight text in multiple scripts:
27
28Tifinagh: Traditional Amazigh script
29Latin: Latin transliteration
30Arabic: Arabic script representation
31
32Created on: 2026-02-07