Views
No views yet
pip install git+https://github.com/Koziev/character-tokenizer<s>, </s>, <pad>, and <unk>.transformers.AutoTokenizer.from_pretrained, but somewhat like this:1import charactertokenizer
2
3...
4tokenizer = charactertokenizer.CharacterTokenizer.from_pretrained('igorktech/CharPicoSatirik-m')1prompt = '<s>Hello World\n'
2encoded_prompt = tokenizer.encode(prompt, return_tensors='pt')
3print('Tokenized prompt:', ' | '.join(tokenizer.decode([t]) for t in encoded_prompt[0]))| symbol:Tokenized prompt: <s> | H | e | l | l | o | | W | o | r | l | d |