Views
No views yet
1from transformers import (
2 AutoModel,
3 AutoTokenizer,
4)
5model_id = "google/flan-t5-large"
6tokenizer = AutoTokenizer.from_pretrained(model_id)
7model = AutoModel.from_pretrained(model_id)
8
9accents = "áčďéěíňóřšťúůýž" # CS
10accents += "ąćęłńóśźż" # PL
11accents += "áäčďéíĺľňóôŕšťúýž" # SK
12accents += accents.upper()
13accents = set(c for c in accents)
14new_tokens = accents - set(tokenizer.vocab.keys())
15
16tokenizer.add_tokens(list(new_tokens))
17
18model.resize_token_embeddings(len(tokenizer))