Views
No views yet
1import torch
2from transformers import AutoModel, AutoTokenizer
3
4model = AutoModel.from_pretrained('melll-uff/bertweetbr')
5tokenizer = AutoTokenizer.from_pretrained('melll-uff/bertweetbr', normalization=False)
6
7# INPUT TWEETS ALREADY NORMALIZED!
8inputs = [
9 "Procuro um amor , que seja bom pra mim ... vou procurar , eu vou até o fim :nota_musical:",
10 "Que jogo ontem @USER :mãos_juntas:",
11 "Demojizer para Python é :polegar_para_cima: e está disponível em HTTPURL"]
12
13encoded_inputs = tokenizer(inputs, return_tensors="pt", padding=True)
14
15with torch.no_grad():
16 last_hidden_states = model(**encoded_inputs)
17
18# CLS Token of last hidden states. Shape: (number of input sentences, hidden sizeof the model)
19last_hidden_states[0][:,0,:]
20
21tensor([[-0.1430, -0.1325, 0.1595, ..., -0.0802, -0.0153, -0.1358],
22 [-0.0108, 0.1415, 0.0695, ..., 0.1420, 0.1153, -0.0176],
23 [-0.1854, 0.1866, 0.3163, ..., -0.2117, 0.2123, -0.1907]])1from emoji import demojize
2import torch
3from transformers import AutoModel, AutoTokenizer
4
5model = AutoModel.from_pretrained('melll-uff/bertweetbr')
6tokenizer = AutoTokenizer.from_pretrained('melll-uff/bertweetbr', normalization=True)
7
8inputs = [
9 "Procuro um amor , que seja bom pra mim ... vou procurar , eu vou até o fim 🎵",
10 "Que jogo ontem @cristiano 🙏",
11 "Demojizer para Python é 👍 e está disponível em https://pypi.org/project/emoji/"]
12
13tokenizer.demojizer = lambda x: demojize(x, language='pt')
14
15[tokenizer.normalizeTweet(s) for s in inputs]
16
17# Tokenizer first normalizes tweet sentences
18['Procuro um amor , que seja bom pra mim ... vou procurar , eu vou até o fim :nota_musical:',
19'Que jogo ontem @USER :mãos_juntas:',
20'Demojizer para Python é :polegar_para_cima: e está disponível em HTTPURL']
21
22encoded_inputs = tokenizer(inputs, return_tensors="pt", padding=True)
23
24with torch.no_grad():
25 last_hidden_states = model(**encoded_inputs)
26
27# CLS Token of last hidden states. Shape: (number of input sentences, hidden sizeof the model)
28last_hidden_states[0][:,0,:]
29
30tensor([[-0.1430, -0.1325, 0.1595, ..., -0.0802, -0.0153, -0.1358],
31 [-0.0108, 0.1415, 0.0695, ..., 0.1420, 0.1153, -0.0176],
32 [-0.1854, 0.1866, 0.3163, ..., -0.2117, 0.2123, -0.1907]])1from transformers import pipeline
2
3model_name = 'melll-uff/bertweetbr'
4tokenizer = AutoTokenizer.from_pretrained('melll-uff/bertweetbr', normalization=False)
5
6filler_mask = pipeline("fill-mask", model=model_name, tokenizer=tokenizer)
7filler_mask("Rio é a <mask> cidade do Brasil.", top_k=5)
8
9# Output
10[{'sequence': 'Rio é a melhor cidade do Brasil.',
11 'score': 0.9871652126312256,
12 'token': 120,
13 'token_str': 'm e l h o r'},
14{'sequence': 'Rio é a pior cidade do Brasil.',
15 'score': 0.005050931591540575,
16 'token': 316,
17 'token_str': 'p i o r'},
18{'sequence': 'Rio é a maior cidade do Brasil.',
19 'score': 0.004420778248459101,
20 'token': 389,
21 'token_str': 'm a i o r'},
22{'sequence': 'Rio é a minha cidade do Brasil.',
23 'score': 0.0021856199018657207,
24 'token': 38,
25 'token_str': 'm i n h a'},
26{'sequence': 'Rio é a segunda cidade do Brasil.',
27 'score': 0.0002110043278662488,
28 'token': 667,
29 'token_str': 's e g u n d a'}]