Views
No views yet
| name | files |
|---|---|
| bert-base-swedish-cased | config, vocab, pytorch_model.bin |
| bert-base-swedish-cased-ner | config, vocab pytorch_model.bin |
| albert-base-swedish-cased-alpha | config, sentencepiece model, pytorch_model.bin |
do_lower_case flag parameter set to False and keep_accents to True (for ALBERT).# git clone https://github.com/Kungbib/swedish-bert-models
# cd swedish-bert-models
# python3 -m venv venv
# source venv/bin/activate
# pip install --upgrade pip
# pip install -r requirements.txt1from transformers import AutoModel,AutoTokenizer
2
3tok = AutoTokenizer.from_pretrained('KB/bert-base-swedish-cased')
4model = AutoModel.from_pretrained('KB/bert-base-swedish-cased')1from transformers import pipeline
2
3nlp = pipeline('ner', model='KB/bert-base-swedish-cased-ner', tokenizer='KB/bert-base-swedish-cased-ner')
4
5nlp('Idag släpper KB tre språkmodeller.')TME for time, PRS for personal names, LOC for locations, EVN for events and ORG for organisations. These labels are subject to change.1[ { 'word': 'Idag', 'score': 0.9998126029968262, 'entity': 'TME' },
2 { 'word': 'KB', 'score': 0.9814832210540771, 'entity': 'ORG' } ]##, for example the string Engelbert kör Volvo till Herrängens fotbollsklubb gets tokenized as Engel ##bert kör Volvo till Herr ##ängens fotbolls ##klubb. To glue parts back together one can use something like this:1text = 'Engelbert tar Volvon till Tele2 Arena för att titta på Djurgården IF ' +\
2 'som spelar fotboll i VM klockan två på kvällen.'
3
4l = []
5for token in nlp(text):
6 if token['word'].startswith('##'):
7 l[-1]['word'] += token['word'][2:]
8 else:
9 l += [ token ]
10
11print(l)1[ { 'word': 'Engelbert', 'score': 0.99..., 'entity': 'PRS'},
2 { 'word': 'Volvon', 'score': 0.99..., 'entity': 'OBJ'},
3 { 'word': 'Tele2', 'score': 0.99..., 'entity': 'LOC'},
4 { 'word': 'Arena', 'score': 0.99..., 'entity': 'LOC'},
5 { 'word': 'Djurgården', 'score': 0.99..., 'entity': 'ORG'},
6 { 'word': 'IF', 'score': 0.99..., 'entity': 'ORG'},
7 { 'word': 'VM', 'score': 0.99..., 'entity': 'EVN'},
8 { 'word': 'klockan', 'score': 0.99..., 'entity': 'TME'},
9 { 'word': 'två', 'score': 0.99..., 'entity': 'TME'},
10 { 'word': 'på', 'score': 0.99..., 'entity': 'TME'},
11 { 'word': 'kvällen', 'score': 0.54..., 'entity': 'TME'} ]1from transformers import AutoModel,AutoTokenizer
2
3tok = AutoTokenizer.from_pretrained('KB/albert-base-swedish-cased-alpha'),
4model = AutoModel.from_pretrained('KB/albert-base-swedish-cased-alpha')