Views
No views yet
| Model | F1 macro |
|---|---|
| bert-base-multilingual-cased | 0.5206 |
| ours | 0.5892 |
| ours + two emb | 0.6231 |
1import torch
2import transformers
3
4
5model = transformers.AutoModel.from_pretrained(
6 'numind/NuNER-multilingual-v0.1',
7 output_hidden_states=True,
8)
9tokenizer = transformers.AutoTokenizer.from_pretrained(
10 'numind/NuNER-multilingual-v0.1',
11)
12
13text = [
14 "NuMind is an AI company based in Paris and USA.",
15 "NuMind est une entreprise d'IA basée à Paris et aux États-Unis.",
16 "See other models from us on https://huggingface.co/numind"
17]
18encoded_input = tokenizer(
19 text,
20 return_tensors='pt',
21 padding=True,
22 truncation=True
23)
24output = model(**encoded_input)
25
26# two emb trick: for better quality
27emb = torch.cat(
28 (output.hidden_states[-1], output.hidden_states[-7]),
29 dim=2
30)
31
32# single emb: for better speed
33# emb = output.hidden_states[-1]@misc{bogdanov2024nuner,
title={NuNER: Entity Recognition Encoder Pre-training via LLM-Annotated Data},
author={Sergei Bogdanov and Alexandre Constantin and Timothée Bernard and Benoit Crabbé and Etienne Bernard},
year={2024},
eprint={2402.15343},
archivePrefix={arXiv},
primaryClass={cs.CL}
}