Read more about evaluation protocol & datasets in our paper and blog post.
We suggest using newer version of this model: NuNER v2.0
Model
k=1
k=4
k=16
k=64
RoBERTa-base
24.5
44.7
58.1
65.4
RoBERTa-base + NER-BERT pre-training
32.3
50.9
61.9
67.6
NuNER v0.1
34.3
54.6
64.0
68.7
NuNER v1.0
39.4
59.6
67.8
71.5
NuNER v2.0
43.6
61.0
68.2
72.0
Usage
Embeddings can be used out of the box or fine-tuned on specific datasets.
Get embeddings:
python
1import torch
2import transformers
345model = transformers.AutoModel.from_pretrained(6'numind/NuNER-v0.1',7 output_hidden_states=True8)9tokenizer = transformers.AutoTokenizer.from_pretrained(10'numind/NuNER-v0.1'11)1213text =[14"NuMind is an AI company based in Paris and USA.",15"See other models from us on https://huggingface.co/numind"16]17encoded_input = tokenizer(18 text,19 return_tensors='pt',20 padding=True,21 truncation=True22)23output = model(**encoded_input)2425# for better quality26emb = torch.cat(27(output.hidden_states[-1], output.hidden_states[-7]),28 dim=229)3031# for better speed32# emb = output.hidden_states[-1]
Citation
@misc{bogdanov2024nuner,
title={NuNER: Entity Recognition Encoder Pre-training via LLM-Annotated Data},
author={Sergei Bogdanov and Alexandre Constantin and Timothée Bernard and Benoit Crabbé and Etienne Bernard},
year={2024},
eprint={2402.15343},
archivePrefix={arXiv},
primaryClass={cs.CL}
}