A cross-domain, multilingual Named Entity Recognition model built for the Knowledge Platform — a system that connects patents, scientific papers, news articles, and political documents across 13 data sources.
Fine-tuned from answerdotai/ModernBERT-base on 256K+ multilingual documents spanning patents (USPTO, EPO), scientific papers (OpenAlex, arXiv), political documents (Bundestag, EU Parliament), and news.
Key Results
Metric
Score
F1
90.6%
Precision
89.5%
Recall
91.8%
Accuracy
98.1%
Entity Types
The model recognizes 15 entity types using BIO tagging (31 labels total):
Tag
Entity Type
Example
PER
Person
James Chen, Lisa Paus, Yann LeCun
ORG
Organization
Samsung Electronics, Bundestag, OpenAI
LOC
Location
Seoul, Brüssel, New York
ANIM
Animal
E. coli, SARS-CoV-2
BIO
Biological
CRISPR-Cas9, mRNA
CEL
Celestial Body
Mars, Jupiter
DIS
Disease
Alzheimer's, sickle cell disease
EVE
Event
COP28, World Economic Forum
FOOD
Food
glyphosate, insulin
INST
Instrument
LiDAR, mass spectrometer
MEDIA
Media/Work
Nature, The Lancet
MYTH
Mythological
Apollo (program context)
PLANT
Plant
Arabidopsis, cannabis sativa
TIME
Time
Q3 2025, fiscal year 2024
VEHI
Vehicle
Falcon 9, Boeing 787
Use Cases
This model is designed for knowledge graph construction from heterogeneous document collections:
Patent Analysis: Extract assignees, inventors, locations, and technologies from patent filings
Scientific Literature: Identify authors, institutions, biological entities, and instruments from papers
Political Document Processing: Extract politicians, parties, organizations from parliamentary debates (EN + DE)
News Processing: Identify key entities across news articles for event tracking
Cross-Domain Knowledge Graphs: Connect entities that appear across different document types and languages
Works with the Knowledge Platform Embedding Model
This model is designed to work alongside deepakint/knowledge-platform-embeddings — a SciNCL-based embedding model fine-tuned with contrastive learning on the same document corpus.
Together they form a pipeline:
This NER model extracts entities (the nodes of a knowledge graph)
The embedding model finds document connections (the edges of a knowledge graph)
Quick Start
python
1from transformers import pipeline
23ner = pipeline(4"ner",5 model="deepakint/knowledge-platform-ner",6 aggregation_strategy="max"7)89# English patent text10text ="Samsung Electronics Co., Ltd. filed a patent at the USPTO in Washington, D.C."11entities = ner(text)1213for entity in entities:14print(f" {entity['word']:40s}{entity['entity_group']:10s}{entity['score']:.3f}")
1# German political text2text ="Lisa Paus sprach im Deutschen Bundestag in Berlin über die neue Regulierung."3entities = ner(text)45for entity in entities:6print(f" {entity['word']:40s}{entity['entity_group']:10s}{entity['score']:.3f}")
Lisa Paus PER 1.000
Deutschen Bundestag ORG 1.000
Berlin LOC 1.000
Grouping Entities by Type
python
1from collections import defaultdict
23text ="""Apple Inc. CEO Tim Cook announced a new research lab in Palo Alto,
4California, partnering with Stanford University on CRISPR gene editing research."""56entities = ner(text)7grouped = defaultdict(list)8for ent in entities:9 grouped[ent["entity_group"]].append(ent["word"])1011for label, names insorted(grouped.items()):12print(f" {label:8s}: {names}")
BIO : ['CRISPR']
LOC : ['Palo Alto', 'California']
ORG : ['Apple Inc.', 'Stanford University']
PER : ['Tim Cook']