A 110M parameter ModernBERT-based masked language model trained on glossary and domain-specific text.
Evaluated on 80 domain-specific documents across 10 categories using KMeans.
OGBert-110M-Base matches or exceeds RoBERTa-base on clustering tasks.
1from transformers import pipeline
2
3fill_mask = pipeline('fill-mask', model='mjbommar/ogbert-110m-base')
4result = fill_mask('The financial <|mask|> was approved.')
1from transformers import AutoModelForMaskedLM, AutoTokenizer
2
3tokenizer = AutoTokenizer.from_pretrained('mjbommar/ogbert-110m-base')
4model = AutoModelForMaskedLM.from_pretrained('mjbommar/ogbert-110m-base')
5
6inputs = tokenizer('The <|mask|> definition is clear.', return_tensors='pt')
7outputs = model(**inputs)
Use
mjbommar/ogbert-110m-sentence instead, which includes mean pooling and L2 normalization for optimal similarity search.
1@article{bommarito2025opengloss,
2 title={OpenGloss: A Synthetic Encyclopedic Dictionary and Semantic Knowledge Graph},
3 author={Bommarito II, Michael J.},
4 journal={arXiv preprint arXiv:2511.18622},
5 year={2025}
6}