Views
No views yet
deepvk/RuModernBERT-base.irlspbru/RusLawOD.doc_type: document type classification from doc_typeIPS.classifier: multi-label legal classifier from classifierByIPS.keywords: multi-label keyword prediction from keywordsByIPS.ner: token classification from TryDotAtwo/russian-legal-ner.headingIPS and textIPS are used together as model input for document-level heads.1from legal_modernbert import LegalDocumentPipeline
2
3pipe = LegalDocumentPipeline.from_pretrained("TryDotAtwo/RuModernBERT-ruLaw")
4result = pipe("Текст правового документа...")| Source | Used for | Link |
|---|---|---|
| RuModernBERT-base | Initial encoder weights | deepvk/RuModernBERT-base |
| RusLawOD | MLM, document type, classifier, keywords | irlspbru/RusLawOD |
| Russian legal NER | NER head | TryDotAtwo/russian-legal-ner |
| Sud-resh benchmark | External MLM validation | lawful-good-project/sud-resh-benchmark |
| Evaluation | Metric | Result |
|---|---|---|
| RusLawOD MLM validation | eval loss | 0.1337 |
| RusLawOD MLM validation | train loss | 0.1537 |
| Sud-resh MLM benchmark, this model | eval loss | 0.4473 |
Sud-resh MLM benchmark, base deepvk/RuModernBERT-base | eval loss | 0.5172 |
| Sud-resh MLM benchmark | perplexity improvement vs base | ~6.8% |
| NER test | precision | 0.9970 |
| NER test | recall | 0.9884 |
| NER test | F1 | 0.9927 |
| NER test | loss | 0.00133 |
| Multitask document heads | final train loss | 0.0193 |