Views
No views yet
ai-forever/ruBert-base on Russian clinical text.datasets/subgroups/group_J.csvca2a955685e3b0a1609138b88c68b43589ece162d0ba358b94d23bc973425ad9ml/build_subgroup_datasets.ipynb (iterative multi-label stratification by parse_id).J_OTHER for rare codes collapsed during dataset build).| metric | value |
|---|---|
| macro_f1 | 0.5179 |
| micro_f1 | 0.4536 |
| weighted_f1 | 0.4917 |
| subset_accuracy | 0.0959 |
| hit@1 | 0.5479 |
| hit@3 | 0.7055 |
| recall@3 | 0.6798 |
| mrr | 0.6560 |
metrics.json.*ДАТА*, *ГОРОД*, ...); model may behave differently on non-redacted input.label_map.json → rare_label_ids) for interface stability but will effectively never fire.1from transformers import AutoTokenizer, AutoModelForSequenceClassification
2import torch
3
4repo = "Dmitry43243242/icd10-ru-subgroup-j"
5tok = AutoTokenizer.from_pretrained(repo)
6mdl = AutoModelForSequenceClassification.from_pretrained(repo)
7mdl.eval()
8
9text = "жалобы пациента..."
10inp = tok(text, return_tensors="pt", truncation=True, max_length=512)
11with torch.no_grad():
12 probs = torch.sigmoid(mdl(**inp).logits)[0]
13preds = [mdl.config.id2label[i] for i, p in enumerate(probs.tolist()) if p >= 0.5]
14top3 = sorted(
15 [(mdl.config.id2label[i], p) for i, p in enumerate(probs.tolist())],
16 key=lambda x: -x[1],
17)[:3]
18print(preds, top3)ai-app ICD-10 classification pipeline. Upstream model: ai-forever/ruBert-base (ai-forever).