Views
No views yet
| Model | MedRECT-ja Error Det. F1 | MedRECT-ja Sent. Ext. Acc. | MedRECT-ja EC Avg. Score | MedRECT-en Error Det. F1 | MedRECT-en Sent. Ext. Acc. | MedRECT-en EC Avg. Score |
|---|---|---|---|---|---|---|
| Preferred-MedRECT-32B | 0.743 | 81.5% | 0.627 | 0.728 | 90.9% | 0.718 |
| Qwen3-32B (think) | 0.723 | 72.5% | 0.549 | 0.740 | 83.5% | 0.550 |
| gpt-oss-120b (medium) | 0.721 | 77.4% | 0.581 | 0.777 | 88.1% | 0.630 |
| gpt-oss-20b (medium) | 0.718 | 64.3% | 0.543 | 0.762 | 87.2% | 0.590 |
| GPT-4.1 | 0.658 | 52.6% | 0.655 | 0.789 | 72.8% | 0.710 |
@article{medrect2025,
title={MedRECT: A Medical Reasoning Benchmark for Error Correction in Clinical Texts},
author={Iwase, Naoto and Okuyama, Hiroki and Iwasawa, Junichiro},
journal={arXiv preprint arXiv:2511.00421},
year={2025}
}