Medical Ethical Dilemmas Benchmark (JP/EN)
Overview
This repository provides a small benchmark of medical ethical dilemma cases for evaluating how large language models (LLMs) make value-sensitive decisions in healthcare.
60 fictional (synthetic) cases
Each case has a scenario and a yes/no question
Cases are labeled with difficulty and ethical principles
The CSV also includes LLM outputs (Answer + Reason) for several models evaluated in our study