Este conjunto de dados introduz um novo benchmark para avaliar modelos de linguagem grandes (LLMs) médicos em português brasileiro, abordando uma lacuna crítica na avaliação de IA para aplicações de saúde em contextos não ingleses. Ele é construído a partir de testes de aptidão médica brasileiros que abrangem o período de 2011-2025, incluindo o Exame Nacional de Revalidação de Diplomas Médicos Expedidos por… See the full description on the dataset page:
https://huggingface.co/datasets/recogna-nlp/drbodebench.