The merged dataset utilized in this project combines four distinct annotated datasets, all based on the Spanish Clinical Case Corpus (SPACCC), a compilation of clinical case reports from Spanish medical publications. This merged dataset encompasses a total of 16,504 sentences across 1,000 clinical cases. The dataset focuses on identifying various medical entities within clinical narratives, including symptoms, medical procedures, diseases, proteins… See the full description on the dataset page:
https://huggingface.co/datasets/IEETA/SPACCC-Spanish-NER.