BETO fine-tuned para NER de cáncer de próstata (español)
Modelo de Reconocimiento de Entidades Nombradas (NER) que extrae información clínica
de textos en español sobre cáncer de próstata. Es un fine-tuning de
BETO (BERT entrenado
desde cero en español) para clasificación de tokens en formato BIO con 21 etiquetas.
F1 en test: 0.976 (seqeval, micro) · Precision 0.973 · Recall 0.978 · Accuracy 0.995
🎯 Para qué sirve
Detecta y clasifica, palabra por palabra, 10 tipos de entidades clínicas en informes y
notas médicas de oncología prostática:
Entidad
Qué captura
Ejemplo
EDAD
Edad del paciente
72 años
CANCER
Tipo/diagnóstico de cáncer
adenocarcinoma de próstata
GLEASON
Escala de Gleason
Gleason 3+3
BIOMARCADOR
Biomarcadores (PSA, etc.)
PSA de 9.9 ng/dL
TNM
Estadificación TNM
T2N0M0
TRATAMIENTO
Tratamientos
radioterapia
MEDICAMENTO
Fármacos
bicalutamida
DOSIS
Dosis
50 mg diarios
CIRUGIA
Procedimientos quirúrgicos
prostatectomía radical
FECHA
Fechas
marzo de 2023
Cada entidad se etiqueta en esquema BIO (B- inicio, I- continuación, O fuera),
para 21 etiquetas en total.
🚀 Uso rápido
python
1from transformers import pipeline
23ner = pipeline("token-classification", model="ralzate/beto-prostata-ner",4 aggregation_strategy="simple")56texto =("Paciente masculino de 72 años con adenocarcinoma de próstata, "7"Gleason 3+3 y PSA de 9.9 ng/dL. Se inicia radioterapia y bicalutamida 50 mg.")89for e in ner(texto):10print(f"{e['entity_group']:14s}{e['score']*100:5.1f}% {e['word']}")
Barrido de batch size con 6 épocas y early stopping:
batch size
Precision
Recall
F1
8 (recomendado)
0.9732
0.9781
0.9757
16
0.9627
0.9705
0.9666
32
0.9488
0.9603
0.9545
Este repositorio publica la mejor configuración (batch size 8). El F1 baja levemente al
aumentar el lote porque, con 6 épocas, los lotes pequeños dan más pasos de optimización.
Comparación con XLM-RoBERTa
En el mismo dataset, BETO supera a XLM-RoBERTa-base (multilingüe) en todo el barrido
(F1 0.955–0.976 vs 0.850–0.936). En NER clínico en español, un encoder nativo en español
y compacto rinde mejor que un multilingüe más grande: la especialización lingüística pesa
más que el tamaño.
1@inproceedings{canete2020beto,
2 title={Spanish Pre-Trained BERT Model and Evaluation Data},
3 author={Cañete, José and Chaperon, Gabriel and Fuentes, Rodrigo and Ho, Jou-Hui and Kang, Hojin and Pérez, Jorge},
4 booktitle={PML4DC at ICLR 2020},
5 year={2020}
6}
Modelo afinado y publicado como parte de un proyecto de PLN en español (clasificación y NER
con Transformers). Reproducible en hardware modesto (Apple Silicon) mediante fine-tuning
completo para BETO y LoRA para modelos grandes.