Identificación de retinopatías
El Propósito del siguiente trabajo es identificar los pacientes que tienen complicaciones diabéticas, como lo son la neuropatía, nefropatía y retinopatía de notas médicas. Es el trabajo final del curso Clinical Natural Language Processing impartido en Coursera. Las notas medicas se encuentran en el siguiente link para el entrenamiento del modelo:
Y los datos para su validación se encuentran en el siguiente link:
En primera instancia, se crea el siguiente código para ignorar los warnings:
1
2import warnings
3warnings.filterwarnings("ignore", 'This pattern has match groups')
4datos = "https://raw.githubusercontent.com/hhsieh2416/Identify_Diabetic_Complications/main/data/diabetes_notes.csv"
5df = pd.read_csv(datos)
6
7
8# Importando las paqueterías necesarias:
9import pandas as pd
10import matplotlib.pyplot as plt
11import re
12import numpy as np
13from sklearn.metrics import confusion_matrix, classification_report
14
15# Lectura de datos
16datos = "https://raw.githubusercontent.com/hhsieh2416/Identify_Diabetic_Complications/main/data/diabetes_notes.csv"
17df = pd.read_csv(datos)
18
19# Análisis grafico de los datos
20fig, ax = plt.subplots()
21ax.bar(df['NOTE_ID'],df['TEXT'].str.split().apply(len))
22
23# Cantidad de palabras por reporte de cada paciente identificado por un id
24conteo = df['TEXT'].str.split().apply(len).tolist()
25print('Media de palabras: ' + str(np.mean(conteo)))
26print('Mediana de palabras: ' + str(np.median(conteo)))
27print('Minimo de palabras: ' + str(np.min(conteo)))
28print('Maximo de palabras: ' + str(np.max(conteo)))
29
30def reporte_paciente(id):
31 resumen = re.findall(r"\w+", str(df[df.NOTE_ID == id]['TEXT'].tolist() ))
32 return resumen
33
34# print(reporte_paciente(1))
35
Ahora, se genera una función la cual recibe nuestro DataFrame con las notas médicas, la palabra a buscar y el tamaño de la ventana
Función sin expresiones regulares
1
2def extract_text_window(df, word, window_size, column_name = "TEXT"):
3
4 #Constants
5 user_input = f'({word})'
6 regex = re.compile(user_input)
7
8 negative = f'(no history of {word}|No history of {word}|any comorbid complications|family history|father also has {word}|denies {word}|Negative for {word})'
9 regex_negative = re.compile(negative)
10
11 half_window_size = window_size
12 final_df = pd.DataFrame([])
13 column_position = df.columns.get_loc(column_name) + 1 #We add 1 cause position 0 is the index
14
15
16 #Loop for each row of the column
17 for row in df.itertuples():
18
19 #Loop for multiple matches in the same row
20 for match in regex.finditer(row[column_position]):
21
22 window_start = int([match.start()-half_window_size if match.start()>=half_window_size else 0][0])
23 window_end = int([match.end() + half_window_size if match.end()+half_window_size <= len(row[column_position]) else len(row[column_position])][0])
24
25
26 final_df = final_df.append({
27 "WORD": match.group(),
28 "START_INDEX": match.start(),
29 "WINDOW_START": window_start,
30 "WINDOW_END": window_end,
31 "CONTEXT": row[column_position][window_start:window_end],
32 "FULL_TEXT": row[column_position],
33 "NOTE_ID": row[1]},
34 ignore_index=True)
35 #Extracción de negativos
36 for match in regex_negative.finditer(row[column_position]):
37 final_df2 = final_df[final_df["CONTEXT"].str.contains(pat = regex_negative, regex = True)==False]
38
39 return "No matches for the pattern" if len(final_df) == 0 else final_df2
40
41
42
43# Buscando diabet en las notas médicas
44df = pd.read_csv("https://raw.githubusercontent.com/hhsieh2416/Identify_Diabetic_Complications/main/data/diabetes_notes.csv")
45word = "diabet"
46window_size = 50 #tamaño de la ventana
47
48diabetes_notes_window = extract_text_window(df,word,window_size)
49
50diabetes_notes_window
Se crea una segunda función la cual recibe nuestro DataFrame con nuestras notas médicas, nuestra expresión regular para la palabra a buscar, expresión regular para las expresiones como "historial familiar, no tiene historial de diabetes, no se ha identificado diabetes" entre otras y el tamaño de la ventana al rededor de la palabra a buscar.
Función con expresiones regulares
1
2def extract_text_window_pro(df, pattern,negatives, window_size, column_name = "TEXT"):
3
4 #Constants
5 half_window_size = window_size
6 final_df = pd.DataFrame([])
7 column_position = df.columns.get_loc(column_name) + 1 #We add 1 cause position 0 is the index
8
9
10 #Loop for each row of the column
11 for row in df.itertuples():
12
13 #Loop for multiple matches in the same row
14 for match in re.finditer(pattern,row[column_position]):
15
16 window_start = int([match.start()-half_window_size if match.start()>=half_window_size else 0][0])
17 window_end = int([match.end() + half_window_size if match.end()+half_window_size <= len(row[column_position]) else len(row[column_position])][0])
18
19
20 final_df = final_df.append({
21 "WORD": match.group(),
22 "START_INDEX": match.start(),
23 "WINDOW_START": window_start,
24 "WINDOW_END": window_end,
25 "CONTEXT": row[column_position][window_start:window_end],
26 "FULL_TEXT": row[column_position],
27 "NOTE_ID": row[1]},
28 ignore_index=True)
29 #Extracción de negativos
30 final_df2 = final_df[final_df["CONTEXT"].str.contains(pat = negatives, regex = True)==False]
31
32 return "No matches for the pattern" if len(final_df) == 0 else final_df2
33
34
35# Buscando diabet en las notas médicas
36
37df = pd.read_csv("https://raw.githubusercontent.com/hhsieh2416/Identify_Diabetic_Complications/main/data/diabetes_notes.csv")
38pattern = "diabetes|diabetic" #"(?<![a-zA-Z])diabet(es|ic)?(?![a-zA-Z])"
39window_size = 50
40negatives = r"no history of (?<![a-zA-Z])diabet(es|ic)?(?![a-zA-z])|No history of (?<![a-zA-Z])diabet(es|ic)?(?![a-zA-z])|den(ies|y)? any comorbid complications|family history|negative for (?<![a-zA-Z])diabet(es|ic)?(?![a-zA-z])|(father|mother) (also)? (?<![a-zA-Z])diabet(es|ic)?(?![a-zA-z])|Negative for (?<![a-zA-Z])diabet(es|ic)?(?![a-zA-z]) |no weakness, numbness or tingling|patient's mother and father|father also has diabetes"
41
42
43diabetes_notes_window = extract_text_window_pro(df,pattern,negatives,window_size)
44
45diabetes_notes_window
46
A continuación, es momento de obtener mediante la función, con expresiones regulares, los DataFrame para neuropathy, nephropathy y retinopathy.
1diabetes_notes_window.drop_duplicates(subset=["NOTE_ID"])
2
3
4neuropathy = diabetes_notes_window[diabetes_notes_window['CONTEXT'].str.contains(pat=r"(?<![a-zA-Z])neuropath(y|ic)?(?![a-zA-z])|diabetic nerve pain|tingling",regex=True)]
5neuropathy['COMPLICATIONS'] = "neuropathy"
6diabetes_notes_neuropathy = neuropathy[['NOTE_ID','CONTEXT','COMPLICATIONS']].drop_duplicates(subset=['NOTE_ID'])
7print(diabetes_notes_neuropathy)
8print(diabetes_notes_neuropathy.count())
9
10
11nephropathy = diabetes_notes_window[diabetes_notes_window['CONTEXT'].str.contains(pat=r"(?<![a-zA-Z])nephropathy(?![a-zA-z])|renal (insufficiency|disease)",regex=True)]
12nephropathy['COMPLICATIONS'] = "nephropathy"
13diabetes_notes_nephropathy = nephropathy[['NOTE_ID','CONTEXT','COMPLICATIONS']].drop_duplicates(subset=['NOTE_ID'])
14print(diabetes_notes_nephropathy)
15print(diabetes_notes_nephropathy.count())
16
17
18retinopathy = diabetes_notes_window[diabetes_notes_window['CONTEXT'].str.contains(pat=r"(?<![a-zA-Z])retinopath(y|ic)?(?![a-zA-z])",regex=True)]
19retinopathy['COMPLICATIONS'] = "retinopathy"
20diabetes_notes_retinopathy = retinopathy[['NOTE_ID','CONTEXT','COMPLICATIONS']].drop_duplicates(subset=['NOTE_ID'])
21print(diabetes_notes_retinopathy)
22print(diabetes_notes_retinopathy.count())
23
Para validar que nuestras funciones estén obteniendo bien la información, se hace el uso del segundo link el cual se nos fue proporcionado para la validación de estas notas médicas.
1# Con el link antes mencionado de validación se crean los DataFrame para cada patología
2
3datos_verificacion = pd.read_csv("https://raw.githubusercontent.com/hhsieh2416/Identify_Diabetic_Complications/main/data/glodstandrad.csv")
4
5datos_verificacion_neuropathy = datos_verificacion[datos_verificacion['DIABETIC_NEUROPATHY']==1][['NOTE_ID','DIABETIC_NEUROPATHY']]
6print(datos_verificacion_neuropathy)
7print(datos_verificacion_neuropathy.count())
8
9datos_verificacion_nephropathy = datos_verificacion[datos_verificacion['DIABETIC_NEPHROPATHY']==1][['NOTE_ID','DIABETIC_NEPHROPATHY']]
10print(datos_verificacion_nephropathy)
11print(datos_verificacion_nephropathy.count())
12
13datos_verificacion_retinopathy = datos_verificacion[datos_verificacion['DIABETIC_RETINOPATHY']==1][['NOTE_ID','DIABETIC_RETINOPATHY']]
14print(datos_verificacion_retinopathy)
15print(datos_verificacion_retinopathy.count())
16
Es necesario reunir los datos obtenidos por nuestro modelo con los datos de validación, tarea que es hecha por una unión, usando como llave el identificador de cada paciente
NOTE_ID.
1# Realizamos joins de nuestros DataFrame con las tablas de validación
2
3ver_neuro = pd.merge(datos_verificacion_neuropathy, diabetes_notes_neuropathy, how = 'outer', on = 'NOTE_ID', indicator=True)
4print(ver_neuro)
5
6ver_nephro = pd.merge(datos_verificacion_nephropathy, diabetes_notes_nephropathy, how = 'outer', on = 'NOTE_ID', indicator=True)
7print(ver_nephro)
8
9ver_retino = pd.merge(datos_verificacion_retinopathy, diabetes_notes_retinopathy, how = 'outer', on = 'NOTE_ID', indicator=True)
10print(ver_retino)
El primer análisis es realizar conteos para cada complicación, con el fin de saber cuantos falsos positivos y negativos se encuentran, con estos valores se
construye la matriz de confusión.
1# Se realizan los conteos
2
3conteo_na_neuro_falso_positivo = ver_neuro['DIABETIC_NEUROPATHY'].isna().sum()
4conteo_na_nephro_falso_positivo = ver_nephro['DIABETIC_NEPHROPATHY'].isna().sum()
5conteo_na_retino_falso_positivo = ver_retino['DIABETIC_RETINOPATHY'].isna().sum()
6
7print('Pacientes sin complicaciones pero que si se identifican: ', conteo_na_neuro_falso_positivo+conteo_na_nephro_falso_positivo+conteo_na_retino_falso_positivo)
Pacientes sin complicaciones pero que si se identifican: 5
1conteo_na_neuro_falso_negativo = ver_neuro['COMPLICATIONS'].isna().sum()
2conteo_na_nephro_falso_negativo = ver_nephro['COMPLICATIONS'].isna().sum()
3conteo_na_retino_falso_negativo = ver_retino['COMPLICATIONS'].isna().sum()
4
5print('Pacientes con complicaciones que no fueron detectados: ', conteo_na_neuro_falso_negativo + conteo_na_nephro_falso_negativo + conteo_na_retino_falso_negativo)
Pacientes con complicaciones que no fueron detectados: 13
1conteo_correcto_neuro = len(ver_neuro[ver_neuro['_merge'] == 'both'])
2
3conteo_correcto_nephro = len(ver_nephro[ver_nephro['_merge'] == 'both'])
4
5conteo_correcto_retino = len(ver_retino[ver_retino['_merge'] == 'both'])
6
7
8print('Pacientes que tienen complicaciones diabetes que si se encontaron: ', conteo_correcto_nephro+conteo_correcto_neuro+conteo_correcto_retino)
Pacientes que tienen complicaciones diabetes que si se encontaron: 15
1conteo_complicacion_neuro = len( ver_neuro[ver_neuro['DIABETIC_NEUROPATHY'] == 1] )
2conteo_complicacion_nephro = len( ver_nephro[ver_nephro['DIABETIC_NEPHROPATHY'] == 1] )
3conteo_complicacion_retino = len( ver_retino[ver_retino['DIABETIC_RETINOPATHY'] == 1] )
4print('Pacientes que tienen complicaciones diabeticas: ', conteo_complicacion_neuro +conteo_complicacion_nephro + conteo_complicacion_retino )
Pacientes que tienen complicaciones diabeticas: 28
Matriz de Confusión.
| Predicción\Verdad | Complicaciones | No complicaciones |
|---|
| Complicaciones | 15 | 5 |
| No complicaciones | 13 | 108 |
Procedemos con la evaluación usando la función classification_report de la paqueteria sklearn. Iniciamos con neuropatia, primero debemos llenar todos los espacios con NA (obtenidos de la unión)
usando el valor de cero. Una vez completado esto, hacemos la comparación de las dos columnas.
1cor_neuro = datos_verificacion[['NOTE_ID', 'DIABETIC_NEUROPATHY']].merge(diabetes_notes_neuropathy[['NOTE_ID','COMPLICATIONS']], how='outer', on='NOTE_ID', indicator=True )
2cor_neuro['COMPLICATIONS'] = cor_neuro['COMPLICATIONS'].map(d_neuro).fillna(0)
3
4print('---NEUROPATHY---')
5print(cor_neuro)
6
7print(classification_report(cor_neuro['DIABETIC_NEUROPATHY'].tolist(), cor_neuro['COMPLICATIONS'].tolist()))
Teniendo la siguiente evaluación:
| precision | recall | f1-score | support |
|---|
| 0 | 0.94 | 0.98 | 0.95 | 126 |
| 1 | 0.78 | 0.47 | 0.58 | 15 |
| accuracy | | | 0.93 | 141 |
| macroavg | 0.86 | 0.73 | 0.77 | 141 |
| weighted avg | 0.92 | 0.93 | 0.92 | 141 |
EL método muestra las principales métrica de precisión haciendo uso de los falsos y verdaderos positivos, junto a los falsos y verdaderos negativos.
Recall es la capacidad del clasificador de encontrar los ejemplares positivos, teniendo un valor de 0.73. F1-Score evalua cuantas predicciones positivas correctas se tiene,
el macropromedio es de 0.77. Teniendo un soporte de 15 ejemplares positivos, 126 negativos, sumando un total de 141.
En segundo lugar, evaluamos nefropatia.
1cor_nephro = datos_verificacion[['NOTE_ID', 'DIABETIC_NEPHROPATHY']].merge(diabetes_notes_nephropathy[['NOTE_ID','COMPLICATIONS']], how='outer', on='NOTE_ID', indicator=True )
2cor_nephro['COMPLICATIONS'] = cor_nephro['COMPLICATIONS'].map(d_nephro).fillna(0)
3print('---NEPHROPATHY---')
4print(cor_nephro)
5
6print(classification_report(cor_nephro['DIABETIC_NEPHROPATHY'].tolist(), cor_nephro['COMPLICATIONS'].tolist()))
| precision | recall | f1-score | support |
|---|
| 0 | 0.98 | 0.99 | 0.98 | 131 |
| 1 | 0.88 | 0.70 | 0.78 | 10 |
| accuracy | | | 0.97 | 141 |
| macroavg | 0.93 | 0.85 | 0.88 | 141 |
| weighted avg | 0.97 | 0.97 | 0.97 | 141 |
En este caso, el F1-score del macropromedio aumento a 0.88, mientras que el recall disminuyo a 0.73. Seguimos teniendo los 141 ejemplares.
Finalizando, tenemos retinopatia.
1cor_retino = datos_verificacion[['NOTE_ID', 'DIABETIC_RETINOPATHY']].merge(diabetes_notes_retinopathy[['NOTE_ID','COMPLICATIONS']], how='outer', on='NOTE_ID', indicator=True )
2cor_retino['COMPLICATIONS'] = cor_retino['COMPLICATIONS'].map(d_retino).fillna(0)
3print('---RETINOPATHY---')
4print(cor_retino)
5
6print(classification_report(cor_retino['DIABETIC_RETINOPATHY'].tolist(), cor_retino['COMPLICATIONS'].tolist()))
| precision | recall | f1-score | support |
|---|
| 0 | 0.99 | 0.99 | 0.98 | 138 |
| 1 | 0.33 | 0.33 | 0.33 | 3 |
| accuracy | | | 0.97 | 141 |
| macroavg | 0.66 | 0.66 | 0.66 | 141 |
| weighted avg | 0.97 | 0.97 | 0.97 | 141 |
Esta ultima evalaución nos devuelve el f1-score más bajo de las tres evaluaciones, con 0.66 en el macropromedio. Notemos que es la complicaciones con menos casos positivos de los tres casos
estudiados, contando con tres, de los cuales solo se encontro correctamente un ejemplar. Lo cual reduce el macropromedio considerablemente.