CD_7 Original + Derivados

Infección Urinaria (Sepsis de origen urinario)

Conjunto de datos clínico enfocado en Sepsis de Origen Urinario. Integra variables microbiológicas típicas del tracto urinario (E. coli, Klebsiella) con intervenciones urológicas específicas (catéter doble J).

📈 Eficacia Predictiva Detallada

Comparación detallada de las métricas de clasificación para los modelos entrenados con el conjunto de datos original y el conjunto sintético generado.

📊 Conjunto Original

Clase Precisión Recall F1-Score Soporte
Clase 0 0.17 0.06 0.08 18
Clase 1 0.60 0.84 0.70 31
Accuracy 0.55
Macro Avg 0.39 0.45 0.39 49
Weighted Avg 0.44 0.55 0.48 49
AUC-ROC: 0.65
F1-Score (weighted): 0.48
Accuracy: 0.55
➡️ Mejora
⬆ +0.11 AUC ⬆ +0.21 F1 ⬆ +0.14 Acc
🏆 MEJOR RENDIMIENTO

🔮 Conjunto Sintético

Clase Precisión Recall F1-Score Soporte
Clase 0 0.60 0.50 0.55 18
Clase 1 0.74 ⬆ +0.14 0.81 ⬇ -0.03 0.77 ⬆ +0.07 31
Accuracy 0.69 ⬆ +0.14
Macro Avg 0.67 ⬆ +0.28 0.65 ⬆ +0.20 0.66 ⬆ +0.27 49
Weighted Avg 0.69 ⬆ +0.25 0.69 ⬆ +0.14 0.69 ⬆ +0.21 49
AUC-ROC: 0.76 ⬆ +0.11
F1-Score (weighted): 0.69 ⬆ +0.21
Accuracy: 0.69 ⬆ +0.14

📊 Resumen de Mejoras en Clase Minoritaria (Clase 1)

🎯
Precisión
Original: 0.60
Sintético: 0.74
⬆ +0.14
📈
Recall
Original: 0.84
Sintético: 0.81
⬇ -0.03
⚖️
F1-Score
Original: 0.70
Sintético: 0.77
⬆ +0.07

📚 Fuente Original del Conjunto

Neumonía Grave Adquirida en la Comunidad

v1.0
Datos clínicos hospitalarios
Publicado: 2017-2024

📄 Resumen (Abstract)

Conjunto de datos clínico enfocado en la Sepsis de Origen Urinario. Se distingue por integrar variables microbiológicas típicas del tracto urinario (E. coli, Klebsiella) con intervenciones urológicas específicas (Colocación de catéter doble J).

🔬 Métodos

Recolección retrospectiva de registros electrónicos. Anonimización mediante cifrado.

⚖️ Ética y Privacidad

Estudio aprobado por el comité de ética institucional bajo exención de consentimiento informado. Restricción de confidencialidad: En estricto cumplimiento de los protocolos de privacidad hospitalaria, el comité no autoriza la divulgación pública de los microdatos a nivel de paciente, ni en su versión original ni en sus variantes sintéticas generadas. La publicación se restringe exclusivamente a las métricas de evaluación, resultados agregados y metodología del modelo.

📖 Cómo citar la fuente original

Datos clínicos anonimizados de pacientes con neumonía grave. Servicio de Terapia Intensiva. Hospital Universitario "Arnaldo Milián Castro". Villa Clara. Cuba.

🔄 Transformaciones Aplicadas

Modificaciones realizadas al conjunto original

  • Codificación de categóricas: Transformación a valores numéricos.

📋 Diccionario de Datos Detallado

Variable Descripción Clínica Tipo Rango / Categorías Unidad ¿Objetivo?
Edad Edad del paciente al momento del ingreso Numérico 0 - 94 años No
Estadia Días de estancia hospitalaria del paciente Numérico 0 - 35 días No
Tiempo_exacto_de_ventilacion Tiempo total de ventilación mecánica durante la estancia Numérico 0 - 720 horas No
Puntaje_Apache Puntaje de severidad APACHE II al ingreso Numérico 0 - 40 puntos No
Sexo Género del paciente Categórico 1: Masculino, 2: Femenino N/A No
Raza Raza/etnia del paciente Categórico 1: Blanca, 2: Mestiza, 4: Negra N/A No
Equipo_de_ventilacion_utilizado Tipo de equipo de ventilación utilizado durante la estancia Categórico 1, 3, 4, 6, 8, 9, 11, 12, 13, 14 N/A No
Diagnostico_Infeccion_urinaria Diagnóstico de infección urinaria Binario 0: No, 1: Sí N/A No
Infeccion_Urinaria Presencia de infección urinaria Binario 0: No, 1: Sí N/A No
Germen_Klebsiella Presencia de infección por Klebsiella Binario 0: No, 1: Sí N/A No
Germen_Echierichia_Coli Presencia de infección por Escherichia coli Binario 0: No, 1: Sí N/A No
Germen_Enterobacter_cloacae Presencia de infección por Enterobacter cloacae Binario 0: No, 1: Sí N/A No
Hidratacion_Recibida Paciente recibió hidratación intravenosa Binario 0: No, 1: Sí N/A No
Anticoagulacion_profilactica_Recibida Paciente recibió anticoagulación profiláctica Binario 0: No, 1: Sí N/A No
Antibioprofilaxis_Recibida Paciente recibió antibioprofilaxis Binario 0: No, 1: Sí N/A No
Norepinefrina_Recibida Paciente recibió norepinefrina (vasopresor) Binario 0: No, 1: Sí N/A No
Dobutamina_Recibida Paciente recibió dobutamina (inotrópico) Binario 0: No, 1: Sí N/A No
Epinefrina_Recibida Paciente recibió epinefrina (vasopresor) Binario 0: No, 1: Sí N/A No
Hidrocortisona_Recibida Paciente recibió hidrocortisona (corticoide) Binario 0: No, 1: Sí N/A No
Amiodarona_Recibida Paciente recibió amiodarona (antiarrítmico) Binario 0: No, 1: Sí N/A No
Ceftriaxona_Recibida Paciente recibió ceftriaxona (antibiótico - cefalosporina) Binario 0: No, 1: Sí N/A No
Claforan_Recibida Paciente recibió claforan/cefotaxima (antibiótico - cefalosporina) Binario 0: No, 1: Sí N/A No
Meropenen_Recibida Paciente recibió meropenem (antibiótico - carbapenémico) Binario 0: No, 1: Sí N/A No
Gentamicina_Recibida Paciente recibió gentamicina (antibiótico - aminoglucósido) Binario 0: No, 1: Sí N/A No
Amikacina_Recibida Paciente recibió amikacina (antibiótico - aminoglucósido) Binario 0: No, 1: Sí N/A No
Piperacilina_tazobactan_Recibida Paciente recibió piperacilina-tazobactam (antibiótico) Binario 0: No, 1: Sí N/A No
Insulina_lenta_Recibida Paciente recibió insulina lenta Binario 0: No, 1: Sí N/A No
Ceftazidima_Recibida Paciente recibió ceftazidima (antibiótico - cefalosporina) Binario 0: No, 1: Sí N/A No
Cefuroxima_Recibida Paciente recibió cefuroxima (antibiótico - cefalosporina) Binario 0: No, 1: Sí N/A No
Furosemida_Recibida Paciente recibió furosemida (diurético) Binario 0: No, 1: Sí N/A No
Colocacion_cateter_doble_J_Recibida Paciente recibió colocación de catéter doble J Binario 0: No, 1: Sí N/A No
Fosfomicina_Recibida Paciente recibió fosfomicina (antibiótico) Binario 0: No, 1: Sí N/A No
Murio Indicador de fallecimiento del paciente (variable objetivo) Binario 0: Superviviente, 1: Fallecido N/A
34 Variables totales
4 Numéricas
3 Categóricas
27 Binarias
Objetivo: Mortalidad (Murio)
Datos ausentes: 0%

📈 Distribución de la variable objetivo en el conjunto original

📖 Leyenda de Variables Categóricas

Esta sección detalla los códigos y significados de las variables categóricas y binarias presentes en el conjunto de datos. Comprender estas codificaciones es fundamental para la correcta interpretación de los resultados clínicos.

Sexo Categórica
Código Significado
1 Masculino
2 Femenino
Raza Categórica
Código Significado
1 Blanca / Caucásica
2 Mestiza
4 Negra / Afrodescendiente
Equipo_de_ventilacion_utilizado Categórica
Código Significado
1 Evita-4
3 Servo S
4 Servo-i
6 Savina
8 No ventilado
9 Bella Vista
11 R 50 SIRIUSMED
12 Jenny
13 ABETHA
14 Otros / No especificado
Variables Binarias Binario

Formato común: 0 = No, 1 = Sí

Diagnostico_Infeccion_urinaria Diagnóstico de infección urinaria
Infeccion_Urinaria Presencia de infección urinaria
Germen_Klebsiella Infección por Klebsiella
Germen_Echierichia_Coli Infección por Escherichia coli
Germen_Enterobacter_cloacae Infección por Enterobacter cloacae
Hidratacion_Recibida Administración de hidratación intravenosa
Anticoagulacion_profilactica_Recibida Administración de anticoagulación profiláctica
Antibioprofilaxis_Recibida Administración de antibioprofilaxis
Norepinefrina_Recibida Administración de norepinefrina (vasopresor)
Dobutamina_Recibida Administración de dobutamina (inotrópico)
Epinefrina_Recibida Administración de epinefrina (vasopresor)
Hidrocortisona_Recibida Administración de hidrocortisona (corticoide)
Amiodarona_Recibida Administración de amiodarona (antiarrítmico)
Ceftriaxona_Recibida Administración de ceftriaxona (antibiótico - cefalosporina)
Claforan_Recibida Administración de claforan/cefotaxima (antibiótico - cefalosporina)
Meropenen_Recibida Administración de meropenem (antibiótico - carbapenémico)
Gentamicina_Recibida Administración de gentamicina (antibiótico - aminoglucósido)
Amikacina_Recibida Administración de amikacina (antibiótico - aminoglucósido)
Piperacilina_tazobactan_Recibida Administración de piperacilina-tazobactam (antibiótico)
Insulina_lenta_Recibida Administración de insulina lenta
Ceftazidima_Recibida Administración de ceftazidima (antibiótico - cefalosporina)
Cefuroxima_Recibida Administración de cefuroxima (antibiótico - cefalosporina)
Furosemida_Recibida Administración de furosemida (diurético)
Colocacion_cateter_doble_J_Recibida Colocación de catéter doble J
Fosfomicina_Recibida Administración de fosfomicina (antibiótico)
Murio 🎯 Variable Objetivo: Fallecimiento del paciente (0: Superviviente, 1: Fallecido)
ℹ️

Nota: Todas las variables binarias están codificadas como 0 = No (ausencia) y 1 = Sí (presencia).

📊
Total de variables categóricas: 3
  • Sexo (2 categorías: 1=Masculino, 2=Femenino)
  • Raza (3 categorías: 1=Blanca, 2=Mestiza, 4=Negra)
  • Equipo de ventilación (10 categorías presentes: 1, 3, 4, 6, 8, 9, 11, 12, 13, 14)
🎯
Total de variables binarias: 27
  • 26 variables de diagnóstico/tratamiento
  • 1 variable objetivo (Murio)
💊
Perfil terapéutico identificado:
  • 🩸 Vasopresores e inotrópicos: Norepinefrina, Dobutamina, Epinefrina
  • 💊 Antibióticos: Ceftriaxona, Claforan, Meropenem, Gentamicina, Amikacina, Piperacilina/Tazobactam, Ceftazidima, Cefuroxima, Fosfomicina
  • 💉 Anticoagulación: Anticoagulación profiláctica
  • 💧 Hidratación: Hidratación intravenosa
  • 🛡️ Antibioprofilaxis
  • 🫀 Antiarrítmico: Amiodarona
  • 💊 Corticoide: Hidrocortisona
  • 💉 Insulina: Insulina lenta
  • 💧 Diurético: Furosemida
  • 🩺 Procedimiento: Colocación de catéter doble J
⚠️
Recomendaciones para análisis:
  • Verificar relación entre Diagnostico_Infeccion_urinaria y la presencia de gérmenes específicos
  • Validar la exclusión mutua entre Ceftriaxona y Claforan
  • Validar la exclusión mutua entre Gentamicina y Amikacina (aminoglucósidos)
  • El código 8 en ventilación indica "No ventilado"

🔬 Metodología de Generación (Reproducibilidad Científica)

📐 Método Principal

SMOTE RSB* Adaptado

Versión: 2.0

DOI: 10.1007/s42979-026-04896-8

📏 Reglas de restricción

  • Diagnostico_Infeccion_urinaria == 1 → Infeccion_Urinaria = 1
  • Germen_Echierichia_Coli == 1 → Infeccion_Urinaria = 1
  • Germen_Klebsiella == 1 → Infeccion_Urinaria = 1
  • Norepinefrina_Recibida == 1 → Meropenen_Recibida = 1 OR Piperacilina_tazobactan_Recibida = 1
  • Ceftriaxona_Recibida y Claforan_Recibida son mutuamente excluyentes
  • Gentamicina_Recibida y Amikacina_Recibida son mutuamente excluyentes
  • Tiempo_exacto_de_ventilacion == 0 → Equipo_de_ventilacion_utilizado = 8 (No Aplica)
  • Tiempo_exacto_de_ventilacion > 0 → Equipo_de_ventilacion_utilizado ≠ 8
  • Todo paciente debe recibir hidratación (Hidratacion_Recibida = 1)

📋 Detalle de reglas por categoría:

  • 🩺 Consistencia de Datos: Diagnóstico de ITU implica Infección Urinaria = 1
  • 🦠 Atributo SNOMED: Presencia de E. Coli o Klebsiella implica Infección Urinaria
  • 💊 Guía Clínica Sepsis: Paciente con soporte vasopresor (Norepinefrina) debe recibir antibiótico de amplio espectro (Meropenem o Piperacilina/Tazobactam)
  • ⛔ Redundancia Terapéutica: No administrar Ceftriaxona y Claforan al mismo tiempo. No administrar Gentamicina y Amikacina al mismo tiempo
  • 📊 Lógica de datos: Consistencia entre tiempo de ventilación y equipo utilizado
  • 💉 Cuidados estándar: Todo paciente debe recibir hidratación intravenosa

⚙️ Hiperparámetros SMOTE RSB* Adaptado

Valor escala0.03
Probabilidad Base0.1

🔄 Hiperparámetros CTGAN

epochs300
batch_size20
generator_lr0.0002
discriminator_lr0.0002
pac2
generator_dim(64, 64)
discriminator_dim(64, 64)
embedding_dim128
l2scale1e-05

📊 Hiperparámetros TVAE

epochs 300
batch_size 20
embedding_dim 32
compress_dims (32, 32)
decompress_dims (32, 32)
l2scale 1e-5
loss_factor 2

🔐 Reproducibilidad

Random Seed42
Python3.12.12

Librerías utilizadas:

  • pandas: 2.3.3
  • numpy: 2.4.4
  • scikit-learn: 1.7.2
  • imbalanced-learn: 0.14.0
  • ctgan: 0.11.1
  • torch: 2.9.0
  • sdv: 1.28.0
  • scipy: 1.16.3
  • matplotlib: 3.10.9
📝

Para reproducir exactamente este conjunto de datos, ejecute el script de generación con la semilla aleatoria 42. Los resultados pueden variar ligeramente según la versión de las librerías.

📊 Conjuntos de Datos Derivados

El conjunto original ha sido sometido a un proceso de balanceo de clases y generación sintética para mejorar la representación de clases minoritarias. Nota: se ha empleado un conjunto de validación para evaluar el índice de fidelidad. Se han generado tres familias de conjuntos:

  • 📊 Balanceados: Conjuntos creados mediante técnicas de sobremuestreo
  • 🔮 Sintéticos Puros: Conjuntos generados completamente con modelos generativos
  • ✨ Aumentados: Combinación del conjunto original + datos sintéticos

El mejor conjunto de cada etapa fue seleccionado mediante el índice TabDSFidelity.

📊 Conjuntos Balanceados 8 conjuntos

Algoritmo Ratio N° Ejemplos AUC-ROC F1 Accuracy TabDSFidelity Jensen-Shannon Kolmogorov-Smirnov Kullback-Leibler Correlación Tiempo Total (s) Dist. Promedio Copias Exactas Ataque MIA Mejor
Random Oversampling 1 180 0.888 0.817 0.816 8.700 0.078 0.961 0.002 0.982 86.196 0 180 0.531 🏆
SMOTE 1 180 0.870 0.817 0.816 7.183 0.115 0.869 0.005 0.984 72.957 0.007 144 0.539
Borderline SMOTE 1 180 0.838 0.777 0.776 3.098 0.134 0.908 0.004 0.980 62.731 0.009 144 0.517
ADASYN 1.011 181 0.845 0.777 0.776 3.592 0.122 0.962 0.005 0.983 64.373 0.008 144 0.424
SMOTE RSB* Adaptado 1 180 0.875 0.817 0.816 7.808 0.114 0.947 0.002 0.977 64.247 0.011 144 0.463
SMOTE RSB* Adaptado + Reglas 1 180 0.867 0.778 0.776 4.885 0.110 0.982 0.003 0.977 57.800 0.011 144 0.457
OOF PSO para Balanceo 1 180 0.872 0.815 0.816 4.022 0.197 0.281 0.044 0.790 71.812 0.070 144 0.455
OOF PSO para Balanceo + Reglas 1 180 0.879 0.834 0.837 6.452 0.197 0.454 0.061 0.860 68.348 0.083 61 0.440
Mejor seleccionado: Random Oversampling (TabDSFidelity: 8.700, AUC: 0.888, F1: 0.817, MIA: 0.531). Nota: Ratio <= 1.5 = Conjunto Balanceado.

🔮 Conjuntos Sintéticos Puros 10 conjuntos

Algoritmo Ratio N° Ejemplos AUC-ROC F1 Accuracy TabDSFidelity Jensen-Shannon Kolmogorov-Smirnov Kullback-Leibler Correlación Tiempo Total (s) Dist. Promedio Copias Exactas Ataque MIA Mejor
SMOTE RSB* + Ruido Gaussiano 1.399 6160 0.862 0.817 0.816 9.732 0.164 0.632 0.026 0.953 98.415 0.062 143 0.529 🏆
SMOTE RSB* + Ruido Gaussiano + Reglas 1.399 6160 0.781 0.723 0.735 8.314 0.164 0.632 0.043 0.946 271.320 0.078 49 0.517
CTGAN 1.096 9992 0.831 0.759 0.755 8.027 0.219 0.049 0.004 0.910 316.770 0.075 0 0.576
CTGAN + Reglas del Dominio 1.096 9992 0.719 0.619 0.612 5.792 0.219 0.049 0.024 0.911 521.681 0.085 0 0.576
TVAE 1.126 9975 0.789 0.717 0.714 7.212 0.367 0.182 0.023 0.943 172.323 0.040 1 0.659
TVAE + Reglas del Dominio 1.126 9975 0.728 0.658 0.653 6.145 0.367 0.182 0.029 0.935 376.901 0.053 1 0.663
OOF PSO para Aumento 1 10000 0.567 0.459 0.469 0.519 0.640 0.000 0.249 0.605 154.098 0.216 0 0.428
OOF PSO para Aumento + Reglas 1 10000 0.608 0.395 0.429 0.301 0.640 0.000 0.297 0.603 365.070 0.228 0 0.508
SMOTE RSB* Refinado 1.226 7989 0.812 0.710 0.714 8.463 0.188 0.690 0.018 0.954 104.885 0.059 102 0.399
SMOTE RSB* Refinado + Reglas 1.226 7989 0.808 0.747 0.755 8.801 0.188 0.690 0.035 0.948 298.094 0.074 50 0.469
Mejor seleccionado: SMOTE RSB* + Ruido Gaussiano (TabDSFidelity: 9.732, AUC: 0.862, F1: 0.817, MIA: 0.529). Nota: Ratio <= 1.5 = Conjunto Balanceado.

✨ Conjuntos Aumentados 10 conjuntos

Algoritmo Ratio N° Ejemplos AUC-ROC F1 Accuracy TabDSFidelity Jensen-Shannon Kolmogorov-Smirnov Kullback-Leibler Correlación Tiempo Total (s) Dist. Promedio Copias Exactas Ataque MIA Mejor
SMOTE RSB* + Ruido Gaussiano 1.385 6340 0.867 0.796 0.796 9.733 0.161 0.647 0.025 0.953 182.751 0.060 181 0.533 🏆
SMOTE RSB* + Ruido Gaussiano + Reglas 1.385 6340 0.817 0.752 0.755 8.177 0.161 0.647 0.041 0.947 357.851 0.077 106 0.514
CTGAN 1.094 10172 0.814 0.719 0.714 6.322 0.216 0.054 0.004 0.912 418.442 0.074 40 0.620
CTGAN + Reglas del Dominio 1.094 10172 0.703 0.679 0.673 4.175 0.216 0.054 0.023 0.912 624.005 0.084 40 0.500
TVAE 1.124 10155 0.799 0.696 0.694 5.523 0.360 0.190 0.021 0.945 275.087 0.039 40 0.579
TVAE + Reglas del Dominio 1.124 10155 0.760 0.677 0.673 4.597 0.360 0.190 0.027 0.937 480.832 0.052 40 0.548
OOF PSO para Aumento 1 10180 0.661 0.639 0.633 0.005 0.626 0.000 0.235 0.634 259.739 0.212 39 0.541
OOF PSO para Aumento + Reglas 1 10180 0.703 0.679 0.673 1.443 0.626 0.000 0.282 0.632 475.470 0.225 39 0.558
SMOTE RSB* Refinado 1.220 8169 0.833 0.755 0.755 8.483 0.186 0.706 0.017 0.955 204.670 0.055 148 0.452
SMOTE RSB* Refinado + Reglas 1.220 8169 0.794 0.710 0.714 7.007 0.186 0.706 0.034 0.949 394.487 0.071 92 0.448
Mejor seleccionado: SMOTE RSB* + Ruido Gaussiano (TabDSFidelity: 9.733, AUC: 0.867, F1: 0.796, MIA: 0.533). Nota: Ratio <= 1.5 = Conjunto Balanceado.

📈 Diagrama del Proceso de Generación

Conjunto Original
CD_7
Balanceo
(8 métodos)
↓ Selección por TabDSFidelity
⭐ Mejor Balanceado
Random Oversampling
Generación Sintética
(10 métodos)
↓ Evaluación TabDSFidelity
⭐ Mejor Sintético
SMOTE RSB* + Ruido Gaussiano
⭐ Mejor Aumentado
SMOTE RSB* + Ruido Gaussiano
Conjunto Sintético Final
Seleccionado por calidad

📊 Guía de Métricas de Evaluación

Para interpretar correctamente los resultados de los conjuntos de datos generados, es fundamental comprender qué mide cada métrica y cómo se relacionan entre sí. A continuación, se detalla cada una de las métricas utilizadas en la evaluación:

🎯 Métricas de Rendimiento Predictivo

AUC-ROC (0.5 - 1.0)

¿Qué mide? Capacidad del modelo para distinguir entre clases (Ej: mortalidad vs supervivencia).

Interpretación:

  • 0.5: Sin capacidad predictiva (aleatorio)
  • 0.7-0.8: Aceptable
  • 0.8-0.9: Excelente
  • >0.9: Sobresaliente

Ejemplo: AUC-ROC = 0.82 significa que hay un 82% de probabilidad de que el modelo clasifique correctamente un paciente fallecido frente a uno superviviente.

F1-Score (0 - 1.0)

¿Qué mide? Media armónica entre precisión y sensibilidad (recall).

Interpretación:

  • 0.7-0.8: Buen equilibrio entre precisión y sensibilidad
  • 0.8-0.9: Muy buen equilibrio
  • >0.9: Excelente equilibrio

Ejemplo: F1 = 0.76 indica que el modelo mantiene un buen balance entre identificar correctamente a los pacientes que fallecen (sensibilidad) y no etiquetar erróneamente a los que sobreviven (precisión).

Accuracy (0 - 1.0)

¿Qué mide? Proporción de predicciones correctas sobre el total.

Interpretación:

  • 0.7-0.8: Buen rendimiento general
  • 0.8-0.9: Muy buen rendimiento
  • >0.9: Excelente rendimiento

Ejemplo: Accuracy = 0.75 significa que el 75% de las predicciones del modelo son correctas.

⚠️ Nota: En conjuntos desbalanceados, esta métrica puede ser engañosa. Es mejor usar F1-Score o AUC-ROC.

🔬 Índice de Fidelidad del Conjunto

TabDSFidelity (0 - 10+)

¿Qué mide? Calidad global del conjunto sintético comparado con el original.

Interpretación:

  • < 3.0: Baja fidelidad (poca similitud con el original)
  • 3.0 - 6.0: Fidelidad moderada
  • 6.0 - 8.0: Alta fidelidad
  • > 8.0: Muy alta fidelidad (excelente representación)

Ejemplo: TabDSFidelity = 8.08 indica que el conjunto sintético mantiene una alta similitud con el original, preservando las relaciones y distribuciones de los datos reales, además de maximizar su eficacia predictiva.

💡 Importante: Este es el índice para seleccionar el mejor conjunto de datos sintéticos. Para este caso, el peso empleado para las métricas "AUC-ROC", "F1-Score" y "Accuracy" fue (2) y para el resto de las métricas fue (1).

📊 Métricas de Similitud de Distribuciones

Jensen-Shannon (Promedio) (0 - 1.0)

¿Qué mide? Similitud entre las distribuciones de variables numéricas del conjunto sintético y el original.

Interpretación:

  • Cerca de 0: Distribuciones muy similares (ideal)
  • 0.1 - 0.3: Diferencias moderadas
  • > 0.3: Diferencias significativas

Ejemplo: JS = 0.118 indica que las distribuciones de las variables numéricas (edad, presión arterial, etc.) son bastante similares a las del conjunto original.

📌 Nota: Es el promedio de la divergencia de Jensen-Shannon calculada para todas las variables numéricas.

Kolmogorov-Smirnov (p-valor promedio) (0 - 1.0)

¿Qué mide? Probabilidad estadística de que las muestras numéricas del conjunto sintético provengan de la misma distribución continua que el original.

Interpretación:

  • Cerca de 1.0: Altísima probabilidad de que sean la misma distribución (ideal)
  • > 0.05: Similitud aceptable (no se rechaza que sean iguales)
  • < 0.05: Diferencias estadísticamente significativas

Ejemplo: KS p-valor = 0.753 indica que hay evidencia fuerte a favor de que las distribuciones acumulativas de la variable sintética y la original son equivalentes.

📌 Nota: Se reporta el promedio de los p-valores obtenidos mediante la prueba de Kolmogorov-Smirnov de dos muestras para las variables numéricas.

Kullback-Leibler (Promedio) (0 - ∞)

¿Qué mide? Divergencia entre las distribuciones de variables categóricas del conjunto sintético y el original.

Interpretación:

  • Cerca de 0: Distribuciones muy similares (ideal)
  • 0.01 - 0.1: Diferencias pequeñas
  • > 0.1: Diferencias notables

Ejemplo: KL = 0.014 indica que la distribución de las variables categóricas (género, mortalidad) es muy similar a la del conjunto original.

📌 Nota: Es el promedio de la divergencia de Kullback-Leibler para todas las variables categóricas. A diferencia de JS y KS, esta métrica se aplica solo a variables categóricas.

📊 Métricas de Estructura

Similitud de Correlación (0 - 1.0)

¿Qué mide? Preservación de las relaciones entre variables del conjunto original.

Interpretación:

  • Cerca de 1.0: Las relaciones entre variables se mantienen casi idénticas
  • > 0.9: Excelente preservación de relaciones
  • 0.7 - 0.9: Buena preservación
  • < 0.7: Pérdida significativa de relaciones

Ejemplo: Correlación = 0.976 significa que las relaciones entre variables (ej. edad y mortalidad) se mantienen en un 97.6% respecto al conjunto original.

⏱️ Métricas de Rendimiento Temporal

Tiempo Total (s) (segundos)

¿Qué mide? Tiempo total de ejecución del proceso de generación del conjunto.

Interpretación:

  • < 100s: Generación rápida
  • 100-300s: Tiempo moderado
  • > 300s: Proceso lento (puede ser aceptable para conjuntos grandes)

Ejemplo: Tiempo total = 69.45s significa que el proceso completo de generación del conjunto balanceado tomó aproximadamente 1.16 minutos.

⏱️ Nota: Incluye el tiempo de generación sintética + cálculo de métricas.

🔒 Métricas de Privacidad

Estas métricas evalúan el riesgo de exposición de información sensible y la capacidad de un atacante para inferir datos de los pacientes a partir del conjunto de datos sintéticos.

Distancia al Registro Más Cercano (≥ 0)

¿Qué mide? La distancia promedio entre cada registro sintético y su registro más cercano en el conjunto de datos original.

Interpretación:

  • Cerca de 0: Los datos sintéticos son muy similares a los originales → ⚠️ ALTO RIESGO de privacidad
  • 0.01 - 0.05: Similaridad moderada → Riesgo moderado
  • > 0.05: Buena separación de los datos originales → ✅ BAJO RIESGO de privacidad

Ejemplo: Distancia promedio = 0.015 en SMOTE indica que los registros sintéticos están relativamente cerca de los originales, lo que podría implicar un riesgo de privacidad moderado.

🔬

Metodología: Calculada utilizando la Distancia de Gower, la cual maneja internamente tipos de datos mixtos, normalizando las variables numéricas y penalizando diferencias categóricas para devolver un índice estandarizado entre 0 y 1.

💡

Recomendación: Valores < 0.01 deben ser evaluados con precaución. Idealmente, buscar valores > 0.02 para garantizar la privacidad.

Copias Exactas (≥ 0)

¿Qué mide? Número de registros sintéticos que son copias idénticas de registros en el conjunto de datos original.

Interpretación:

  • 0: Ninguna copia exacta → ✅ SEGURO
  • 1 - 10: Pocas copias → Riesgo bajo
  • 11 - 50: Copias moderadas → ⚠️ RIESGO MODERADO
  • > 50: Muchas copias → 🔴 ALTO RIESGO de reidentificación

Ejemplo: SMOTE RSB* Refinado genera 76 copias exactas de 8817 registros (0.86%), lo que representa un riesgo de privacidad que debe ser evaluado.

⚠️

Importante: La presencia de copias exactas es uno de los indicadores más críticos de fuga de datos. Idealmente, este valor debe ser 0.

Ataque de Inferencia de Membresía (MIA) (0 - 1.0)

¿Qué mide? Tasa de éxito (medida en AUC-ROC) de un atacante para determinar si un registro específico pertenece al conjunto de datos original.

Interpretación:

  • 0.5: Aleatorio (ideal) → ✅ PRIVACIDAD ÓPTIMA
  • 0.5 - 0.55: Riesgo bajo
  • 0.55 - 0.6: Riesgo moderado → ⚠️ PRIVACIDAD CUESTIONABLE
  • > 0.6: Riesgo alto → 🔴 PRIVACIDAD COMPROMETIDA

Ejemplo: MIA = 0.553 significa que el atacante tiene un éxito ligeramente superior al 50% aleatorio, lo que indica un riesgo de privacidad bajo/moderado.

🎯

Objetivo: Buscar valores lo más cercanos a 0.5. Valores > 0.6 indican que el conjunto sintético no protege adecuadamente la privacidad.

📝 Resumen Rápido para Selección

🏆
Para seleccionar el mejor conjunto:
  • Priorizar TabDSFidelity más alto
  • Buscar AUC-ROC y F1 altos
  • Valores de divergencia JS y KL cercanos a 0
  • P-valor de KS lo más cercano a 1.0 posible (>0.05)
  • Correlación > 0.9
⚖️
Balance entre calidad y tiempo:
  • Un TabDSFidelity > 8.0 indica excelente calidad
  • Tiempos de generación < 200s son aceptables
  • La Correlación > 0.95 asegura buena preservación de relaciones
🔒
Para garantizar la privacidad:
  • MIA lo más cercano a 0.5 (ideal)
  • Copias exactas = 0 (ideal) o lo más bajo posible
  • Distancia promedio > 0.02 para buena separación
  • Evaluar balance entre calidad (TabDSFidelity) y privacidad (MIA)