CD_8 Original + Derivados

Meningoencefalitis Bacteriana

Conjunto de datos clínico enfocado en Meningoencefalitis Bacteriana. Integra marcadores microbiológicos específicos (Streptococcus pneumoniae en LCR) con régimen antibiótico dual (Ceftriaxona + Vancomicina) y Betametasona.

📈 Eficacia Predictiva Detallada

Comparación detallada de las métricas de clasificación para los modelos entrenados con el conjunto de datos original y el conjunto sintético generado.

📊 Conjunto Original

Clase Precisión Recall F1-Score Soporte
Clase 0 0.75 0.50 0.60 6
Clase 1 0.25 0.50 0.33 2
Accuracy 0.50
Macro Avg 0.50 0.50 0.47 8
Weighted Avg 0.62 0.50 0.53 8
AUC-ROC: 0.42
F1-Score (weighted): 0.53
Accuracy: 0.50
➡️ Mejora
⬆ +0.17 AUC ⬆ +0.33 F1 ⬆ +0.38 Acc
🏆 MEJOR RENDIMIENTO

🔮 Conjunto Sintético

Clase Precisión Recall F1-Score Soporte
Clase 0 0.86 1.00 0.92 6
Clase 1 1.00 ⬆ +0.75 0.50 0.67 ⬆ +0.34 2
Accuracy 0.88 ⬆ +0.38
Macro Avg 0.93 ⬆ +0.43 0.75 ⬆ +0.25 0.79 ⬆ +0.32 8
Weighted Avg 0.89 ⬆ +0.27 0.88 ⬆ +0.38 0.86 ⬆ +0.33 8
AUC-ROC: 0.58 ⬆ +0.17
F1-Score (weighted): 0.86 ⬆ +0.33
Accuracy: 0.88 ⬆ +0.38

📊 Resumen de Mejoras en Clase Minoritaria (Clase 1)

🎯
Precisión
Original: 0.25
Sintético: 1.00
⬆ +0.75
📈
Recall
Original: 0.50
Sintético: 0.50
— Sin cambio
⚖️
F1-Score
Original: 0.33
Sintético: 0.67
⬆ +0.34

📚 Fuente Original del Conjunto

Meningoencefalitis Bacteriana

v1.0
Datos clínicos hospitalarios
Publicado: 2017-2024

📄 Resumen (Abstract)

Conjunto de datos clínico enfocado en la Meningoencefalitis Bacteriana. Se distingue por integrar marcadores microbiológicos específicos (Streptococcus pneumoniae en LCR) con un régimen antibiótico dual estándar (Ceftriaxona + Vancomicina) y terapia coadyuvante con Betametasona.

🔬 Métodos

Recolección retrospectiva de registros electrónicos. Anonimización mediante cifrado.

⚖️ Ética y Privacidad

Estudio aprobado por el comité de ética institucional bajo exención de consentimiento informado. Restricción de confidencialidad: En estricto cumplimiento de los protocolos de privacidad hospitalaria, el comité no autoriza la divulgación pública de los microdatos a nivel de paciente, ni en su versión original ni en sus variantes sintéticas generadas. La publicación se restringe exclusivamente a las métricas de evaluación, resultados agregados y metodología del modelo.

📖 Cómo citar la fuente original

Datos clínicos anonimizados de pacientes con neumonía grave. Servicio de Terapia Intensiva. Hospital Universitario "Arnaldo Milián Castro". Villa Clara. Cuba.

🔄 Transformaciones Aplicadas

Modificaciones realizadas al conjunto original

  • Codificación de categóricas: Transformación a valores numéricos.

📋 Diccionario de Datos Detallado

Variable Descripción Clínica Tipo Rango / Categorías Unidad ¿Objetivo?
Edad Edad del paciente al momento del ingreso Numérico 18 - 86 años No
Estadia Días de estancia hospitalaria del paciente Numérico 2 - 35 días No
Tiempo_exacto_de_ventilacion Tiempo total de ventilación mecánica durante la estancia Numérico 0 - 528 horas No
Puntaje_Apache Puntaje de severidad APACHE II al ingreso (0-34) Numérico 0 - 26 puntos No
Sexo Género del paciente Categórico 1: Masculino, 2: Femenino N/A No
Raza Raza/etnia del paciente Categórico 1, 2, 4 N/A No
Equipo_de_ventilacion_utilizado Tipo de equipo de ventilación utilizado durante la estancia Categórico 1, 3, 4, 6, 8, 9, 14 N/A No
Diagnostico_Meningoencefalitis_bacteriana Diagnóstico de meningoencefalitis bacteriana Binario 0: No, 1: Sí N/A No
Infeccion_Respiratoria Presencia de infección respiratoria Binario 0: No, 1: Sí N/A No
Infeccion_Liquido_cefaloraquideo Infección del líquido cefalorraquídeo Binario 0: No, 1: Sí N/A No
Germen_Acynetobacter Presencia de infección por Acinetobacter Binario 0: No, 1: Sí N/A No
Germen_Staphilococo_Aureus_Meticillin_Sensible Presencia de Staphylococcus aureus sensible a meticilina (MSSA) Binario 0: No, 1: Sí N/A No
Germen_Streptococo_Pneumoniae Presencia de infección por Streptococcus pneumoniae Binario 0: No, 1: Sí N/A No
_Analgesia_Recibida Paciente recibió analgesia Binario 0: No, 1: Sí N/A No
Hidratacion_Recibida Paciente recibió hidratación intravenosa Binario 0: No, 1: Sí N/A No
Anticoagulacion_profilactica_Recibida Paciente recibió anticoagulación profiláctica Binario 0: No, 1: Sí N/A No
Manitol_Recibida Paciente recibió manitol Binario 0: No, 1: Sí N/A No
Fenitoina_Recibida Paciente recibió fenitoína Binario 0: No, 1: Sí N/A No
Ceftriaxona_Recibida Paciente recibió ceftriaxona Binario 0: No, 1: Sí N/A No
Vancomicina_Recibida Paciente recibió vancomicina Binario 0: No, 1: Sí N/A No
Betametasona_Recibida Paciente recibió betametasona Binario 0: No, 1: Sí N/A No
Murio Indicador de fallecimiento del paciente Binario 0: No, 1: Sí N/A
22 Variables totales
4 Numéricas
3 Categóricas
15 Binarias
Objetivo: Mortalidad (Murio)
Datos ausentes: 0%

📈 Distribución de la variable objetivo en el conjunto original

📖 Leyenda de Variables Categóricas

Esta sección detalla los códigos y significados de las variables categóricas y binarias presentes en el conjunto de datos. Comprender estas codificaciones es fundamental para la correcta interpretación de los resultados clínicos.

Sexo Categórica
Código Significado
1 Masculino
2 Femenino
Raza Categórica
Código Significado
1 Blanca / Caucásica
2 Mestiza
4 Negra / Afrodescendiente
Equipo_de_ventilacion_utilizado Categórica
Código Significado
1 Evita-4
3 Servo S
4 Servo-i
6 Savina
8 No ventilado
9 Bella Vista
14 Otro / No especificado
Variables Binarias Binario

Formato común: 0 = No, 1 = Sí

Diagnostico_Meningoencefalitis_bacteriana Diagnóstico de meningoencefalitis bacteriana
Infeccion_Respiratoria Presencia de infección respiratoria
Infeccion_Liquido_cefaloraquideo Infección del líquido cefalorraquídeo
Germen_Acynetobacter Infección por Acinetobacter baumannii
Germen_Staphilococo_Aureus_Meticillin_Sensible Infección por Staphylococcus aureus sensible a meticilina (MSSA)
Germen_Streptococo_Pneumoniae Infección por Streptococcus pneumoniae
_Analgesia_Recibida Administración de analgesia
Hidratacion_Recibida Administración de hidratación intravenosa
Anticoagulacion_profilactica_Recibida Administración de anticoagulación profiláctica
Manitol_Recibida Administración de manitol
Fenitoina_Recibida Administración de fenitoína
Ceftriaxona_Recibida Administración de ceftriaxona
Vancomicina_Recibida Administración de vancomicina
Betametasona_Recibida Administración de betametasona
Murio 🎯 Variable Objetivo: Fallecimiento del paciente
ℹ️

Nota: Todas las variables binarias están codificadas como 0 = No (ausencia) y 1 = Sí (presencia).

📊
Total de variables categóricas: 3
  • Sexo (2 categorías)
  • Raza (3 categorías)
  • Equipo de ventilación (7 categorías presentes)
🎯
Total de variables binarias: 15
  • 14 variables de diagnóstico/tratamiento
  • 1 variable objetivo (Murio)
⚠️
Recomendaciones:
  • Verificar relación entre Diagnostico_Meningoencefalitis_bacteriana y los hallazgos en LCR
  • Validar consistencia entre germen identificado y antibioticoterapia recibida
  • El código 8 en ventilación indica "No ventilado"

🔬 Metodología de Generación (Reproducibilidad Científica)

📐 Método Principal

SMOTE RSB* Adaptado

Versión: 2.0

DOI: 10.1007/s42979-026-04896-8

📏 Reglas de restricción

  • Tiempo_exacto_de_ventilacion == 0 → Equipo_de_ventilacion_utilizado = 8 (No Aplica)
  • Tiempo_exacto_de_ventilacion > 0 → Equipo_de_ventilacion_utilizado ≠ 8
  • Diagnostico_Meningoencefalitis_bacteriana == 1 → Infeccion_Liquido_cefaloraquideo = 1
  • Germen_Streptococo_Pneumoniae == 1 → Infeccion_Liquido_cefaloraquideo = 1
  • Diagnostico_Meningoencefalitis_bacteriana == 1 → Ceftriaxona_Recibida = 1
  • Diagnostico_Meningoencefalitis_bacteriana == 1 → Vancomicina_Recibida = 1
  • Diagnostico_Meningoencefalitis_bacteriana == 1 → Betametasona_Recibida = 1
  • Ceftriaxona_Recibida y Claforan_Recibido son mutuamente excluyentes
  • Todo paciente debe recibir hidratación
  • Neumonia_Grave e Infeccion_Respiratoria son mutuamente excluyentes

⚙️ Hiperparámetros SMOTE RSB* Adaptado

Valor escala0.03
Probabilidad Base0.1

🔄 Hiperparámetros CTGAN

epochs300
batch_size10
generator_lr0.0002
discriminator_lr0.0002
pac2
generator_dim(64, 64)
discriminator_dim(64, 64)
embedding_dim128
l2scale1e-05

📊 Hiperparámetros TVAE

epochs 300
batch_size 10
embedding_dim 32
compress_dims (32, 32)
decompress_dims (32, 32)
l2scale 1e-5
loss_factor 2

🔐 Reproducibilidad

Random Seed42
Python3.12.12

Librerías utilizadas:

  • pandas: 2.3.3
  • numpy: 2.4.4
  • scikit-learn: 1.7.2
  • imbalanced-learn: 0.14.0
  • ctgan: 0.11.1
  • torch: 2.9.0
  • sdv: 1.28.0
  • scipy: 1.16.3
  • matplotlib: 3.10.9
📝

Para reproducir exactamente este conjunto de datos, ejecute el script de generación con la semilla aleatoria 42. Los resultados pueden variar ligeramente según la versión de las librerías.

📊 Conjuntos de Datos Derivados

El conjunto original ha sido sometido a un proceso de balanceo de clases y generación sintética para mejorar la representación de clases minoritarias. Nota: se ha empleado un conjunto de validación para evaluar el índice de fidelidad. Se han generado tres familias de conjuntos:

  • 📊 Balanceados: Conjuntos creados mediante técnicas de sobremuestreo
  • 🔮 Sintéticos Puros: Conjuntos generados completamente con modelos generativos
  • ✨ Aumentados: Combinación del conjunto original + datos sintéticos

El mejor conjunto de cada etapa fue seleccionado mediante el índice TabDSFidelity.

📊 Conjuntos Balanceados 8 conjuntos

Algoritmo Ratio N° Ejemplos AUC-ROC F1 Accuracy TabDSFidelity Jensen-Shannon Kolmogorov-Smirnov Kullback-Leibler Correlación Tiempo Total (s) Dist. Promedio Copias Exactas Ataque MIA Mejor
Random Oversampling 1 34 0.750 0.643 0.750 5.366 0.176 0.921 0.018 0.914 79.468 0 34 0.375
Smote 1 34 0.833 0.577 0.625 3.973 0.247 0.923 0.019 0.931 65.015 0.032 26 0.417
Borderline SMOTE 1 34 0.833 0.577 0.625 3.973 0.247 0.923 0.019 0.931 83.036 0.032 26 0.417
ADASYN 1.063 33 0.708 0.643 0.750 5.173 0.223 0.976 0.021 0.943 61.044 0.036 25 0.167
SMOTE RSB* Adaptado 1.417 29 1.000 0.859 0.875 9.531 0.231 0.985 0.009 0.943 54.572 0.032 23 0.333 🏆
SMOTE RSB* Adaptado + Reglas 1.417 29 0.750 0.750 0.750 6.445 0.208 0.992 0.011 0.938 52.124 0.030 23 0.250
OOF PSO para Balanceo 1 34 0.667 0.645 0.625 1.384 0.306 0.739 0.056 0.819 59.788 0.113 23 0.417
OOF PSO para Balanceo + Reglas 1 34 0.917 0.750 0.750 4.398 0.284 0.864 0.258 0.819 85.600 0.186 2 0.333
Mejor seleccionado: SMOTE RSB* Adaptado (TabDSFidelity: 9.531, AUC: 1.000, F1: 0.859, MIA: 0.333). Nota: Ratio <= 1.5 = Conjunto Balanceado.

🔮 Conjuntos Sintéticos Puros 10 conjuntos

Algoritmo Ratio N° Ejemplos AUC-ROC F1 Accuracy TabDSFidelity Jensen-Shannon Kolmogorov-Smirnov Kullback-Leibler Correlación Tiempo Total (s) Dist. Promedio Copias Exactas Ataque MIA Mejor
SMOTE RSB* + Ruido Gaussiano 1.280 6873 0.833 0.750 0.750 7.659 0.360 0.599 0.020 0.906 83.166 0.096 13 0.250
SMOTE RSB* + Ruido Gaussiano + Reglas 1.280 6873 0.833 0.750 0.750 7.476 0.360 0.599 0.189 0.856 269.756 0.157 2 0.667
CTGAN 1.321 9961 0.667 0.750 0.750 5.900 0.452 0.181 0.034 0.812 199.475 0.172 0 0.750
CTGAN + Reglas del Dominio 1.321 9961 0.083 0.577 0.625 2.149 0.452 0.181 0.479 0.807 397.217 0.202 0 0.667
TVAE 2.267 9995 0.917 0.859 0.875 6.944 0.514 0.167 0.868 0.828 154.441 0.121 0 0.417
TVAE + Reglas del Dominio 2.267 9995 0.917 0.750 0.750 5.249 0.514 0.167 2.904 0.825 345.160 0.174 0 0.917
OOF PSO para Aumento 1 10000 1.000 0.767 0.750 4.838 0.591 0.004 0.282 0.649 170.243 0.226 0 0.250
OOF PSO para Aumento + Reglas 1 10000 1.000 0.882 0.875 6.764 0.591 0.004 0.389 0.668 402.706 0.249 0 0.417
SMOTE RSB* Refinado 1.035 7605 0.792 0.643 0.750 6.810 0.389 0.664 0.024 0.897 146.831 0.106 10 0.500
SMOTE RSB* Refinado + Reglas 1.035 7605 0.833 0.859 0.875 9.158 0.389 0.664 0.215 0.854 332.293 0.168 3 0.500 🏆
Mejor seleccionado: SMOTE RSB* Refinado + Reglas del Dominio (TabDSFidelity: 9.158, AUC: 0.833, F1: 0.859, MIA: 0.500). Nota: Ratio <= 1.5 = Conjunto Balanceado.

✨ Conjuntos Aumentados 10 conjuntos

Algoritmo Ratio N° Ejemplos AUC-ROC F1 Accuracy TabDSFidelity Jensen-Shannon Kolmogorov-Smirnov Kullback-Leibler Correlación Tiempo Total (s) Dist. Promedio Copias Exactas Ataque MIA Mejor
SMOTE RSB* + Ruido Gaussiano 1.281 6902 0.833 0.645 0.625 5.304 0.360 0.600 0.020 0.906 185.177 0.097 22 0.167
SMOTE RSB* + Ruido Gaussiano + Reglas 1.281 6902 0.833 0.750 0.750 6.300 0.360 0.600 0.186 0.857 350.507 0.160 7 0.250
CTGAN 1.321 9990 0.625 0.645 0.625 2.794 0.451 0.182 0.033 0.813 298.276 0.171 9 0.417
CTGAN + Reglas del Dominio 1.321 9990 0.667 0.577 0.625 1.887 0.451 0.182 0.466 0.808 499.787 0.199 9 0.333
TVAE 2.264 10024 1.000 0.859 0.875 6.047 0.513 0.168 0.335 0.849 251.738 0.121 8 0.333
TVAE + Reglas del Dominio 2.264 10024 1.000 0.859 0.875 6.074 0.513 0.168 0.876 0.835 442.499 0.173 8 0.667
OOF PSO para Aumento 1.001 10029 1.000 1.000 1.000 6.000 0.589 0.004 0.280 0.650 270.976 0.227 8 0.333
OOF PSO para Aumento + Reglas 1.001 10029 1.000 1.000 1.000 6.311 0.589 0.004 0.383 0.670 519.246 0.250 8 0.250
SMOTE RSB* Refinado 1.034 7634 0.833 0.750 0.750 6.417 0.389 0.665 0.024 0.897 226.411 0.107 14 0.667
SMOTE RSB* Refinado + Reglas 1.034 7634 0.833 0.859 0.875 7.450 0.389 0.665 0.212 0.855 423.504 0.168 6 0.542 🏆
Mejor seleccionado: SMOTE RSB* Refinado + Reglas del Dominio (TabDSFidelity: 7.450, AUC: 0.833, F1: 0.859, MIA: 0.542). Nota: Ratio <= 1.5 = Conjunto Balanceado.

📈 Diagrama del Proceso de Generación

Conjunto Original
CD_8
Balanceo
(8 métodos)
↓ Selección por TabDSFidelity
⭐ Mejor Balanceado
SMOTE RSB* Adaptado
Generación Sintética
(10 métodos)
↓ Evaluación TabDSFidelity
⭐ Mejor Sintético
SMOTE RSB* Refinado + Reglas del Dominio
⭐ Mejor Aumentado
SMOTE RSB* Refinado + Reglas del Dominio
Conjunto Sintético Final
Seleccionado por calidad

📊 Guía de Métricas de Evaluación

Para interpretar correctamente los resultados de los conjuntos de datos generados, es fundamental comprender qué mide cada métrica y cómo se relacionan entre sí. A continuación, se detalla cada una de las métricas utilizadas en la evaluación:

🎯 Métricas de Rendimiento Predictivo

AUC-ROC (0.5 - 1.0)

¿Qué mide? Capacidad del modelo para distinguir entre clases (Ej: mortalidad vs supervivencia).

Interpretación:

  • 0.5: Sin capacidad predictiva (aleatorio)
  • 0.7-0.8: Aceptable
  • 0.8-0.9: Excelente
  • >0.9: Sobresaliente

Ejemplo: AUC-ROC = 0.82 significa que hay un 82% de probabilidad de que el modelo clasifique correctamente un paciente fallecido frente a uno superviviente.

F1-Score (0 - 1.0)

¿Qué mide? Media armónica entre precisión y sensibilidad (recall).

Interpretación:

  • 0.7-0.8: Buen equilibrio entre precisión y sensibilidad
  • 0.8-0.9: Muy buen equilibrio
  • >0.9: Excelente equilibrio

Ejemplo: F1 = 0.76 indica que el modelo mantiene un buen balance entre identificar correctamente a los pacientes que fallecen (sensibilidad) y no etiquetar erróneamente a los que sobreviven (precisión).

Accuracy (0 - 1.0)

¿Qué mide? Proporción de predicciones correctas sobre el total.

Interpretación:

  • 0.7-0.8: Buen rendimiento general
  • 0.8-0.9: Muy buen rendimiento
  • >0.9: Excelente rendimiento

Ejemplo: Accuracy = 0.75 significa que el 75% de las predicciones del modelo son correctas.

⚠️ Nota: En conjuntos desbalanceados, esta métrica puede ser engañosa. Es mejor usar F1-Score o AUC-ROC.

🔬 Índice de Fidelidad del Conjunto

TabDSFidelity (0 - 10+)

¿Qué mide? Calidad global del conjunto sintético comparado con el original.

Interpretación:

  • < 3.0: Baja fidelidad (poca similitud con el original)
  • 3.0 - 6.0: Fidelidad moderada
  • 6.0 - 8.0: Alta fidelidad
  • > 8.0: Muy alta fidelidad (excelente representación)

Ejemplo: TabDSFidelity = 8.08 indica que el conjunto sintético mantiene una alta similitud con el original, preservando las relaciones y distribuciones de los datos reales, además de maximizar su eficacia predictiva.

💡 Importante: Este es el índice para seleccionar el mejor conjunto de datos sintéticos. Para este caso, el peso empleado para las métricas "AUC-ROC", "F1-Score" y "Accuracy" fue (2) y para el resto de las métricas fue (1).

📊 Métricas de Similitud de Distribuciones

Jensen-Shannon (Promedio) (0 - 1.0)

¿Qué mide? Similitud entre las distribuciones de variables numéricas del conjunto sintético y el original.

Interpretación:

  • Cerca de 0: Distribuciones muy similares (ideal)
  • 0.1 - 0.3: Diferencias moderadas
  • > 0.3: Diferencias significativas

Ejemplo: JS = 0.118 indica que las distribuciones de las variables numéricas (edad, presión arterial, etc.) son bastante similares a las del conjunto original.

📌 Nota: Es el promedio de la divergencia de Jensen-Shannon calculada para todas las variables numéricas.

Kolmogorov-Smirnov (p-valor promedio) (0 - 1.0)

¿Qué mide? Probabilidad estadística de que las muestras numéricas del conjunto sintético provengan de la misma distribución continua que el original.

Interpretación:

  • Cerca de 1.0: Altísima probabilidad de que sean la misma distribución (ideal)
  • > 0.05: Similitud aceptable (no se rechaza que sean iguales)
  • < 0.05: Diferencias estadísticamente significativas

Ejemplo: KS p-valor = 0.753 indica que hay evidencia fuerte a favor de que las distribuciones acumulativas de la variable sintética y la original son equivalentes.

📌 Nota: Se reporta el promedio de los p-valores obtenidos mediante la prueba de Kolmogorov-Smirnov de dos muestras para las variables numéricas.

Kullback-Leibler (Promedio) (0 - ∞)

¿Qué mide? Divergencia entre las distribuciones de variables categóricas del conjunto sintético y el original.

Interpretación:

  • Cerca de 0: Distribuciones muy similares (ideal)
  • 0.01 - 0.1: Diferencias pequeñas
  • > 0.1: Diferencias notables

Ejemplo: KL = 0.014 indica que la distribución de las variables categóricas (género, mortalidad) es muy similar a la del conjunto original.

📌 Nota: Es el promedio de la divergencia de Kullback-Leibler para todas las variables categóricas. A diferencia de JS y KS, esta métrica se aplica solo a variables categóricas.

📊 Métricas de Estructura

Similitud de Correlación (0 - 1.0)

¿Qué mide? Preservación de las relaciones entre variables del conjunto original.

Interpretación:

  • Cerca de 1.0: Las relaciones entre variables se mantienen casi idénticas
  • > 0.9: Excelente preservación de relaciones
  • 0.7 - 0.9: Buena preservación
  • < 0.7: Pérdida significativa de relaciones

Ejemplo: Correlación = 0.976 significa que las relaciones entre variables (ej. edad y mortalidad) se mantienen en un 97.6% respecto al conjunto original.

⏱️ Métricas de Rendimiento Temporal

Tiempo Total (s) (segundos)

¿Qué mide? Tiempo total de ejecución del proceso de generación del conjunto.

Interpretación:

  • < 100s: Generación rápida
  • 100-300s: Tiempo moderado
  • > 300s: Proceso lento (puede ser aceptable para conjuntos grandes)

Ejemplo: Tiempo total = 69.45s significa que el proceso completo de generación del conjunto balanceado tomó aproximadamente 1.16 minutos.

⏱️ Nota: Incluye el tiempo de generación sintética + cálculo de métricas.

🔒 Métricas de Privacidad

Estas métricas evalúan el riesgo de exposición de información sensible y la capacidad de un atacante para inferir datos de los pacientes a partir del conjunto de datos sintéticos.

Distancia al Registro Más Cercano (≥ 0)

¿Qué mide? La distancia promedio entre cada registro sintético y su registro más cercano en el conjunto de datos original.

Interpretación:

  • Cerca de 0: Los datos sintéticos son muy similares a los originales → ⚠️ ALTO RIESGO de privacidad
  • 0.01 - 0.05: Similaridad moderada → Riesgo moderado
  • > 0.05: Buena separación de los datos originales → ✅ BAJO RIESGO de privacidad

Ejemplo: Distancia promedio = 0.015 en SMOTE indica que los registros sintéticos están relativamente cerca de los originales, lo que podría implicar un riesgo de privacidad moderado.

🔬

Metodología: Calculada utilizando la Distancia de Gower, la cual maneja internamente tipos de datos mixtos, normalizando las variables numéricas y penalizando diferencias categóricas para devolver un índice estandarizado entre 0 y 1.

💡

Recomendación: Valores < 0.01 deben ser evaluados con precaución. Idealmente, buscar valores > 0.02 para garantizar la privacidad.

Copias Exactas (≥ 0)

¿Qué mide? Número de registros sintéticos que son copias idénticas de registros en el conjunto de datos original.

Interpretación:

  • 0: Ninguna copia exacta → ✅ SEGURO
  • 1 - 10: Pocas copias → Riesgo bajo
  • 11 - 50: Copias moderadas → ⚠️ RIESGO MODERADO
  • > 50: Muchas copias → 🔴 ALTO RIESGO de reidentificación

Ejemplo: SMOTE RSB* Refinado genera 76 copias exactas de 8817 registros (0.86%), lo que representa un riesgo de privacidad que debe ser evaluado.

⚠️

Importante: La presencia de copias exactas es uno de los indicadores más críticos de fuga de datos. Idealmente, este valor debe ser 0.

Ataque de Inferencia de Membresía (MIA) (0 - 1.0)

¿Qué mide? Tasa de éxito (medida en AUC-ROC) de un atacante para determinar si un registro específico pertenece al conjunto de datos original.

Interpretación:

  • 0.5: Aleatorio (ideal) → ✅ PRIVACIDAD ÓPTIMA
  • 0.5 - 0.55: Riesgo bajo
  • 0.55 - 0.6: Riesgo moderado → ⚠️ PRIVACIDAD CUESTIONABLE
  • > 0.6: Riesgo alto → 🔴 PRIVACIDAD COMPROMETIDA

Ejemplo: MIA = 0.553 significa que el atacante tiene un éxito ligeramente superior al 50% aleatorio, lo que indica un riesgo de privacidad bajo/moderado.

🎯

Objetivo: Buscar valores lo más cercanos a 0.5. Valores > 0.6 indican que el conjunto sintético no protege adecuadamente la privacidad.

📝 Resumen Rápido para Selección

🏆
Para seleccionar el mejor conjunto:
  • Priorizar TabDSFidelity más alto
  • Buscar AUC-ROC y F1 altos
  • Valores de divergencia JS y KL cercanos a 0
  • P-valor de KS lo más cercano a 1.0 posible (>0.05)
  • Correlación > 0.9
⚖️
Balance entre calidad y tiempo:
  • Un TabDSFidelity > 8.0 indica excelente calidad
  • Tiempos de generación < 200s son aceptables
  • La Correlación > 0.95 asegura buena preservación de relaciones
🔒
Para garantizar la privacidad:
  • MIA lo más cercano a 0.5 (ideal)
  • Copias exactas = 0 (ideal) o lo más bajo posible
  • Distancia promedio > 0.02 para buena separación
  • Evaluar balance entre calidad (TabDSFidelity) y privacidad (MIA)