CD_51 Original + Derivados

CD_51: Mammographic Mass

Conjunto de datos radiológico para la clasificación binaria de la severidad de masas mamarias. Integra atributos morfológicos (forma, margen) con ordinalidad implícita y datos demográficos procesados por imputación.

📈 Eficacia Predictiva Detallada

Comparación detallada de las métricas de clasificación para los modelos entrenados con el conjunto de datos original y el conjunto sintético generado.

🏆 MEJOR RENDIMIENTO

📊 Conjunto Original

Clase Precisión Recall F1-Score Soporte
Clase 0 0.84 0.80 0.82 104
Clase 1 0.78 0.82 0.80 89
Accuracy 0.81
Macro Avg 0.81 0.81 0.81 193
Weighted Avg 0.81 0.81 0.81 193
AUC-ROC: 0.89
F1-Score (weighted): 0.81
Accuracy: 0.81
⬇️ Degradación
⬇ -0.01 AUC ⬇ -0.01 F1 ⬇ -0.01 Acc

🔮 Conjunto Sintético

Clase Precisión Recall F1-Score Soporte
Clase 0 0.89 0.71 0.79 104
Clase 1 0.73 ⬇ -0.05 0.90 ⬆ +0.08 0.80 89
Accuracy 0.80 ⬇ -0.01
Macro Avg 0.81 0.81 0.80 ⬇ -0.01 193
Weighted Avg 0.82 ⬆ +0.01 0.80 ⬇ -0.01 0.80 ⬇ -0.01 193
AUC-ROC: 0.88 ⬇ -0.01
F1-Score (weighted): 0.80 ⬇ -0.01
Accuracy: 0.80 ⬇ -0.01

📊 Resumen de Cambios en Clase Minoritaria (Clase 1)

🎯
Precisión
Original: 0.78
Sintético: 0.73
⬇ -0.05
📈
Recall
Original: 0.82
Sintético: 0.90
⬆ +0.08
⚖️
F1-Score
Original: 0.80
Sintético: 0.80
— Sin cambio

📚 Fuente Original del Conjunto

Mammographic Mass Dataset

v1.0
Elter, M., Schulz-Wendtland, R., & Wittenberg, T.
Publicado: 2007

📄 Resumen (Abstract)

El conjunto de datos de Masas Mamográficas (Mammographic Mass) está diseñado para la discriminación de masas mamográficas benignas y malignas basada en atributos BI-RADS y la edad del paciente. La mamografía es el método más efectivo para la detección del cáncer de mama disponible actualmente. Sin embargo, el bajo valor predictivo positivo de la biopsia de mama resultante de la interpretación de mamografías conduce a aproximadamente 70% de biopsias innecesarias con resultados benignos. Este conjunto de datos puede utilizarse para predecir la severidad (benigna o maligna) de una lesión de masa mamográfica a partir de atributos BI-RADS y la edad del paciente, ayudando a los médicos en su decisión de realizar una biopsia o un seguimiento a corto plazo.

🔬 Contexto del Dominio

El cáncer de mama es una de las principales causas de muerte en mujeres en todo el mundo. La detección temprana mediante mamografía es crucial para mejorar las tasas de supervivencia. Sin embargo, la interpretación de mamografías tiene una tasa significativa de falsos positivos, lo que lleva a biopsias innecesarias que son costosas, invasivas y causan ansiedad en los pacientes.

Los sistemas CAD (Computer-Aided Diagnosis) han sido propuestos para ayudar a los médicos en la toma de decisiones. Este dataset, recolectado en el Instituto de Radiología de la Universidad de Erlangen-Nuremberg entre 2003 y 2006, contiene datos de mamografías digitales de campo completo con 516 masas benignas y 445 malignas.

📋 Clasificación BI-RADS

BI-RADS (Breast Imaging Reporting and Data System) es un sistema de estandarización para informes de imágenes mamarias. Cada instancia tiene una evaluación BI-RADS que va de 1 (definitivamente benigno) a 5 (altamente sugestivo de malignidad), asignada en un proceso de doble revisión por médicos.

  • 1: Definitivamente benigno
  • 2: Benigno
  • 3: Probablemente benigno
  • 4: Sospechoso
  • 5: Altamente sugestivo de malignidad

Asumiendo que todos los casos con evaluaciones BI-RADS ≥ un valor dado (1-5) son malignos, se pueden calcular sensibilidades y especificidades para comparar el rendimiento de los sistemas CAD con el de los radiólogos.

📊 Descripción de Datos

El dataset contiene 961 instancias con 5 atributos (4 variables predictoras y 1 variable objetivo). Las características son de tipo entero (ordinales y nominales). Presenta valores faltantes en varias variables.

📋 Variables del Dataset
Variable Tipo Descripción Escala / Categorías Valores Faltantes
A. Variables Predictoras
BI-RADS Ordinal Evaluación BI-RADS de la masa 1-5 (1 = definitivamente benigno, 5 = altamente sugestivo de malignidad) 2
Age Entero Edad del paciente años 5
Shape Nominal Forma de la masa 1 = redonda, 2 = oval, 3 = lobulada, 4 = irregular 31
Margin Nominal Margen de la masa 1 = circunscrito, 2 = microlobulado, 3 = oscurecido, 4 = mal definido, 5 = espiculado 48
Density Ordinal Densidad de la masa 1 = alta, 2 = iso, 3 = baja, 4 = contiene grasa 76
B. Variable Objetivo
Severity Binaria (Target) Resultado de la biopsia 0 = benigno, 1 = maligno 0
⚠️ Distribución de Clases
Clase Instancias Porcentaje Descripción
Benigna (0) 516 53.7% Resultado benigno de biopsia
Maligna (1) 445 46.3% Resultado maligno de biopsia

El dataset está relativamente balanceado entre clases benignas y malignas.

⚠️ Valores Faltantes por Variable
Variable Valores Faltantes Porcentaje de Faltantes
BI-RADS 2 0.2%
Age 5 0.5%
Shape 31 3.2%
Margin 48 5.0%
Density 76 7.9%

⚠️ La variable Density tiene el mayor número de valores faltantes (7.9%).

📋 Características del Dataset

  • Tipo de problema: Clasificación binaria (Benigno vs. Maligno)
  • Dimensión: Multivariante (961 × 5)
  • Tipo de características: Enteras (Ordinales y Nominales)
  • Valores faltantes: Sí (en todas las variables predictoras)
  • Área de aplicación: Salud y Medicina, Radiología, Diagnóstico por Imágenes
  • Distribución de clases: 516 benignas (53.7%), 445 malignas (46.3%)
  • Período de recolección: 2003-2006
  • Institución: Instituto de Radiología de la Universidad de Erlangen-Nuremberg

📖 Publicación Introductoria

El artículo fundamental que describe la predicción de resultados de biopsias de mama utilizando dos enfoques CAD es:

Elter, M., Schulz-Wendtland, R., & Wittenberg, T. (2007). The prediction of breast cancer biopsy outcomes using two CAD approaches that both emphasize an intelligible decision process. Medical Physics, 34(11), 4164-4172. https://doi.org/10.1118/1.2814240

⚖️ Ética y Privacidad

El conjunto de datos ha sido anonimizado para proteger la privacidad de los pacientes. No contiene información personal identificable como nombres, direcciones o números de identificación. Los datos fueron recolectados con fines de investigación en el Instituto de Radiología de la Universidad de Erlangen-Nuremberg. Restricción de confidencialidad: El uso de los datos está restringido a fines académicos y de investigación. La publicación de resultados debe limitarse a métricas de evaluación, resultados agregados y metodología del modelo, sin divulgación de información que permita la reidentificación de pacientes.

📋 Notas de Uso

Este conjunto de datos es ideal para clasificación médica y sistemas CAD. Se recomienda:

  • La variable objetivo Severity está codificada como 0 = Benigno y 1 = Maligno
  • La variable BI-RADS es ordinal (1-5) y puede utilizarse como característica o como umbral de referencia
  • Las variables Shape y Margin son nominales y requieren codificación One-Hot Encoding
  • Las variables BI-RADS y Density son ordinales y pueden tratarse como numéricas
  • Manejar los valores faltantes mediante imputación:
    • BI-RADS, Shape, Margin, Density: Imputación por moda
    • Age: Imputación por mediana o media
  • Estandarizar/normalizar la variable Age
  • La variable BI-RADS es un predictor muy fuerte, pero en aplicaciones clínicas puede considerarse no predictiva en el sentido de que ya representa la evaluación del radiólogo
  • El dataset está balanceado (53.7% benignas, 46.3% malignas), pero se recomienda validación cruzada estratificada
  • Este dataset es adecuado para modelos de clasificación como Regresión Logística, Árboles de Decisión, Random Forest, SVM y Redes Neuronales
  • La interpretabilidad de los modelos es especialmente importante en aplicaciones médicas

💡 Importancia en el Diagnóstico de Cáncer de Mama

El cáncer de mama es el cáncer más común en mujeres en todo el mundo, con aproximadamente 2.3 millones de casos nuevos y 685,000 muertes en 2020, según la Organización Mundial de la Salud. La detección temprana a través de mamografía es fundamental para:

  • Mejorar las tasas de supervivencia y reducir la mortalidad
  • Reducir el número de biopsias innecesarias (aproximadamente 70%)
  • Disminuir la ansiedad del paciente y los costos de atención médica
  • Apoyar a los radiólogos en la toma de decisiones clínicas

Los sistemas CAD basados en este dataset pueden ayudar a los médicos a decidir si realizar una biopsia o un seguimiento a corto plazo, mejorando la precisión diagnóstica y reduciendo procedimientos innecesarios.

📖 Cómo citar la fuente original

Elter, M., Schulz-Wendtland, R., & Wittenberg, T. (2007). The prediction of breast cancer biopsy outcomes using two CAD approaches that both emphasize an intelligible decision process. Medical Physics, 34(11), 4164-4172. https://doi.org/10.1118/1.2814240

📚 Referencias Adicionales

🔄 Transformaciones Aplicadas

Modificaciones realizadas al conjunto original (Mammographic Masses)

  • Carga y estructuración de datos:
    • Carga del archivo mammographic_masses.data con nombres de columnas según la documentación oficial: BI_RADS_assessment, Age, Shape, Margin, Density, Severity.
    • Tratamiento de valores '?' como NaN durante la carga para identificación temprana de valores faltantes.
    • Verificación de la estructura del dataset (6 columnas).
  • Imputación de valores faltantes:
    • Imputación con mediana para Age (edad) — estrategia robusta frente a outliers en variables demográficas.
    • Imputación con moda para variables ordinales/categóricas: BI_RADS_assessment (evaluación radiológica 1-5), Shape (forma 1-4), Margin (margen 1-5), Density (densidad 1-4).
    • Garantía de integridad total del conjunto de datos para modelado directo.
  • Estandarización y optimización de tipos de datos: < class="transformacion-lista">
  • Conversión forzada de todas las 6 variables a tipo entero (int) para eliminar decimales y optimizar memoria.
  • Variables incluidas: BI_RADS_assessment, Age, Shape, Margin, Density, Severity.
  • Eliminación de decimales espurios resultantes de la imputación.
  • Preservación de la semántica de variables ordinales:
    • Documentación detallada de las escalas ordinales con su significado clínico:
      • BI_RADS_assessment (1-5): Evaluación radiológica — mayor valor indica mayor sospecha de malignidad.
      • Shape (1-4): Forma de la masa — 1=Round, 2=Oval, 3=Lobular, 4=Irregular (mayor riesgo).
      • Margin (1-5): Margen de la masa — 1=Circumscribed, 2=Microlobulated, 3=Obscured, 4=Ill-defined, 5=Spiculated.
      • Density (1-4): Densidad de la masa — 1=High, 2=Iso, 3=Low, 4=Fat-containing.
  • Generación de documentación completa:
    • Creación del archivo leyenda_mammographic.txt con semántica completa de la variable objetivo y todas las variables predictoras.
    • Documentación de la variable Severity (0 = Benign - No canceroso, 1 = Malignant - Canceroso).
    • Descripción detallada de las 4 variables ordinales con sus escalas y significados clínicos.
    • Nota sobre imputación de valores perdidos: mediana para Edad, moda para el resto.
    • Contextualización del dataset: clasificación de masas mamarias en mamografías.
    • Estadísticas finales: total de instancias, distribución de clases y ratio de desbalance.
  • Preservación de la estructura y calidad de datos:
    • Mantenimiento de las 961 instancias (pacientes con masas mamarias) sin eliminación de filas.
    • Dataset final con 5 variables predictoras (todas ordinales/númericas enteras) y 1 variable objetivo binaria.
    • Guardado en formato CSV con separador punto y coma (;) para compatibilidad internacional.
  • 📊 Resultado: Dataset de 961 pacientes con masas mamarias con 5 variables predictoras (evaluación radiológica, edad, forma, margen, densidad) y 1 variable objetivo binaria (Severity). Desbalance moderado (~54% benignas / ~46% malignas) — escenario ideal para validación de técnicas de generación de datos sintéticos y evaluación del índice TabDSFidelity en contextos de diagnóstico por imagen y detección temprana de cáncer de mama, donde las características morfológicas de las masas y la evaluación radiológica son determinantes.

    🩺 Fuente: Mammographic Masses Dataset (UCI Machine Learning Repository) - Datos de masas mamarias para clasificación benigno/maligno.

    📊 BI_RADS_assessment (1-5): Escala de evaluación radiológica — mayor valor = mayor sospecha de malignidad (variable más predictiva).

    🔬 Variables morfológicas: Shape (forma de la masa, 1-4), Margin (margen, 1-5), Density (densidad, 1-4) — todas con significado clínico documentado.

    👤 Variable demográfica: Age (edad del paciente en años) — imputada con mediana.

    📁 Leyenda disponible: Archivo leyenda_mammographic.txt con descripción completa de variables ordinales y sus escalas clínicas.

    🎯 Variable objetivo: Severity (1 = Maligno/Canceroso, 0 = Benigno/No canceroso).

    🧹 Limpieza aplicada: Tratamiento de '?' como NaN, imputación con mediana (Age) y moda (BI_RADS, Shape, Margin, Density), estandarización de tipos a int.

    📋 Diccionario de Datos Detallado

    Variable Descripción Mamográfica Tipo Rango / Categorías Unidad ¿Objetivo?
    BI_RADS_assessment Evaluación BI-RADS del radiólogo (escala de sospecha) Categórico 0, 2, 3, 4, 5, 6 (ver leyenda) N/A No
    Shape Forma de la masa mamaria Categórico 1: Redonda, 2: Oval, 3: Lobular, 4: Irregular N/A No
    Margin Margen de la masa mamaria Categórico 1: Circunscrito, 2: Microlobulado, 3: Oscurecido, 4: Mal definido, 5: Espiculado N/A No
    Density Densidad de la masa mamaria Categórico 1: Alta, 2: Iso, 3: Baja, 4: Contiene grasa N/A No
    Age Edad del paciente Numérico 18 - 96 años No
    Severity Severidad de la masa mamaria (objetivo) Binario 0: Benigno, 1: Maligno N/A
    6 Variables totales
    1 Numéricas
    4 Categóricas
    1 Binarias
    Objetivo: Severidad (Severity)
    Datos ausentes: 0%

    📈 Distribución de la variable objetivo en el conjunto original

    📖 Leyenda de Variables Categóricas

    Esta sección detalla los códigos y significados de las variables categóricas y binarias presentes en el conjunto de datos de Masas Mamográficas (Mammographic Masses). Comprender estas codificaciones es fundamental para la correcta interpretación de los resultados de diagnóstico de cáncer de mama.

    BI_RADS_assessment Categórica (Ordinal)

    Evaluación BI-RADS (Breast Imaging Reporting and Data System)

    Código Significado Riesgo de Malignidad
    0Incompleto (Necesita evaluación adicional)-
    2Benigno (Hallazgos claramente benignos)✓ Muy bajo (<2%)
    3Probablemente benigno (Seguimiento corto plazo)✓ Bajo (~2%)
    4Sospechoso (Recomendación de biopsia)⚠ Moderado (~23-34%)
    5Altamente sospechoso de malignidad✗ Alto (>95%)
    6Malignidad conocida (confirmado por biopsia)✗ Muy alto (100%)
    🚨

    Factor clave: BI-RADS es el predictor más fuerte de malignidad. Códigos 4 y 5 requieren biopsia.

    Shape Categórica (Ordinal)
    Código Significado Riesgo de Malignidad
    1Redonda (Round)✓ Bajo
    2Oval (Oval)✓ Bajo
    3Lobular (Lobular)⚠ Moderado
    4Irregular (Irregular)✗ Alto
    📐

    Interpretación: Formas más irregulares y lobulares son más sospechosas de malignidad.

    Margin Categórica (Ordinal)
    Código Significado Riesgo de Malignidad
    1Circunscrito (Circumscribed)✓ Muy bajo
    2Microlobulado (Microlobulated)⚠ Moderado
    3Oscurecido (Obscured)⚠ Moderado
    4Mal definido (Ill-defined)✗ Alto
    5Espiculado (Spiculated)✗ Muy alto
    🔬

    Interpretación: Margen espiculado (5) es altamente sugestivo de cáncer infiltrante.

    Density Categórica (Ordinal)
    Código Significado Riesgo de Malignidad
    1Alta densidad (High)⚠ Moderado
    2Iso densidad (Iso)✓ Bajo
    3Baja densidad (Low)✓ Bajo
    4Contiene grasa (Fat-containing)✓ Muy bajo (Benigno)
    💡

    Interpretación: Masas con contenido graso (4) son casi siempre benignas. Alta densidad (1) puede oscurecer lesiones.

    Severity 🎯 Objetivo
    Código Significado
    0 Benigno - Masa no cancerosa (53.7%)
    1 Maligno - Masa cancerosa (46.3%)
    🎯

    Variable Objetivo: Clasifica la severidad de la masa mamaria como benigna o maligna.

    Resumen de Características Mamográficas 4 Categóricas + 1 Numérica
    🏥 BI-RADS Evaluación radiológica 0, 2, 3, 4, 5, 6
    🔵 Shape Forma de la masa 1-4 (Round → Irregular)
    📐 Margin Bordes de la masa 1-5 (Circunscrito → Espiculado)
    🎨 Density Densidad radiográfica 1-4 (Alta → Grasa)
    👤 Age Edad del paciente (18-96 años) A mayor edad, mayor riesgo
    📊
    Variables categóricas: 4
    • BI_RADS_assessment (6 niveles - ordinal)
    • Shape (4 niveles - ordinal)
    • Margin (5 niveles - ordinal)
    • Density (4 niveles - ordinal)
    🎯
    Variables binarias: 1
    • 🎯 Severity (Objetivo - Benigno/Maligno)
    📈
    Variables numéricas: 1
    • Age (Edad en años)
    ⚠️
    Recomendaciones Clínicas:
    • Factor más importante: BI_RADS_assessment - Códigos 4+ son altamente predictivos de malignidad
    • Forma sospechosa: Shape = 4 (Irregular) es la forma más asociada a cáncer
    • Margen sospechoso: Margin = 5 (Espiculado) es un hallazgo clásico de cáncer infiltrante
    • Densidad protectora: Density = 4 (Contiene grasa) casi siempre benigno
    • Edad: Mayor edad (> 50 años) aumenta el riesgo de malignidad
    • BI-RADS 0: Requiere imágenes adicionales (no es diagnóstico final)
    • BI-RADS 6: Malignidad ya confirmada por biopsia previa

    🔬 Metodología de Generación (Reproducibilidad Científica)

    📐 Método Principal

    SMOTE RSB* Adaptado

    Versión: 2.0

    DOI: 10.1007/s42979-026-04896-8

    📏 Reglas de restricción

    • Margin == 5 → BI_RADS_assessment = 5 (Margen irregular → BI-RADS 5)
    • Margin == 5 → Severity = 1 (Margen irregular → severidad alta)
    • Shape == 4 → BI_RADS_assessment ≥ 4 (Forma irregular → BI-RADS ≥4)
    • Shape == 4 → Severity = 1 (Forma irregular → severidad alta)
    • Margin == 1 → BI_RADS_assessment ≠ 5 (Margen bien definido → BI-RADS no 5)
    • Margin == 1 → Severity = 0 (Margen bien definido → severidad baja)
    • Shape == 1 → Severity = 0 (Forma bien definida → severidad baja)
    • BI_RADS_assessment == 6 → Severity = 1
    • BI_RADS_assessment == 5 → Severity = 1
    • BI_RADS_assessment == 2 → Severity = 0
    • Margin == 3 → Density ≤ 2
    • Age > 85 → Density ≠ 1
    • Severity == 1 → Age ≥ 25
    • BI_RADS_assessment == 4 → (Shape ≥ 3) OR (Margin ≥ 3)
    • Severity == 0 → Margin ≠ 5

    ⚙️ Hiperparámetros SMOTE RSB* Adaptado

    Valor escala0.03
    Probabilidad Base0.1

    🔄 Hiperparámetros CTGAN

    epochs500
    batch_size50
    generator_lr0.0002
    discriminator_lr0.0002
    pac10
    generator_dim(256, 256)
    discriminator_dim(256, 256)
    embedding_dim128
    l2scale1e-05

    📊 Hiperparámetros TVAE

    epochs 500
    batch_size 50
    embedding_dim 128
    compress_dims (128, 128)
    decompress_dims (128, 128)
    l2scale 1e-5
    loss_factor 2

    🔐 Reproducibilidad

    Random Seed42
    Python3.12.12

    Librerías utilizadas:

    • pandas: 2.3.3
    • numpy: 2.4.4
    • scikit-learn: 1.7.2
    • imbalanced-learn: 0.14.0
    • ctgan: 0.11.1
    • torch: 2.9.0
    • sdv: 1.28.0
    • scipy: 1.16.3
    • matplotlib: 3.10.9
    📝

    Para reproducir exactamente este conjunto de datos, ejecute el script de generación con la semilla aleatoria 42. Los resultados pueden variar ligeramente según la versión de las librerías.

    📊 Conjuntos de Datos Derivados

    El conjunto original ha sido sometido a un proceso de balanceo de clases y generación sintética para mejorar la representación de clases minoritarias. Nota: se ha empleado un conjunto de validación para evaluar el índice de fidelidad. Se han generado tres familias de conjuntos:

    • 📊 Balanceados: Conjuntos creados mediante técnicas de sobremuestreo
    • 🔮 Sintéticos Puros: Conjuntos generados completamente con modelos generativos
    • ✨ Aumentados: Combinación del conjunto original + datos sintéticos

    El mejor conjunto de cada etapa fue seleccionado mediante el índice TabDSFidelity.

    📊 Conjuntos Balanceados 8 conjuntos

    Algoritmo Ratio N° Ejemplos AUC-ROC F1 Accuracy TabDSFidelity Jensen-Shannon Kolmogorov-Smirnov Kullback-Leibler Correlación Tiempo Total (s) Dist. Promedio Copias Exactas Ataque MIA Mejor
    Random Oversampling - - - - - - - - - - - - - -
    Smote - - - - - - - - - - - - - -
    Borderline SMOTE - - - - - - - - - - - - - -
    ADASYN - - - - - - - - - - - - - -
    SMOTE RSB* Adaptado - - - - - - - - - - - - - -
    SMOTE RSB* Adaptado + Reglas - - - - - - - - - - - - - -
    OOF PSO para Balanceo - - - - - - - - - - - - - -
    OOF PSO para Balanceo + Reglas - - - - - - - - - - - - - -
    Mejor seleccionado: Sin datos disponibles (TabDSFidelity: -, AUC: -, F1: -, MIA: -). Nota: Ratio <= 1.5 = Conjunto Balanceado.

    🔮 Conjuntos Sintéticos Puros 10 conjuntos

    Algoritmo Ratio N° Ejemplos AUC-ROC F1 Accuracy TabDSFidelity Jensen-Shannon Kolmogorov-Smirnov Kullback-Leibler Correlación Tiempo Total (s) Dist. Promedio Copias Exactas Ataque MIA Mejor
    SMOTE RSB* + Ruido Gaussiano 1.060 3103 0.686 0.619 0.620 4.335 0.050 1.000 0.412 0.812 44.426 0.200 0 0.458
    SMOTE RSB* + Ruido Gaussiano + Reglas 1.371 3103 0.864 0.828 0.828 7.443 0.050 1.000 0.380 0.830 110.056 0.162 44 0.463
    CTGAN 1.860 3572 0.495 0.470 0.510 2.416 0.139 0.000 0.152 0.873 308.721 0.087 0 0.423
    CTGAN + Reglas del Dominio 1.275 3572 0.844 0.839 0.839 7.808 0.139 0.000 0.143 0.895 378.241 0.072 114 0.512 🏆
    TVAE 1.029 1447 0.488 0.436 0.438 1.881 0.173 0.041 0.033 0.852 157.378 0.020 0 0.480
    TVAE + Reglas del Dominio 1.106 1447 0.853 0.813 0.813 7.537 0.173 0.041 0.047 0.847 221.893 0.015 256 0.471
    OOF PSO para Aumento 1.521 8287 0.805 0.781 0.781 5.433 0.662 0.000 1.290 0.652 247.029 0.210 4 0.447
    OOF PSO para Aumento + Reglas 1.477 8287 0.864 0.795 0.797 5.600 0.662 0.000 1.258 0.537 320.156 0.155 13 0.469
    SMOTE RSB* Refinado 1 3758 0.571 0.515 0.516 2.787 0.057 0.981 0.306 0.818 41.169 0.172 0 0.514
    SMOTE RSB* Refinado + Reglas 1.344 3758 0.852 0.839 0.839 7.596 0.057 0.981 0.279 0.842 108.754 0.139 104 0.488
    Mejor seleccionado: CTGAN + Reglas del Dominio (TabDSFidelity: 7.808, AUC: 0.844, F1: 0.839, MIA: 0.512). Nota: Ratio <= 1.5 = Conjunto Balanceado.

    ✨ Conjuntos Aumentados 10 conjuntos

    Algoritmo Ratio N° Ejemplos AUC-ROC F1 Accuracy TabDSFidelity Jensen-Shannon Kolmogorov-Smirnov Kullback-Leibler Correlación Tiempo Total (s) Dist. Promedio Copias Exactas Ataque MIA Mejor
    SMOTE RSB* + Ruido Gaussiano 1.083 4064 0.981 0.906 0.906 5.834 0.039 1.000 0.248 0.855 78.105 0.151 475 0.448
    SMOTE RSB* + Ruido Gaussiano + Reglas 1.227 4064 0.979 0.906 0.906 5.754 0.039 1.000 0.226 0.872 143.182 0.124 513 0.473
    CTGAN 1.676 4533 0.965 0.890 0.891 2.960 0.114 0.000 0.100 0.901 344.440 0.069 423 0.520
    CTGAN + Reglas del Dominio 1.173 4533 0.977 0.891 0.891 4.172 0.114 0.000 0.095 0.920 413.396 0.058 512 0.479
    TVAE 1.079 2408 0.970 0.880 0.880 2.475 0.108 0.370 0.013 0.920 190.434 0.012 810 0.532
    TVAE + Reglas del Dominio 1.002 2408 0.976 0.891 0.891 4.168 0.108 0.370 0.013 0.925 254.842 0.008 1031 0.459
    OOF PSO para Aumento 1.478 9248 0.986 0.917 0.917 6.291 0.593 0.000 0.790 0.684 283.291 0.187 214 0.446 🏆
    OOF PSO para Aumento + Reglas 1.440 9248 0.986 0.917 0.917 6.089 0.593 0.000 0.721 0.580 358.075 0.139 223 0.447
    SMOTE RSB* Refinado 1.031 4719 0.976 0.901 0.901 4.908 0.045 0.999 0.205 0.854 75.334 0.136 418 0.428
    SMOTE RSB* Refinado + Reglas 1.227 4719 0.978 0.901 0.901 5.114 0.045 0.999 0.186 0.875 144.801 0.110 495 0.479
    Mejor seleccionado: OOF PSO para Aumento (TabDSFidelity: 6.291, AUC: 0.986, F1: 0.917, MIA: 0.446). Nota: Ratio <= 1.5 = Conjunto Balanceado.

    📈 Diagrama del Proceso de Generación

    Conjunto Original
    CD_51
    Balanceo
    (8 métodos)
    ↓ Selección por TabDSFidelity
    ⭐ Mejor Balanceado
    ----
    Generación Sintética
    (10 métodos)
    ↓ Evaluación TabDSFidelity
    ⭐ Mejor Sintético
    CTGAN + Reglas del Dominio
    ⭐ Mejor Aumentado
    OOF PSO para Aumento
    Conjunto Sintético Final
    Seleccionado por calidad

    📊 Guía de Métricas de Evaluación

    Para interpretar correctamente los resultados de los conjuntos de datos generados, es fundamental comprender qué mide cada métrica y cómo se relacionan entre sí. A continuación, se detalla cada una de las métricas utilizadas en la evaluación:

    🎯 Métricas de Rendimiento Predictivo

    AUC-ROC (0.5 - 1.0)

    ¿Qué mide? Capacidad del modelo para distinguir entre clases (Ej: mortalidad vs supervivencia).

    Interpretación:

    • 0.5: Sin capacidad predictiva (aleatorio)
    • 0.7-0.8: Aceptable
    • 0.8-0.9: Excelente
    • >0.9: Sobresaliente

    Ejemplo: AUC-ROC = 0.82 significa que hay un 82% de probabilidad de que el modelo clasifique correctamente un paciente fallecido frente a uno superviviente.

    F1-Score (0 - 1.0)

    ¿Qué mide? Media armónica entre precisión y sensibilidad (recall).

    Interpretación:

    • 0.7-0.8: Buen equilibrio entre precisión y sensibilidad
    • 0.8-0.9: Muy buen equilibrio
    • >0.9: Excelente equilibrio

    Ejemplo: F1 = 0.76 indica que el modelo mantiene un buen balance entre identificar correctamente a los pacientes que fallecen (sensibilidad) y no etiquetar erróneamente a los que sobreviven (precisión).

    Accuracy (0 - 1.0)

    ¿Qué mide? Proporción de predicciones correctas sobre el total.

    Interpretación:

    • 0.7-0.8: Buen rendimiento general
    • 0.8-0.9: Muy buen rendimiento
    • >0.9: Excelente rendimiento

    Ejemplo: Accuracy = 0.75 significa que el 75% de las predicciones del modelo son correctas.

    ⚠️ Nota: En conjuntos desbalanceados, esta métrica puede ser engañosa. Es mejor usar F1-Score o AUC-ROC.

    🔬 Índice de Fidelidad del Conjunto

    TabDSFidelity (0 - 10+)

    ¿Qué mide? Calidad global del conjunto sintético comparado con el original.

    Interpretación:

    • < 3.0: Baja fidelidad (poca similitud con el original)
    • 3.0 - 6.0: Fidelidad moderada
    • 6.0 - 8.0: Alta fidelidad
    • > 8.0: Muy alta fidelidad (excelente representación)

    Ejemplo: TabDSFidelity = 8.08 indica que el conjunto sintético mantiene una alta similitud con el original, preservando las relaciones y distribuciones de los datos reales, además de maximizar su eficacia predictiva.

    💡 Importante: Este es el índice para seleccionar el mejor conjunto de datos sintéticos. Para este caso, el peso empleado para las métricas "AUC-ROC", "F1-Score" y "Accuracy" fue (2) y para el resto de las métricas fue (1).

    📊 Métricas de Similitud de Distribuciones

    Jensen-Shannon (Promedio) (0 - 1.0)

    ¿Qué mide? Similitud entre las distribuciones de variables numéricas del conjunto sintético y el original.

    Interpretación:

    • Cerca de 0: Distribuciones muy similares (ideal)
    • 0.1 - 0.3: Diferencias moderadas
    • > 0.3: Diferencias significativas

    Ejemplo: JS = 0.118 indica que las distribuciones de las variables numéricas (edad, presión arterial, etc.) son bastante similares a las del conjunto original.

    📌 Nota: Es el promedio de la divergencia de Jensen-Shannon calculada para todas las variables numéricas.

    Kolmogorov-Smirnov (p-valor promedio) (0 - 1.0)

    ¿Qué mide? Probabilidad estadística de que las muestras numéricas del conjunto sintético provengan de la misma distribución continua que el original.

    Interpretación:

    • Cerca de 1.0: Altísima probabilidad de que sean la misma distribución (ideal)
    • > 0.05: Similitud aceptable (no se rechaza que sean iguales)
    • < 0.05: Diferencias estadísticamente significativas

    Ejemplo: KS p-valor = 0.753 indica que hay evidencia fuerte a favor de que las distribuciones acumulativas de la variable sintética y la original son equivalentes.

    📌 Nota: Se reporta el promedio de los p-valores obtenidos mediante la prueba de Kolmogorov-Smirnov de dos muestras para las variables numéricas.

    Kullback-Leibler (Promedio) (0 - ∞)

    ¿Qué mide? Divergencia entre las distribuciones de variables categóricas del conjunto sintético y el original.

    Interpretación:

    • Cerca de 0: Distribuciones muy similares (ideal)
    • 0.01 - 0.1: Diferencias pequeñas
    • > 0.1: Diferencias notables

    Ejemplo: KL = 0.014 indica que la distribución de las variables categóricas (género, mortalidad) es muy similar a la del conjunto original.

    📌 Nota: Es el promedio de la divergencia de Kullback-Leibler para todas las variables categóricas. A diferencia de JS y KS, esta métrica se aplica solo a variables categóricas.

    📊 Métricas de Estructura

    Similitud de Correlación (0 - 1.0)

    ¿Qué mide? Preservación de las relaciones entre variables del conjunto original.

    Interpretación:

    • Cerca de 1.0: Las relaciones entre variables se mantienen casi idénticas
    • > 0.9: Excelente preservación de relaciones
    • 0.7 - 0.9: Buena preservación
    • < 0.7: Pérdida significativa de relaciones

    Ejemplo: Correlación = 0.976 significa que las relaciones entre variables (ej. edad y mortalidad) se mantienen en un 97.6% respecto al conjunto original.

    ⏱️ Métricas de Rendimiento Temporal

    Tiempo Total (s) (segundos)

    ¿Qué mide? Tiempo total de ejecución del proceso de generación del conjunto.

    Interpretación:

    • < 100s: Generación rápida
    • 100-300s: Tiempo moderado
    • > 300s: Proceso lento (puede ser aceptable para conjuntos grandes)

    Ejemplo: Tiempo total = 69.45s significa que el proceso completo de generación del conjunto balanceado tomó aproximadamente 1.16 minutos.

    ⏱️ Nota: Incluye el tiempo de generación sintética + cálculo de métricas.

    🔒 Métricas de Privacidad

    Estas métricas evalúan el riesgo de exposición de información sensible y la capacidad de un atacante para inferir datos de los pacientes a partir del conjunto de datos sintéticos.

    Distancia al Registro Más Cercano (≥ 0)

    ¿Qué mide? La distancia promedio entre cada registro sintético y su registro más cercano en el conjunto de datos original.

    Interpretación:

    • Cerca de 0: Los datos sintéticos son muy similares a los originales → ⚠️ ALTO RIESGO de privacidad
    • 0.01 - 0.05: Similaridad moderada → Riesgo moderado
    • > 0.05: Buena separación de los datos originales → ✅ BAJO RIESGO de privacidad

    Ejemplo: Distancia promedio = 0.015 en SMOTE indica que los registros sintéticos están relativamente cerca de los originales, lo que podría implicar un riesgo de privacidad moderado.

    🔬

    Metodología: Calculada utilizando la Distancia de Gower, la cual maneja internamente tipos de datos mixtos, normalizando las variables numéricas y penalizando diferencias categóricas para devolver un índice estandarizado entre 0 y 1.

    💡

    Recomendación: Valores < 0.01 deben ser evaluados con precaución. Idealmente, buscar valores > 0.02 para garantizar la privacidad.

    Copias Exactas (≥ 0)

    ¿Qué mide? Número de registros sintéticos que son copias idénticas de registros en el conjunto de datos original.

    Interpretación:

    • 0: Ninguna copia exacta → ✅ SEGURO
    • 1 - 10: Pocas copias → Riesgo bajo
    • 11 - 50: Copias moderadas → ⚠️ RIESGO MODERADO
    • > 50: Muchas copias → 🔴 ALTO RIESGO de reidentificación

    Ejemplo: SMOTE RSB* Refinado genera 76 copias exactas de 8817 registros (0.86%), lo que representa un riesgo de privacidad que debe ser evaluado.

    ⚠️

    Importante: La presencia de copias exactas es uno de los indicadores más críticos de fuga de datos. Idealmente, este valor debe ser 0.

    Ataque de Inferencia de Membresía (MIA) (0 - 1.0)

    ¿Qué mide? Tasa de éxito (medida en AUC-ROC) de un atacante para determinar si un registro específico pertenece al conjunto de datos original.

    Interpretación:

    • 0.5: Aleatorio (ideal) → ✅ PRIVACIDAD ÓPTIMA
    • 0.5 - 0.55: Riesgo bajo
    • 0.55 - 0.6: Riesgo moderado → ⚠️ PRIVACIDAD CUESTIONABLE
    • > 0.6: Riesgo alto → 🔴 PRIVACIDAD COMPROMETIDA

    Ejemplo: MIA = 0.553 significa que el atacante tiene un éxito ligeramente superior al 50% aleatorio, lo que indica un riesgo de privacidad bajo/moderado.

    🎯

    Objetivo: Buscar valores lo más cercanos a 0.5. Valores > 0.6 indican que el conjunto sintético no protege adecuadamente la privacidad.

    📝 Resumen Rápido para Selección

    🏆
    Para seleccionar el mejor conjunto:
    • Priorizar TabDSFidelity más alto
    • Buscar AUC-ROC y F1 altos
    • Valores de divergencia JS y KL cercanos a 0
    • P-valor de KS lo más cercano a 1.0 posible (>0.05)
    • Correlación > 0.9
    ⚖️
    Balance entre calidad y tiempo:
    • Un TabDSFidelity > 8.0 indica excelente calidad
    • Tiempos de generación < 200s son aceptables
    • La Correlación > 0.95 asegura buena preservación de relaciones
    🔒
    Para garantizar la privacidad:
    • MIA lo más cercano a 0.5 (ideal)
    • Copias exactas = 0 (ideal) o lo más bajo posible
    • Distancia promedio > 0.02 para buena separación
    • Evaluar balance entre calidad (TabDSFidelity) y privacidad (MIA)

    📥 Descargar conjuntos y código Python

    Formatos incluidos: CSV.

    📚 Cómo citar este conjunto

    Díaz Bastida, M., Pérez Vázquez, R. A., & Bello Pérez, R. (2026). High-Fidelity Synthetic Dataset for Breast Cancer Diagnosis (Mammographic Mass) (Version 1). figshare. https://doi.org/10.6084/m9.figshare.32946752.v1