Conjunto de datos radiológico para la clasificación binaria de la severidad de masas mamarias. Integra atributos morfológicos (forma, margen) con ordinalidad implícita y datos demográficos procesados por imputación.
Comparación detallada de las métricas de clasificación para los modelos entrenados con el conjunto de datos original y el conjunto sintético generado.
| Clase | Precisión | Recall | F1-Score | Soporte |
|---|---|---|---|---|
| Clase 0 | 0.84 | 0.80 | 0.82 | 104 |
| Clase 1 | 0.78 | 0.82 | 0.80 | 89 |
| Accuracy | 0.81 | |||
| Macro Avg | 0.81 | 0.81 | 0.81 | 193 |
| Weighted Avg | 0.81 | 0.81 | 0.81 | 193 |
| Clase | Precisión | Recall | F1-Score | Soporte |
|---|---|---|---|---|
| Clase 0 | 0.89 | 0.71 | 0.79 | 104 |
| Clase 1 | 0.73 ⬇ -0.05 | 0.90 ⬆ +0.08 | 0.80 — | 89 |
| Accuracy | 0.80 ⬇ -0.01 | |||
| Macro Avg | 0.81 — | 0.81 — | 0.80 ⬇ -0.01 | 193 |
| Weighted Avg | 0.82 ⬆ +0.01 | 0.80 ⬇ -0.01 | 0.80 ⬇ -0.01 | 193 |
El conjunto de datos de Masas Mamográficas (Mammographic Mass) está diseñado para la discriminación de masas mamográficas benignas y malignas basada en atributos BI-RADS y la edad del paciente. La mamografía es el método más efectivo para la detección del cáncer de mama disponible actualmente. Sin embargo, el bajo valor predictivo positivo de la biopsia de mama resultante de la interpretación de mamografías conduce a aproximadamente 70% de biopsias innecesarias con resultados benignos. Este conjunto de datos puede utilizarse para predecir la severidad (benigna o maligna) de una lesión de masa mamográfica a partir de atributos BI-RADS y la edad del paciente, ayudando a los médicos en su decisión de realizar una biopsia o un seguimiento a corto plazo.
El cáncer de mama es una de las principales causas de muerte en mujeres en todo el mundo. La detección temprana mediante mamografía es crucial para mejorar las tasas de supervivencia. Sin embargo, la interpretación de mamografías tiene una tasa significativa de falsos positivos, lo que lleva a biopsias innecesarias que son costosas, invasivas y causan ansiedad en los pacientes.
Los sistemas CAD (Computer-Aided Diagnosis) han sido propuestos para ayudar a los médicos en la toma de decisiones. Este dataset, recolectado en el Instituto de Radiología de la Universidad de Erlangen-Nuremberg entre 2003 y 2006, contiene datos de mamografías digitales de campo completo con 516 masas benignas y 445 malignas.
BI-RADS (Breast Imaging Reporting and Data System) es un sistema de estandarización para informes de imágenes mamarias. Cada instancia tiene una evaluación BI-RADS que va de 1 (definitivamente benigno) a 5 (altamente sugestivo de malignidad), asignada en un proceso de doble revisión por médicos.
Asumiendo que todos los casos con evaluaciones BI-RADS ≥ un valor dado (1-5) son malignos, se pueden calcular sensibilidades y especificidades para comparar el rendimiento de los sistemas CAD con el de los radiólogos.
El dataset contiene 961 instancias con 5 atributos (4 variables predictoras y 1 variable objetivo). Las características son de tipo entero (ordinales y nominales). Presenta valores faltantes en varias variables.
| Variable | Tipo | Descripción | Escala / Categorías | Valores Faltantes |
|---|---|---|---|---|
| A. Variables Predictoras | ||||
| BI-RADS | Ordinal | Evaluación BI-RADS de la masa | 1-5 (1 = definitivamente benigno, 5 = altamente sugestivo de malignidad) | 2 |
| Age | Entero | Edad del paciente | años | 5 |
| Shape | Nominal | Forma de la masa | 1 = redonda, 2 = oval, 3 = lobulada, 4 = irregular | 31 |
| Margin | Nominal | Margen de la masa | 1 = circunscrito, 2 = microlobulado, 3 = oscurecido, 4 = mal definido, 5 = espiculado | 48 |
| Density | Ordinal | Densidad de la masa | 1 = alta, 2 = iso, 3 = baja, 4 = contiene grasa | 76 |
| B. Variable Objetivo | ||||
| Severity | Binaria (Target) | Resultado de la biopsia | 0 = benigno, 1 = maligno | 0 |
| Clase | Instancias | Porcentaje | Descripción |
|---|---|---|---|
| Benigna (0) | 516 | 53.7% | Resultado benigno de biopsia |
| Maligna (1) | 445 | 46.3% | Resultado maligno de biopsia |
El dataset está relativamente balanceado entre clases benignas y malignas.
| Variable | Valores Faltantes | Porcentaje de Faltantes |
|---|---|---|
| BI-RADS | 2 | 0.2% |
| Age | 5 | 0.5% |
| Shape | 31 | 3.2% |
| Margin | 48 | 5.0% |
| Density | 76 | 7.9% |
⚠️ La variable Density tiene el mayor número de valores faltantes (7.9%).
El artículo fundamental que describe la predicción de resultados de biopsias de mama utilizando dos enfoques CAD es:
Elter, M., Schulz-Wendtland, R., & Wittenberg, T. (2007). The prediction of breast cancer biopsy outcomes using two CAD approaches that both emphasize an intelligible decision process. Medical Physics, 34(11), 4164-4172. https://doi.org/10.1118/1.2814240
El conjunto de datos ha sido anonimizado para proteger la privacidad de los pacientes. No contiene información personal identificable como nombres, direcciones o números de identificación. Los datos fueron recolectados con fines de investigación en el Instituto de Radiología de la Universidad de Erlangen-Nuremberg. Restricción de confidencialidad: El uso de los datos está restringido a fines académicos y de investigación. La publicación de resultados debe limitarse a métricas de evaluación, resultados agregados y metodología del modelo, sin divulgación de información que permita la reidentificación de pacientes.
Este conjunto de datos es ideal para clasificación médica y sistemas CAD. Se recomienda:
El cáncer de mama es el cáncer más común en mujeres en todo el mundo, con aproximadamente 2.3 millones de casos nuevos y 685,000 muertes en 2020, según la Organización Mundial de la Salud. La detección temprana a través de mamografía es fundamental para:
Los sistemas CAD basados en este dataset pueden ayudar a los médicos a decidir si realizar una biopsia o un seguimiento a corto plazo, mejorando la precisión diagnóstica y reduciendo procedimientos innecesarios.
Elter, M., Schulz-Wendtland, R., & Wittenberg, T. (2007). The prediction of breast cancer biopsy outcomes using two CAD approaches that both emphasize an intelligible decision process. Medical Physics, 34(11), 4164-4172. https://doi.org/10.1118/1.2814240
📊 Resultado: Dataset de 961 pacientes con masas mamarias con 5 variables predictoras (evaluación radiológica, edad, forma, margen, densidad) y 1 variable objetivo binaria (Severity). Desbalance moderado (~54% benignas / ~46% malignas) — escenario ideal para validación de técnicas de generación de datos sintéticos y evaluación del índice TabDSFidelity en contextos de diagnóstico por imagen y detección temprana de cáncer de mama, donde las características morfológicas de las masas y la evaluación radiológica son determinantes.
🩺 Fuente: Mammographic Masses Dataset (UCI Machine Learning Repository) - Datos de masas mamarias para clasificación benigno/maligno.
📊 BI_RADS_assessment (1-5): Escala de evaluación radiológica — mayor valor = mayor sospecha de malignidad (variable más predictiva).
🔬 Variables morfológicas: Shape (forma de la masa, 1-4), Margin (margen, 1-5), Density (densidad, 1-4) — todas con significado clínico documentado.
👤 Variable demográfica: Age (edad del paciente en años) — imputada con mediana.
📁 Leyenda disponible: Archivo leyenda_mammographic.txt con descripción completa de variables ordinales y sus escalas clínicas.
🎯 Variable objetivo: Severity (1 = Maligno/Canceroso, 0 = Benigno/No canceroso).
🧹 Limpieza aplicada: Tratamiento de '?' como NaN, imputación con mediana (Age) y moda (BI_RADS, Shape, Margin, Density), estandarización de tipos a int.
| Variable | Descripción Mamográfica | Tipo | Rango / Categorías | Unidad | ¿Objetivo? |
|---|---|---|---|---|---|
BI_RADS_assessment |
Evaluación BI-RADS del radiólogo (escala de sospecha) | Categórico | 0, 2, 3, 4, 5, 6 (ver leyenda) | N/A | No |
Shape |
Forma de la masa mamaria | Categórico | 1: Redonda, 2: Oval, 3: Lobular, 4: Irregular | N/A | No |
Margin |
Margen de la masa mamaria | Categórico | 1: Circunscrito, 2: Microlobulado, 3: Oscurecido, 4: Mal definido, 5: Espiculado | N/A | No |
Density |
Densidad de la masa mamaria | Categórico | 1: Alta, 2: Iso, 3: Baja, 4: Contiene grasa | N/A | No |
Age |
Edad del paciente | Numérico | 18 - 96 | años | No |
Severity |
Severidad de la masa mamaria (objetivo) | Binario | 0: Benigno, 1: Maligno | N/A | Sí |
Esta sección detalla los códigos y significados de las variables categóricas y binarias presentes en el conjunto de datos de Masas Mamográficas (Mammographic Masses). Comprender estas codificaciones es fundamental para la correcta interpretación de los resultados de diagnóstico de cáncer de mama.
BI_RADS_assessment
Categórica (Ordinal)
Evaluación BI-RADS (Breast Imaging Reporting and Data System)
| Código | Significado | Riesgo de Malignidad |
|---|---|---|
| 0 | Incompleto (Necesita evaluación adicional) | - |
| 2 | Benigno (Hallazgos claramente benignos) | ✓ Muy bajo (<2%) |
| 3 | Probablemente benigno (Seguimiento corto plazo) | ✓ Bajo (~2%) |
| 4 | Sospechoso (Recomendación de biopsia) | ⚠ Moderado (~23-34%) |
| 5 | Altamente sospechoso de malignidad | ✗ Alto (>95%) |
| 6 | Malignidad conocida (confirmado por biopsia) | ✗ Muy alto (100%) |
Factor clave: BI-RADS es el predictor más fuerte de malignidad. Códigos 4 y 5 requieren biopsia.
Shape
Categórica (Ordinal)
| Código | Significado | Riesgo de Malignidad |
|---|---|---|
| 1 | Redonda (Round) | ✓ Bajo |
| 2 | Oval (Oval) | ✓ Bajo |
| 3 | Lobular (Lobular) | ⚠ Moderado |
| 4 | Irregular (Irregular) | ✗ Alto |
Interpretación: Formas más irregulares y lobulares son más sospechosas de malignidad.
Margin
Categórica (Ordinal)
| Código | Significado | Riesgo de Malignidad |
|---|---|---|
| 1 | Circunscrito (Circumscribed) | ✓ Muy bajo |
| 2 | Microlobulado (Microlobulated) | ⚠ Moderado |
| 3 | Oscurecido (Obscured) | ⚠ Moderado |
| 4 | Mal definido (Ill-defined) | ✗ Alto |
| 5 | Espiculado (Spiculated) | ✗ Muy alto |
Interpretación: Margen espiculado (5) es altamente sugestivo de cáncer infiltrante.
Density
Categórica (Ordinal)
| Código | Significado | Riesgo de Malignidad |
|---|---|---|
| 1 | Alta densidad (High) | ⚠ Moderado |
| 2 | Iso densidad (Iso) | ✓ Bajo |
| 3 | Baja densidad (Low) | ✓ Bajo |
| 4 | Contiene grasa (Fat-containing) | ✓ Muy bajo (Benigno) |
Interpretación: Masas con contenido graso (4) son casi siempre benignas. Alta densidad (1) puede oscurecer lesiones.
Severity
🎯 Objetivo
| Código | Significado |
|---|---|
| 0 | Benigno - Masa no cancerosa (53.7%) |
| 1 | Maligno - Masa cancerosa (46.3%) |
Variable Objetivo: Clasifica la severidad de la masa mamaria como benigna o maligna.
BI_RADS_assessment - Códigos 4+ son altamente predictivos de malignidadShape = 4 (Irregular) es la forma más asociada a cáncerMargin = 5 (Espiculado) es un hallazgo clásico de cáncer infiltranteDensity = 4 (Contiene grasa) casi siempre benignoMargin == 5 → BI_RADS_assessment = 5 (Margen irregular → BI-RADS 5)Margin == 5 → Severity = 1 (Margen irregular → severidad alta)Shape == 4 → BI_RADS_assessment ≥ 4 (Forma irregular → BI-RADS ≥4)Shape == 4 → Severity = 1 (Forma irregular → severidad alta)Margin == 1 → BI_RADS_assessment ≠ 5 (Margen bien definido → BI-RADS no 5)Margin == 1 → Severity = 0 (Margen bien definido → severidad baja)Shape == 1 → Severity = 0 (Forma bien definida → severidad baja)BI_RADS_assessment == 6 → Severity = 1BI_RADS_assessment == 5 → Severity = 1BI_RADS_assessment == 2 → Severity = 0Margin == 3 → Density ≤ 2Age > 85 → Density ≠ 1Severity == 1 → Age ≥ 25BI_RADS_assessment == 4 → (Shape ≥ 3) OR (Margin ≥ 3)Severity == 0 → Margin ≠ 5| Valor escala | 0.03 |
|---|---|
| Probabilidad Base | 0.1 |
| epochs | 500 |
|---|---|
| batch_size | 50 |
| generator_lr | 0.0002 |
| discriminator_lr | 0.0002 |
| pac | 10 |
| generator_dim | (256, 256) |
| discriminator_dim | (256, 256) |
| embedding_dim | 128 |
| l2scale | 1e-05 |
| epochs | 500 |
|---|---|
| batch_size | 50 |
| embedding_dim | 128 |
| compress_dims | (128, 128) |
| decompress_dims | (128, 128) |
| l2scale | 1e-5 |
| loss_factor | 2 |
| Random Seed | 42 |
|---|---|
| Python | 3.12.12 |
Para reproducir exactamente este conjunto de datos, ejecute el script de generación con la semilla aleatoria 42.
Los resultados pueden variar ligeramente según la versión de las librerías.
El conjunto original ha sido sometido a un proceso de balanceo de clases y generación sintética para mejorar la representación de clases minoritarias. Nota: se ha empleado un conjunto de validación para evaluar el índice de fidelidad. Se han generado tres familias de conjuntos:
El mejor conjunto de cada etapa fue seleccionado mediante el índice TabDSFidelity.
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Random Oversampling | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
| Smote | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
| Borderline SMOTE | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
| ADASYN | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
| SMOTE RSB* Adaptado | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
| SMOTE RSB* Adaptado + Reglas | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
| OOF PSO para Balanceo | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
| OOF PSO para Balanceo + Reglas | - | - | - | - | - | - | - | - | - | - | - | - | - | - |
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SMOTE RSB* + Ruido Gaussiano | 1.060 | 3103 | 0.686 | 0.619 | 0.620 | 4.335 | 0.050 | 1.000 | 0.412 | 0.812 | 44.426 | 0.200 | 0 | 0.458 | |
| SMOTE RSB* + Ruido Gaussiano + Reglas | 1.371 | 3103 | 0.864 | 0.828 | 0.828 | 7.443 | 0.050 | 1.000 | 0.380 | 0.830 | 110.056 | 0.162 | 44 | 0.463 | |
| CTGAN | 1.860 | 3572 | 0.495 | 0.470 | 0.510 | 2.416 | 0.139 | 0.000 | 0.152 | 0.873 | 308.721 | 0.087 | 0 | 0.423 | |
| CTGAN + Reglas del Dominio | 1.275 | 3572 | 0.844 | 0.839 | 0.839 | 7.808 | 0.139 | 0.000 | 0.143 | 0.895 | 378.241 | 0.072 | 114 | 0.512 | 🏆 |
| TVAE | 1.029 | 1447 | 0.488 | 0.436 | 0.438 | 1.881 | 0.173 | 0.041 | 0.033 | 0.852 | 157.378 | 0.020 | 0 | 0.480 | |
| TVAE + Reglas del Dominio | 1.106 | 1447 | 0.853 | 0.813 | 0.813 | 7.537 | 0.173 | 0.041 | 0.047 | 0.847 | 221.893 | 0.015 | 256 | 0.471 | |
| OOF PSO para Aumento | 1.521 | 8287 | 0.805 | 0.781 | 0.781 | 5.433 | 0.662 | 0.000 | 1.290 | 0.652 | 247.029 | 0.210 | 4 | 0.447 | |
| OOF PSO para Aumento + Reglas | 1.477 | 8287 | 0.864 | 0.795 | 0.797 | 5.600 | 0.662 | 0.000 | 1.258 | 0.537 | 320.156 | 0.155 | 13 | 0.469 | |
| SMOTE RSB* Refinado | 1 | 3758 | 0.571 | 0.515 | 0.516 | 2.787 | 0.057 | 0.981 | 0.306 | 0.818 | 41.169 | 0.172 | 0 | 0.514 | |
| SMOTE RSB* Refinado + Reglas | 1.344 | 3758 | 0.852 | 0.839 | 0.839 | 7.596 | 0.057 | 0.981 | 0.279 | 0.842 | 108.754 | 0.139 | 104 | 0.488 |
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SMOTE RSB* + Ruido Gaussiano | 1.083 | 4064 | 0.981 | 0.906 | 0.906 | 5.834 | 0.039 | 1.000 | 0.248 | 0.855 | 78.105 | 0.151 | 475 | 0.448 | |
| SMOTE RSB* + Ruido Gaussiano + Reglas | 1.227 | 4064 | 0.979 | 0.906 | 0.906 | 5.754 | 0.039 | 1.000 | 0.226 | 0.872 | 143.182 | 0.124 | 513 | 0.473 | |
| CTGAN | 1.676 | 4533 | 0.965 | 0.890 | 0.891 | 2.960 | 0.114 | 0.000 | 0.100 | 0.901 | 344.440 | 0.069 | 423 | 0.520 | |
| CTGAN + Reglas del Dominio | 1.173 | 4533 | 0.977 | 0.891 | 0.891 | 4.172 | 0.114 | 0.000 | 0.095 | 0.920 | 413.396 | 0.058 | 512 | 0.479 | |
| TVAE | 1.079 | 2408 | 0.970 | 0.880 | 0.880 | 2.475 | 0.108 | 0.370 | 0.013 | 0.920 | 190.434 | 0.012 | 810 | 0.532 | |
| TVAE + Reglas del Dominio | 1.002 | 2408 | 0.976 | 0.891 | 0.891 | 4.168 | 0.108 | 0.370 | 0.013 | 0.925 | 254.842 | 0.008 | 1031 | 0.459 | |
| OOF PSO para Aumento | 1.478 | 9248 | 0.986 | 0.917 | 0.917 | 6.291 | 0.593 | 0.000 | 0.790 | 0.684 | 283.291 | 0.187 | 214 | 0.446 | 🏆 |
| OOF PSO para Aumento + Reglas | 1.440 | 9248 | 0.986 | 0.917 | 0.917 | 6.089 | 0.593 | 0.000 | 0.721 | 0.580 | 358.075 | 0.139 | 223 | 0.447 | |
| SMOTE RSB* Refinado | 1.031 | 4719 | 0.976 | 0.901 | 0.901 | 4.908 | 0.045 | 0.999 | 0.205 | 0.854 | 75.334 | 0.136 | 418 | 0.428 | |
| SMOTE RSB* Refinado + Reglas | 1.227 | 4719 | 0.978 | 0.901 | 0.901 | 5.114 | 0.045 | 0.999 | 0.186 | 0.875 | 144.801 | 0.110 | 495 | 0.479 |
Para interpretar correctamente los resultados de los conjuntos de datos generados, es fundamental comprender qué mide cada métrica y cómo se relacionan entre sí. A continuación, se detalla cada una de las métricas utilizadas en la evaluación:
¿Qué mide? Capacidad del modelo para distinguir entre clases (Ej: mortalidad vs supervivencia).
Interpretación:
Ejemplo: AUC-ROC = 0.82 significa que hay un 82% de probabilidad de que el modelo clasifique correctamente un paciente fallecido frente a uno superviviente.
¿Qué mide? Media armónica entre precisión y sensibilidad (recall).
Interpretación:
Ejemplo: F1 = 0.76 indica que el modelo mantiene un buen balance entre identificar correctamente a los pacientes que fallecen (sensibilidad) y no etiquetar erróneamente a los que sobreviven (precisión).
¿Qué mide? Proporción de predicciones correctas sobre el total.
Interpretación:
Ejemplo: Accuracy = 0.75 significa que el 75% de las predicciones del modelo son correctas.
⚠️ Nota: En conjuntos desbalanceados, esta métrica puede ser engañosa. Es mejor usar F1-Score o AUC-ROC.
¿Qué mide? Calidad global del conjunto sintético comparado con el original.
Interpretación:
Ejemplo: TabDSFidelity = 8.08 indica que el conjunto sintético mantiene una alta similitud con el original, preservando las relaciones y distribuciones de los datos reales, además de maximizar su eficacia predictiva.
💡 Importante: Este es el índice para seleccionar el mejor conjunto de datos sintéticos. Para este caso, el peso empleado para las métricas "AUC-ROC", "F1-Score" y "Accuracy" fue (2) y para el resto de las métricas fue (1).
¿Qué mide? Similitud entre las distribuciones de variables numéricas del conjunto sintético y el original.
Interpretación:
Ejemplo: JS = 0.118 indica que las distribuciones de las variables numéricas (edad, presión arterial, etc.) son bastante similares a las del conjunto original.
📌 Nota: Es el promedio de la divergencia de Jensen-Shannon calculada para todas las variables numéricas.
¿Qué mide? Probabilidad estadística de que las muestras numéricas del conjunto sintético provengan de la misma distribución continua que el original.
Interpretación:
Ejemplo: KS p-valor = 0.753 indica que hay evidencia fuerte a favor de que las distribuciones acumulativas de la variable sintética y la original son equivalentes.
📌 Nota: Se reporta el promedio de los p-valores obtenidos mediante la prueba de Kolmogorov-Smirnov de dos muestras para las variables numéricas.
¿Qué mide? Divergencia entre las distribuciones de variables categóricas del conjunto sintético y el original.
Interpretación:
Ejemplo: KL = 0.014 indica que la distribución de las variables categóricas (género, mortalidad) es muy similar a la del conjunto original.
📌 Nota: Es el promedio de la divergencia de Kullback-Leibler para todas las variables categóricas. A diferencia de JS y KS, esta métrica se aplica solo a variables categóricas.
¿Qué mide? Preservación de las relaciones entre variables del conjunto original.
Interpretación:
Ejemplo: Correlación = 0.976 significa que las relaciones entre variables (ej. edad y mortalidad) se mantienen en un 97.6% respecto al conjunto original.
¿Qué mide? Tiempo total de ejecución del proceso de generación del conjunto.
Interpretación:
Ejemplo: Tiempo total = 69.45s significa que el proceso completo de generación del conjunto balanceado tomó aproximadamente 1.16 minutos.
⏱️ Nota: Incluye el tiempo de generación sintética + cálculo de métricas.
Estas métricas evalúan el riesgo de exposición de información sensible y la capacidad de un atacante para inferir datos de los pacientes a partir del conjunto de datos sintéticos.
¿Qué mide? La distancia promedio entre cada registro sintético y su registro más cercano en el conjunto de datos original.
Interpretación:
Ejemplo: Distancia promedio = 0.015 en SMOTE indica que los registros sintéticos están relativamente cerca de los originales, lo que podría implicar un riesgo de privacidad moderado.
Metodología: Calculada utilizando la Distancia de Gower, la cual maneja internamente tipos de datos mixtos, normalizando las variables numéricas y penalizando diferencias categóricas para devolver un índice estandarizado entre 0 y 1.
Recomendación: Valores < 0.01 deben ser evaluados con precaución. Idealmente, buscar valores > 0.02 para garantizar la privacidad.
¿Qué mide? Número de registros sintéticos que son copias idénticas de registros en el conjunto de datos original.
Interpretación:
Ejemplo: SMOTE RSB* Refinado genera 76 copias exactas de 8817 registros (0.86%), lo que representa un riesgo de privacidad que debe ser evaluado.
Importante: La presencia de copias exactas es uno de los indicadores más críticos de fuga de datos. Idealmente, este valor debe ser 0.
¿Qué mide? Tasa de éxito (medida en AUC-ROC) de un atacante para determinar si un registro específico pertenece al conjunto de datos original.
Interpretación:
Ejemplo: MIA = 0.553 significa que el atacante tiene un éxito ligeramente superior al 50% aleatorio, lo que indica un riesgo de privacidad bajo/moderado.
Objetivo: Buscar valores lo más cercanos a 0.5. Valores > 0.6 indican que el conjunto sintético no protege adecuadamente la privacidad.
Formatos incluidos: CSV.
Díaz Bastida, M., Pérez Vázquez, R. A., & Bello Pérez, R. (2026). High-Fidelity Synthetic Dataset for Breast Cancer Diagnosis (Mammographic Mass) (Version 1). figshare. https://doi.org/10.6084/m9.figshare.32946752.v1