Conjunto de datos biomédico (Universidad de Oxford) para la clasificación binaria de la Enfermedad de Parkinson (status) mediante el análisis acústico de la voz. Consta de 195 instancias y 22 características continuas que cuantifican la disfonía. Las variables incluyen medidas de frecuencia fundamental, perturbación de micro-temblor (Jitter), variación de amplitud (Shimmer), ruido (NHR/HNR) y, crucialmente, métricas de dinámica no lineal basadas en la teoría del caos (RPDE, D2, DFA) para capturar degradaciones vocales sutiles.
Comparación detallada de las métricas de clasificación para los modelos entrenados con el conjunto de datos original y el conjunto sintético generado.
| Clase | Precisión | Recall | F1-Score | Soporte |
|---|---|---|---|---|
| Clase 0 | 0.35 | 0.60 | 0.44 | 10 |
| Clase 1 | 0.82 | 0.62 | 0.71 | 29 |
| Accuracy | 0.62 | |||
| Macro Avg | 0.59 | 0.61 | 0.58 | 39 |
| Weighted Avg | 0.70 | 0.62 | 0.64 | 39 |
| Clase | Precisión | Recall | F1-Score | Soporte |
|---|---|---|---|---|
| Clase 0 | 0.89 | 0.80 | 0.84 | 10 |
| Clase 1 | 0.93 ⬆ +0.11 | 0.97 ⬆ +0.35 | 0.95 ⬆ +0.24 | 29 |
| Accuracy | 0.92 ⬆ +0.30 | |||
| Macro Avg | 0.91 ⬆ +0.32 | 0.88 ⬆ +0.27 | 0.90 ⬆ +0.32 | 39 |
| Weighted Avg | 0.92 ⬆ +0.22 | 0.92 ⬆ +0.30 | 0.92 ⬆ +0.28 | 39 |
🚀 Mejora espectacular en la clase minoritaria: El modelo sintético transforma completamente el rendimiento en la Clase 0, aumentando la precisión de 0.35 a 0.89 (+0.54), el recall de 0.60 a 0.80 (+0.20) y el F1-Score de 0.44 a 0.84 (+0.40). La accuracy global salta de 0.62 a 0.92 (+0.30) y el AUC-ROC mejora de 0.71 a 0.96 (+0.24), demostrando una capacidad de discriminación excepcional.
El conjunto de datos de Detección de Enfermedad de Parkinson de Oxford está compuesto por un conjunto de mediciones biomédicas de voz de 31 personas, de las cuales 23 tienen enfermedad de Parkinson (PD). Cada columna representa una medida de voz particular, y cada fila corresponde a una de las 195 grabaciones de voz de estos individuos (identificados en la columna "name"). El objetivo principal del dataset es discriminar entre personas sanas y aquellas con enfermedad de Parkinson basándose en la columna "status" (0 = sano, 1 = Parkinson). Existen aproximadamente 6 grabaciones por paciente, lo que permite análisis tanto a nivel de grabación como a nivel de paciente.
Este dataset fue desarrollado por el equipo de Max Little de la Universidad de Oxford como parte de la investigación sobre el uso de mediciones de voz para el telemonitoreo de la enfermedad de Parkinson. La enfermedad de Parkinson afecta el control motor, y la voz es una de las funciones que se ven afectadas tempranamente. Los síntomas vocales incluyen:
Las mediciones se realizaron a partir de grabaciones de voz sostenida de la vocal /a/. Este enfoque no invasivo y de bajo costo tiene el potencial de ser utilizado como herramienta de diagnóstico temprano y monitoreo remoto de la progresión de la enfermedad, especialmente en áreas con acceso limitado a especialistas.
El dataset contiene 197 instancias (195 registros de voz + 1 encabezado) con 22 atributos (21 variables predictoras y 1 variable objetivo). Las características son de tipo continuo (real) y no presentan valores faltantes. Los datos están en formato ASCII CSV.
| Variable | Tipo | Descripción | Unidades |
|---|---|---|---|
| name | ID Categórica | Nombre del sujeto y número de grabación | - |
| MDVP:Fo | Continuo | Frecuencia fundamental vocal promedio | Hz |
| MDVP:Fhi | Continuo | Frecuencia fundamental vocal máxima | Hz |
| MDVP:Flo | Continuo | Frecuencia fundamental vocal mínima | Hz |
| MDVP:Jitter(%) | Continuo | Variación en frecuencia fundamental (porcentaje) | % |
| MDVP:Jitter(Abs) | Continuo | Variación absoluta en frecuencia fundamental | Abs |
| MDVP:RAP | Continuo | Amplitud de perturbación relativa | - |
| MDVP:PPQ | Continuo | Cociente de perturbación de período | - |
| Jitter:DDP | Continuo | Diferencia de diferencias de período | - |
| MDVP:Shimmer | Continuo | Variación en amplitud | - |
| MDVP:Shimmer(dB) | Continuo | Variación en amplitud (decibelios) | dB |
| Shimmer:APQ3 | Continuo | Cociente de perturbación de amplitud (3 puntos) | - |
| Shimmer:APQ5 | Continuo | Cociente de perturbación de amplitud (5 puntos) | - |
| MDVP:APQ | Continuo | Cociente de perturbación de amplitud | - |
| Shimmer:DDA | Continuo | Diferencia de diferencias de amplitud | - |
| NHR | Continuo | Cociente de ruido a componentes tonales | - |
| HNR | Continuo | Cociente de tono a ruido | - |
| status | Binaria (Target) | Estado de salud: 0 = sano, 1 = Parkinson | - |
| RPDE | Continuo | Medida de complejidad dinámica no lineal | - |
| DFA | Continuo | Exponente de escala fractal de la señal | - |
| spread1 | Continuo | Medida no lineal de variación de frecuencia fundamental | - |
| spread2 | Continuo | Medida no lineal de variación de frecuencia fundamental | - |
| D2 | Continuo | Medida de complejidad dinámica no lineal | - |
| PPE | Continuo | Medida no lineal de variación de frecuencia fundamental | - |
El artículo fundamental que describe el uso de mediciones de voz para la detección de la enfermedad de Parkinson es:
Little, M. A., McSharry, P. E., Hunter, E. J., & Ramig, L. O. (2008). Suitability of dysphonia measurements for telemonitoring of Parkinson's disease. IEEE Transactions on Biomedical Engineering, 56(4), 1015-1022. https://doi.org/10.1109/TBME.2008.2005954
También se recomienda citar el artículo anterior:
Little, M. A., McSharry, P., Roberts, S., Costello, D., & Moroz, I. (2007). Exploiting Nonlinear Recurrence and Fractal Scaling Properties for Voice Disorder Detection. BioMedical Engineering OnLine, 6(1), 23. https://doi.org/10.1186/1475-925X-6-23
El conjunto de datos ha sido anonimizado para proteger la privacidad de los participantes. Los nombres de los sujetos en la columna name han sido codificados para evitar la identificación personal. Restricción de confidencialidad: En cumplimiento de los protocolos de privacidad, el uso de los datos está restringido a fines académicos y de investigación. La publicación de resultados debe limitarse a métricas de evaluación, resultados agregados y metodología del modelo, sin divulgación de información que permita la reidentificación de pacientes.
Este conjunto de datos es ampliamente utilizado como referencia en problemas de clasificación biomédica y procesamiento de señales. Se recomienda:
name del modelado por ser un identificador único sin valor predictivostatus está codificada como 0 (sano) y 1 (Parkinson)La enfermedad de Parkinson es un trastorno neurodegenerativo progresivo que afecta aproximadamente a 10 millones de personas en todo el mundo. Se caracteriza por síntomas motores como temblores, rigidez y bradicinesia, así como por síntomas no motores. El diagnóstico temprano es crucial para:
Las mediciones de voz ofrecen una herramienta no invasiva, de bajo costo y accesible para el cribado y monitoreo de la enfermedad de Parkinson, especialmente en regiones con acceso limitado a neurólogos. Este dataset ha sido fundamental para demostrar el potencial del análisis acústico como biomarcador de la enfermedad.
Little, M. A., McSharry, P. E., Hunter, E. J., & Ramig, L. O. (2008). Suitability of dysphonia measurements for telemonitoring of Parkinson's disease. IEEE Transactions on Biomedical Engineering, 56(4), 1015-1022. https://doi.org/10.1109/TBME.2008.2005954
📊 Resultado: Dataset de 195 pacientes con 22 variables predictoras numéricas continuas (derivadas de mediciones de voz) y 1 variable objetivo binaria (status). Desbalance moderado (~75% casos Parkinson / ~25% controles sanos) — escenario ideal para validación de técnicas de generación de datos sintéticos y evaluación del índice TabDSFidelity en contextos de enfermedades neurodegenerativas con alta dimensionalidad y correlación entre variables.
🏥 Fuente: Parkinsons Dataset (UCI Machine Learning Repository) - Creado por Max A. Little et al. (2007).
🗣️ Método de recolección: Mediciones de voz extraídas de grabaciones de pacientes que sostienen la vocal "a" durante varios segundos, utilizando el software Praat para análisis acústico.
📁 Leyenda disponible: Archivo leyenda_parkinsons.txt con descripción completa de la variable objetivo y agrupación de características biomédicas.
🎯 Variable objetivo: status (1 = Enfermedad de Parkinson - PD, 0 = Sano/Control).
📈 Características clave: Alta correlación entre variables (jitter, shimmer, medidas de frecuencia), adecuada para evaluar técnicas de reducción de dimensionalidad y generación de datos sintéticos que preserven correlaciones complejas.
| Variable | Descripción Clínica | Tipo | Rango / Categorías | Unidad | ¿Objetivo? |
|---|---|---|---|---|---|
status |
Estado de salud (diagnóstico de Parkinson) | Binario | 0: Sano, 1: Parkinson (PD) | N/A | Sí |
MDVP:Fo(Hz) |
Frecuencia fundamental media (tono promedio) | Numérico | 88.33 - 260.11 | Hz | No |
MDVP:Fhi(Hz) |
Frecuencia fundamental máxima | Numérico | 102.15 - 592.03 | Hz | No |
MDVP:Flo(Hz) |
Frecuencia fundamental mínima | Numérico | 65.48 - 239.17 | Hz | No |
MDVP:Jitter(%) |
Jitter porcentual (variación ciclo a ciclo del tono) | Numérico | 0.0017 - 0.0332 | % | No |
MDVP:Jitter(Abs) |
Jitter absoluto (variación absoluta del tono) | Numérico | 7.0e-6 - 0.00026 | s | No |
MDVP:RAP |
Amplitud de perturbación relativa (variación de tono) | Numérico | 0.00068 - 0.02144 | N/A | No |
MDVP:PPQ |
Índice de perturbación del tono (variación de tono) | Numérico | 0.00092 - 0.01958 | N/A | No |
Jitter:DDP |
Diferencia de período a período (variación de tono) | Numérico | 0.00204 - 0.06433 | N/A | No |
MDVP:Shimmer |
Shimmer (variación ciclo a ciclo de la amplitud) | Numérico | 0.00954 - 0.11908 | % | No |
MDVP:Shimmer(dB) |
Shimmer en decibelios | Numérico | 0.085 - 1.302 | dB | No |
Shimmer:APQ3 |
Amplitud de perturbación (3 puntos) | Numérico | 0.00455 - 0.05647 | N/A | No |
Shimmer:APQ5 |
Amplitud de perturbación (5 puntos) | Numérico | 0.00570 - 0.07940 | N/A | No |
MDVP:APQ |
Índice de perturbación de amplitud | Numérico | 0.00719 - 0.13778 | N/A | No |
Shimmer:DDA |
Amplitud de diferencia de período | Numérico | 0.01364 - 0.16942 | N/A | No |
NHR |
Relación Ruido-Armónico (ruido en la voz) | Numérico | 0.00072 - 0.31482 | N/A | No |
HNR |
Relación Armónico-Ruido (calidad tonal) | Numérico | 8.441 - 32.684 | dB | No |
RPDE |
Entropía de densidad de periodo de recurrencia | Numérico | 0.25657 - 0.67713 | N/A | No |
DFA |
Análisis de fluctuación sin tendencia (escala fractal) | Numérico | 0.57428 - 0.82348 | N/A | No |
spread1 |
Medida no lineal de variación de tono (entropía del periodo) | Numérico | -7.69573 - -2.43403 | N/A | No |
spread2 |
Medida no lineal de variación de tono (entropía del periodo) | Numérico | 0.01869 - 0.45049 | N/A | No |
D2 |
Dimensión de correlación (complejidad fractal) | Numérico | 1.51228 - 3.67116 | N/A | No |
PPE |
Entropía de periodo de tono (no lineal) | Numérico | 0.05614 - 0.52737 | N/A | No |
Esta sección detalla los códigos y significados de las variables categóricas y binarias presentes en el conjunto de datos de Detección de Parkinson (Oxford Parkinson's). Comprender estas codificaciones es fundamental para la correcta interpretación de los resultados clínicos.
status
🎯 Objetivo
| Código | Significado |
|---|---|
| 0 | Sano (Control) - Sujeto sin diagnóstico de Parkinson |
| 1 | Parkinson (PD) - Sujeto diagnosticado con Enfermedad de Parkinson |
Variable Objetivo: El modelo debe clasificar si el sujeto padece Parkinson basándose en características acústicas de la voz.
Contexto clínico: La disfonía (alteración de la voz) es uno de los primeros síntomas de Parkinson, detectable antes que los síntomas motores.
Formato: 0 = Sano, 1 = Parkinson
status
🎯 Variable Objetivo: Diagnóstico de Parkinson (0: Sano, 1: Parkinson)
Nota: Única variable binaria en el dataset.
MDVP:Fhi(Hz) < 150 → MDVP:Fo(Hz) < 150MDVP:Flo(Hz) > 200 → MDVP:Fo(Hz) > 200MDVP:Flo(Hz) > 200 → MDVP:Fhi(Hz) > 200MDVP:RAP > 0.01 → Jitter:DDP > 0.025Shimmer:APQ3 > 0.03 → Shimmer:DDA > 0.08HNR < 10 → NHR > 0.02HNR > 30 → NHR < 0.02NHR > 0.1 → RPDE > 0.3MDVP:Jitter(%) > 0.03 → MDVP:Shimmer > 0.02PPE > 0.35 → status = 1 (Patología)HNR > 33 → status = 0 (Salud)MDVP:Jitter(%) > 0.02 → status = 1 (Disfonía severa)spread1 > -3.0 → status = 1 (Caos vocal)| Valor escala | 0.03 |
|---|---|
| Probabilidad Base | 0.1 |
| epochs | 300 |
|---|---|
| batch_size | 20 |
| generator_lr | 0.0002 |
| discriminator_lr | 0.0002 |
| pac | 2 |
| generator_dim | (64, 64) |
| discriminator_dim | (64, 64) |
| embedding_dim | 128 |
| l2scale | 1e-05 |
| epochs | 300 |
|---|---|
| batch_size | 10 |
| embedding_dim | 32 |
| compress_dims | (32, 32) |
| decompress_dims | (32, 32) |
| l2scale | 1e-5 |
| loss_factor | 2 |
| Random Seed | 42 |
|---|---|
| Python | 3.12.12 |
Para reproducir exactamente este conjunto de datos, ejecute el script de generación con la semilla aleatoria 42.
Los resultados pueden variar ligeramente según la versión de las librerías.
El conjunto original ha sido sometido a un proceso de balanceo de clases y generación sintética para mejorar la representación de clases minoritarias. Nota: se ha empleado un conjunto de validación para evaluar el índice de fidelidad. Se han generado tres familias de conjuntos:
El mejor conjunto de cada etapa fue seleccionado mediante el índice TabDSFidelity.
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Random Oversampling | 1 | 178 | 0.940 | 0.897 | 0.897 | 5.112 | 0.201 | 0.116 | 0.143 | 0.955 | 48.117 | 0 | 178 | 0.309 | |
| Smote | 1 | 178 | 0.929 | 0.893 | 0.897 | 3.028 | 0.366 | 0.070 | 0.143 | 0.945 | 48.331 | 0.006 | 117 | 0.319 | |
| Borderline SMOTE | 1 | 178 | 0.929 | 0.850 | 0.846 | 1.037 | 0.366 | 0.163 | 0.143 | 0.958 | 47.495 | 0.006 | 117 | 0.318 | |
| ADASYN | 1.034 | 181 | 0.938 | 0.870 | 0.872 | 3.695 | 0.372 | 0.259 | 0.152 | 0.972 | 47.994 | 0.007 | 117 | 0.344 | |
| SMOTE RSB* Adaptado | 1.060 | 173 | 0.945 | 0.846 | 0.846 | 2.855 | 0.354 | 0.244 | 0.128 | 0.964 | 41.342 | 0.009 | 117 | 0.309 | |
| SMOTE RSB* Adaptado + Reglas | 1.060 | 173 | 0.926 | 0.846 | 0.846 | 0.699 | 0.355 | 0.181 | 0.128 | 0.961 | 42.320 | 0.009 | 117 | 0.315 | |
| OOF PSO para Balanceo | 3.069 | 118 | 0.936 | 0.918 | 0.923 | 7.750 | 0.030 | 1.000 | 0.000 | 0.965 | 47.034 | 0.002 | 117 | 0.327 | |
| OOF PSO para Balanceo + Reglas | 3.069 | 118 | 0.936 | 0.918 | 0.923 | 8.091 | 0.029 | 1.000 | 0.000 | 0.975 | 48.525 | 0.002 | 117 | 0.323 | 🏆 |
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SMOTE RSB* + Ruido Gaussiano | 2.799 | 7108 | 0.940 | 0.918 | 0.923 | 8.268 | 0.798 | 0.953 | 0.002 | 0.970 | 82.777 | 0.069 | 0 | 0.352 | |
| SMOTE RSB* + Ruido Gaussiano + Reglas | 2.819 | 7108 | 0.952 | 0.918 | 0.923 | 8.374 | 0.798 | 0.953 | 0.001 | 0.970 | 227.018 | 0.069 | 0 | 0.324 | 🏆 |
| CTGAN | 1.293 | 10000 | 0.740 | 0.755 | 0.744 | 1.134 | 0.793 | 0.005 | 0.084 | 0.565 | 157.149 | 0.185 | 0 | 0.694 | |
| CTGAN + Reglas del Dominio | 1.540 | 10000 | 0.810 | 0.733 | 0.718 | 1.259 | 0.793 | 0.005 | 0.053 | 0.566 | 358.802 | 0.185 | 0 | 0.744 | |
| TVAE | 5.361 | 10000 | 0.766 | 0.761 | 0.795 | 3.291 | 0.777 | 0.273 | 0.023 | 0.861 | 144.854 | 0.076 | 0 | 0.410 | |
| TVAE + Reglas del Dominio | 5.361 | 10000 | 0.766 | 0.761 | 0.795 | 3.291 | 0.777 | 0.273 | 0.023 | 0.861 | 340.742 | 0.076 | 0 | 0.410 | |
| OOF PSO para Aumento | 1 | 10000 | 0.910 | 0.853 | 0.846 | 4.474 | 0.811 | 0.000 | 0.143 | 0.645 | 130.968 | 0.206 | 0 | 0.389 | |
| OOF PSO para Aumento + Reglas | 1.118 | 10000 | 0.890 | 0.781 | 0.769 | 2.775 | 0.811 | 0.000 | 0.115 | 0.648 | 317.068 | 0.207 | 0 | 0.332 | |
| SMOTE RSB* Refinado | 1 | 7000 | 0.969 | 0.918 | 0.923 | 6.945 | 0.821 | 0.062 | 0.143 | 0.921 | 79.057 | 0.026 | 0 | 0.347 | |
| SMOTE RSB* Refinado + Reglas | 1 | 7000 | 0.969 | 0.918 | 0.923 | 6.945 | 0.821 | 0.062 | 0.143 | 0.921 | 216.982 | 0.026 | 0 | 0.347 |
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SMOTE RSB* + Ruido Gaussiano | 2.803 | 7226 | 0.972 | 0.918 | 0.923 | 8.497 | 0.779 | 0.955 | 0.001 | 0.970 | 155.972 | 0.069 | 0 | 0.315 | 🏆 |
| SMOTE RSB* + Ruido Gaussiano + Reglas | 2.823 | 7226 | 0.966 | 0.918 | 0.923 | 8.393 | 0.779 | 0.955 | 0.001 | 0.970 | 298.734 | 0.069 | 0 | 0.296 | |
| CTGAN | 1.304 | 10118 | 0.848 | 0.801 | 0.795 | 1.236 | 0.775 | 0.005 | 0.082 | 0.568 | 258.380 | 0.181 | 32 | 0.725 | |
| CTGAN + Reglas del Dominio | 1.551 | 10118 | 0.841 | 0.823 | 0.821 | 1.820 | 0.775 | 0.005 | 0.052 | 0.569 | 460.300 | 0.181 | 32 | 0.731 | |
| TVAE | 5.320 | 10118 | 0.872 | 0.761 | 0.795 | 2.500 | 0.762 | 0.281 | 0.022 | 0.862 | 242.634 | 0.074 | 32 | 0.356 | |
| TVAE + Reglas del Dominio | 5.320 | 10118 | 0.872 | 0.761 | 0.795 | 2.500 | 0.762 | 0.281 | 0.022 | 0.862 | 438.795 | 0.074 | 32 | 0.356 | |
| OOF PSO para Aumento | 1.012 | 10118 | 0.941 | 0.870 | 0.872 | 4.458 | 0.791 | 0.000 | 0.140 | 0.648 | 224.614 | 0.202 | 32 | 0.295 | |
| OOF PSO para Aumento + Reglas | 1.130 | 10118 | 0.940 | 0.874 | 0.872 | 4.492 | 0.791 | 0.000 | 0.113 | 0.651 | 410.048 | 0.203 | 32 | 0.312 | |
| SMOTE RSB* Refinado | 1.017 | 7118 | 0.971 | 0.893 | 0.897 | 6.212 | 0.797 | 0.068 | 0.138 | 0.922 | 149.179 | 0.026 | 40 | 0.366 | |
| SMOTE RSB* Refinado + Reglas | 1.017 | 7118 | 0.971 | 0.893 | 0.897 | 6.212 | 0.797 | 0.068 | 0.138 | 0.922 | 285.027 | 0.026 | 40 | 0.366 |
Para interpretar correctamente los resultados de los conjuntos de datos generados, es fundamental comprender qué mide cada métrica y cómo se relacionan entre sí. A continuación, se detalla cada una de las métricas utilizadas en la evaluación:
¿Qué mide? Capacidad del modelo para distinguir entre clases (Ej: mortalidad vs supervivencia).
Interpretación:
Ejemplo: AUC-ROC = 0.82 significa que hay un 82% de probabilidad de que el modelo clasifique correctamente un paciente fallecido frente a uno superviviente.
¿Qué mide? Media armónica entre precisión y sensibilidad (recall).
Interpretación:
Ejemplo: F1 = 0.76 indica que el modelo mantiene un buen balance entre identificar correctamente a los pacientes que fallecen (sensibilidad) y no etiquetar erróneamente a los que sobreviven (precisión).
¿Qué mide? Proporción de predicciones correctas sobre el total.
Interpretación:
Ejemplo: Accuracy = 0.75 significa que el 75% de las predicciones del modelo son correctas.
⚠️ Nota: En conjuntos desbalanceados, esta métrica puede ser engañosa. Es mejor usar F1-Score o AUC-ROC.
¿Qué mide? Calidad global del conjunto sintético comparado con el original.
Interpretación:
Ejemplo: TabDSFidelity = 8.08 indica que el conjunto sintético mantiene una alta similitud con el original, preservando las relaciones y distribuciones de los datos reales, además de maximizar su eficacia predictiva.
💡 Importante: Este es el índice para seleccionar el mejor conjunto de datos sintéticos. Para este caso, el peso empleado para las métricas "AUC-ROC", "F1-Score" y "Accuracy" fue (2) y para el resto de las métricas fue (1).
¿Qué mide? Similitud entre las distribuciones de variables numéricas del conjunto sintético y el original.
Interpretación:
Ejemplo: JS = 0.118 indica que las distribuciones de las variables numéricas (edad, presión arterial, etc.) son bastante similares a las del conjunto original.
📌 Nota: Es el promedio de la divergencia de Jensen-Shannon calculada para todas las variables numéricas.
¿Qué mide? Probabilidad estadística de que las muestras numéricas del conjunto sintético provengan de la misma distribución continua que el original.
Interpretación:
Ejemplo: KS p-valor = 0.753 indica que hay evidencia fuerte a favor de que las distribuciones acumulativas de la variable sintética y la original son equivalentes.
📌 Nota: Se reporta el promedio de los p-valores obtenidos mediante la prueba de Kolmogorov-Smirnov de dos muestras para las variables numéricas.
¿Qué mide? Divergencia entre las distribuciones de variables categóricas del conjunto sintético y el original.
Interpretación:
Ejemplo: KL = 0.014 indica que la distribución de las variables categóricas (género, mortalidad) es muy similar a la del conjunto original.
📌 Nota: Es el promedio de la divergencia de Kullback-Leibler para todas las variables categóricas. A diferencia de JS y KS, esta métrica se aplica solo a variables categóricas.
¿Qué mide? Preservación de las relaciones entre variables del conjunto original.
Interpretación:
Ejemplo: Correlación = 0.976 significa que las relaciones entre variables (ej. edad y mortalidad) se mantienen en un 97.6% respecto al conjunto original.
¿Qué mide? Tiempo total de ejecución del proceso de generación del conjunto.
Interpretación:
Ejemplo: Tiempo total = 69.45s significa que el proceso completo de generación del conjunto balanceado tomó aproximadamente 1.16 minutos.
⏱️ Nota: Incluye el tiempo de generación sintética + cálculo de métricas.
Estas métricas evalúan el riesgo de exposición de información sensible y la capacidad de un atacante para inferir datos de los pacientes a partir del conjunto de datos sintéticos.
¿Qué mide? La distancia promedio entre cada registro sintético y su registro más cercano en el conjunto de datos original.
Interpretación:
Ejemplo: Distancia promedio = 0.015 en SMOTE indica que los registros sintéticos están relativamente cerca de los originales, lo que podría implicar un riesgo de privacidad moderado.
Metodología: Calculada utilizando la Distancia de Gower, la cual maneja internamente tipos de datos mixtos, normalizando las variables numéricas y penalizando diferencias categóricas para devolver un índice estandarizado entre 0 y 1.
Recomendación: Valores < 0.01 deben ser evaluados con precaución. Idealmente, buscar valores > 0.02 para garantizar la privacidad.
¿Qué mide? Número de registros sintéticos que son copias idénticas de registros en el conjunto de datos original.
Interpretación:
Ejemplo: SMOTE RSB* Refinado genera 76 copias exactas de 8817 registros (0.86%), lo que representa un riesgo de privacidad que debe ser evaluado.
Importante: La presencia de copias exactas es uno de los indicadores más críticos de fuga de datos. Idealmente, este valor debe ser 0.
¿Qué mide? Tasa de éxito (medida en AUC-ROC) de un atacante para determinar si un registro específico pertenece al conjunto de datos original.
Interpretación:
Ejemplo: MIA = 0.553 significa que el atacante tiene un éxito ligeramente superior al 50% aleatorio, lo que indica un riesgo de privacidad bajo/moderado.
Objetivo: Buscar valores lo más cercanos a 0.5. Valores > 0.6 indican que el conjunto sintético no protege adecuadamente la privacidad.
Formatos incluidos: CSV.
Díaz Bastida, M., Pérez Vázquez, R. A., & Bello Pérez, R. (2026). High-Fidelity Synthetic Dataset for Parkinson's Disease Detection (Version 1). figshare. https://doi.org/10.6084/m9.figshare.32933759.v1