Matriz analítica del estudio poblacional NHANES para la predicción de Hipertensión Arterial (Hypertension_Diagnosis). Integra ~9,800 registros y 16 variables: 1) Demografía (edad, etnia, nivel socioeconómico); 2) Antropometría/Vitales (IMC, cintura, lecturas actuales de presión sistólica/diastólica); 3) Biomarcadores (creatinina sérica como indicador renal, lípidos); y 4) Nutrición/Hábitos (ingesta crítica de Sodio/Potasio, alcohol, tabaco).
Comparación detallada de las métricas de clasificación para los modelos entrenados con el conjunto de datos original y el conjunto sintético generado.
| Clase | Precisión | Recall | F1-Score | Soporte |
|---|---|---|---|---|
| Clase 0 | 0.74 | 0.86 | 0.80 | 133 |
| Clase 1 | 0.59 | 0.39 | 0.47 | 67 |
| Accuracy | 0.70 | |||
| Macro Avg | 0.66 | 0.63 | 0.63 | 200 |
| Weighted Avg | 0.69 | 0.70 | 0.69 | 200 |
| Clase | Precisión | Recall | F1-Score | Soporte |
|---|---|---|---|---|
| Clase 0 | 0.80 | 0.80 | 0.80 | 133 |
| Clase 1 | 0.60 ⬆ +0.01 | 0.60 ⬆ +0.21 | 0.60 ⬆ +0.13 | 67 |
| Accuracy | 0.73 ⬆ +0.03 | |||
| Macro Avg | 0.70 ⬆ +0.04 | 0.70 ⬆ +0.07 | 0.70 ⬆ +0.07 | 200 |
| Weighted Avg | 0.73 ⬆ +0.04 | 0.73 ⬆ +0.03 | 0.73 ⬆ +0.04 | 200 |
La Encuesta Nacional de Examen de Salud y Nutrición (NHANES) es un programa de estudios diseñado para evaluar el estado de salud y nutricional de adultos y niños en Estados Unidos. La encuesta es única en su tipo porque combina entrevistas y exámenes físicos. NHANES es un programa principal del Centro Nacional de Estadísticas de Salud (NCHS), que forma parte de los Centros para el Control y la Prevención de Enfermedades (CDC) y tiene la responsabilidad de producir estadísticas vitales y de salud para la nación.
El programa NHANES comenzó a principios de la década de 1960 y se ha llevado a cabo como una serie de encuestas centradas en diferentes grupos de población o temas de salud. En 1999, la encuesta se convirtió en un programa continuo que tiene un enfoque cambiante en una variedad de mediciones de salud y nutrición para satisfacer las necesidades emergentes. La encuesta examina una muestra representativa a nivel nacional de aproximadamente 5,000 personas cada año, ubicadas en condados de todo el país, de los cuales 15 son visitados cada año.
La entrevista de NHANES incluye preguntas sobre demografía, situación socioeconómica, dieta y salud. El componente de examen consiste en mediciones médicas, dentales y fisiológicas, así como pruebas de laboratorio administradas por personal médico altamente capacitado. Hasta la fecha, miles de hallazgos de investigación han sido publicados utilizando los datos de NHANES.
Incluye una amplia gama de pruebas de laboratorio:
El conjunto de datos NHANES 2013-2014 es una colección integral de múltiples datasets interconectados que cubren diferentes aspectos de la salud y nutrición de la población estadounidense. Cada componente incluye su propio diccionario de variables y se puede acceder a través del sitio web oficial de NHANES.
| Componente | Descripción |
|---|---|
| Demographics | Información demográfica, socioeconómica y de salud |
| Examinations | Mediciones físicas, presión arterial, fuerza muscular, salud oral, gusto y olfato |
| Dietary | Ingesta total de nutrientes (primer día) |
| Laboratory | Pruebas de laboratorio (más de 40 tipos de análisis) |
| Questionnaire | Cuestionarios sobre salud, comportamiento y estilo de vida (más de 40 temas) |
| Medication | Medicamentos recetados |
NHANES es una encuesta gubernamental de EE.UU. que cumple con estrictos protocolos de confidencialidad y privacidad. Todos los identificadores personales son eliminados de los conjuntos de datos públicos para proteger la identidad de los participantes. Los datos están en dominio público y pueden ser utilizados libremente para investigación, con la condición de que se cite adecuadamente a la fuente. El NCHS/CDC ha implementado procedimientos de enmascaramiento de datos para minimizar el riesgo de reidentificación. Restricción de confidencialidad: La publicación de resultados debe limitarse a métricas de evaluación, resultados agregados y metodología del modelo, sin divulgación de información que permita la reidentificación de participantes.
El conjunto de datos NHANES es uno de los recursos más valiosos para la investigación en salud pública. Se recomienda:
NHANES es una de las encuestas de salud más importantes del mundo y ha sido fundamental para:
Los datos de NHANES han sido utilizados en miles de publicaciones científicas y continúan siendo un recurso invaluable para la comunidad de investigación en salud global.
National Center for Health Statistics (NCHS). National Health and Nutrition Examination Survey Data 2013-2014. Hyattsville, MD: U.S. Department of Health and Human Services, Centers for Disease Control and Prevention. https://www.cdc.gov/nchs/nhanes/
train_test_split con random_state=42).📊 Resultado: Dataset reducido mediante muestreo estratificado a 1,000 participantes del ciclo NHANES 2013-2014 con 14 variables predictoras (demográficas, antropométricas, metabólicas, dietéticas y de hábitos) y 1 variable objetivo binaria (Hypertension_Diagnosis). Se mantiene fielmente el desbalance original de clases — escenario ideal para validación de técnicas de generación de datos sintéticos y evaluación del índice TabDSFidelity en contextos epidemiológicos con datos complejos y multidimensionales.
🏥 Fuente: National Health and Nutrition Examination Survey (NHANES) 2013-2014 - CDC/NCHS.
🧂 Variables dietéticas clave: Ingesta diaria de sodio (sal), potasio (factor protector), y alcohol — factores críticos en la regulación de la presión arterial.
🔬 Variables clínicas clave: Creatinina sérica (función renal), colesterol total, triglicéridos, índice de masa corporal, circunferencia de cintura, presión arterial sistólica y diastólica.
📁 Leyenda disponible: Archivo leyenda_nhanes_hypertension.txt con mapeo semántico completo de todas las variables categóricas y descripción de variables continuas.
🎯 Variable objetivo: Hypertension_Diagnosis (1 = Diagnosticado con presión arterial alta por doctor, 0 = Sin diagnóstico).
📋 Contexto epidemiológico: Datos representativos de la población civil no institucionalizada de EE. UU., con enfoque en factores nutricionales y metabólicos asociados a la hipertensión.
| Variable | Descripción Clínica | Tipo | Rango / Categorías | Unidad | ¿Objetivo? |
|---|---|---|---|---|---|
Ethnicity |
Origen étnico/racial del participante | Categórico | 1: Mexican American, 2: Other Hispanic, 3: Non-Hispanic White, 4: Non-Hispanic Black, 5: Other Race | N/A | No |
Age |
Edad del participante (censurada en 80) | Numérico | 16 - 80 | años | No |
Family_Income_Ratio |
Índice de pobreza (ratio de ingresos respecto al umbral federal) | Numérico | 0 - 5 | N/A | No |
BMI |
Índice de Masa Corporal | Numérico | 15.4 - 74.1 | kg/m² | No |
Waist_Circumference |
Circunferencia de la cintura (grasa visceral) | Numérico | 65.2 - 177.9 | cm | No |
Systolic_BP_Reading |
Presión arterial sistólica (lectura del examen) | Numérico | 90 - 190 | mm Hg | No |
Diastolic_BP_Reading |
Presión arterial diastólica (lectura del examen) | Numérico | 0 - 98 | mm Hg | No |
Total_Cholesterol |
Colesterol total en sangre | Numérico | 108 - 348 | mg/dL | No |
Serum_Creatinine |
Creatinina sérica (función renal) | Numérico | 0.38 - 6.14 | mg/dL | No |
Triglycerides |
Triglicéridos en sangre | Numérico | 27 - 1,090 | mg/dL | No |
Daily_Sodium_Intake |
Ingesta diaria de sodio (factor clave en hipertensión) | Numérico | 486 - 21,004 | mg | No |
Daily_Potassium_Intake |
Ingesta diaria de potasio (factor protector) | Numérico | 200 - 11,242 | mg | No |
Daily_Alcohol_Intake |
Ingesta diaria de alcohol | Numérico | 0 - 259.8 | gramos | No |
Gender |
Sexo biológico del participante | Binario | 0: Masculino, 1: Femenino | N/A | No |
Smoker_History |
Historial de tabaquismo (>100 cigarrillos en la vida) | Binario | 0: No, 1: Sí | N/A | No |
Hypertension_Diagnosis |
Diagnóstico médico de hipertensión (objetivo) | Binario | 0: No, 1: Sí | N/A | Sí |
Esta sección detalla los códigos y significados de las variables categóricas y binarias presentes en el conjunto de datos de NHANES 2013-2014 para Predicción de Hipertensión. Comprender estas codificaciones es fundamental para la correcta interpretación de los resultados clínicos.
Ethnicity
Categórica
Origen étnico/racial del participante
| Código | Significado |
|---|---|
| 1 | Mexican American (Mexicano-Americano) |
| 2 | Other Hispanic (Otro Hispano) |
| 3 | Non-Hispanic White (Blanco No Hispano) |
| 4 | Non-Hispanic Black (Negro No Hispano) |
| 5 | Other Race (Otra Raza) |
Relevancia: La etnicidad es un factor de riesgo documentado para hipertensión. Non-Hispanic Blacks tienen mayor prevalencia y peor control.
Formato común: 0 = No / Ausencia, 1 = Sí / Presencia
Gender
Sexo (0: Masculino, 1: Femenino)
Smoker_History
Historial de tabaquismo (>100 cigarros en la vida) (0: No, 1: Sí)
Hypertension_Diagnosis
🎯 Variable Objetivo: Hipertensión diagnosticada (0: No, 1: Sí)
Nota: Todas las variables binarias están codificadas como 0 = No y 1 = Sí.
Systolic_BP_Reading > 150 → Diastolic_BP_Reading < 100 (Rigidez arterial → diastólica no alta)Systolic_BP_Reading < 110 → Diastolic_BP_Reading < 90 (Presión de pulso ≥ 20 mmHg)Age > 70 → Systolic_BP_Reading > 95 (Ancianos no tienen hipotensión extrema)Daily_Sodium_Intake > 6000 → Daily_Potassium_Intake > 1500 (Sodio alto → potasio adecuado)Serum_Creatinine > 2.5 → Hypertension_Diagnosis = 1 (Fallo renal → hipertensión)Gender == 1 (Mujer) → Serum_Creatinine < 1.5 (Menor masa muscular → creatinina más baja)Total_Cholesterol < 160 → Smoker_History = 0 (Perfil sano → no fumador)Hypertension_Diagnosis == 0 → Systolic_BP_Reading < 160 (Sin HTA → sin crisis)Age < 14 → Smoker_History = 0 (Menores de 14 sin historial tabáquico)Age < 18 → Daily_Alcohol_Intake = 0 (Menores de 18 sin consumo de alcohol)BMI > 40 → (Hypertension_Diagnosis = 1) OR (Smoker_History = 1)Age > 75 → (Hypertension_Diagnosis = 1) OR (Smoker_History = 1)| Valor escala | 0.03 |
|---|---|
| Probabilidad Base | 0.1 |
| epochs | 500 |
|---|---|
| batch_size | 50 |
| generator_lr | 0.0002 |
| discriminator_lr | 0.0002 |
| pac | 10 |
| generator_dim | (256, 256) |
| discriminator_dim | (256, 256) |
| embedding_dim | 128 |
| l2scale | 1e-05 |
| epochs | 500 |
|---|---|
| batch_size | 50 |
| embedding_dim | 128 |
| compress_dims | (128, 128) |
| decompress_dims | (128, 128) |
| l2scale | 1e-5 |
| loss_factor | 2 |
| Random Seed | 42 |
|---|---|
| Python | 3.12.12 |
Para reproducir exactamente este conjunto de datos, ejecute el script de generación con la semilla aleatoria 42.
Los resultados pueden variar ligeramente según la versión de las librerías.
El conjunto original ha sido sometido a un proceso de balanceo de clases y generación sintética para mejorar la representación de clases minoritarias. Nota: se ha empleado un conjunto de validación para evaluar el índice de fidelidad. Se han generado tres familias de conjuntos:
El mejor conjunto de cada etapa fue seleccionado mediante el índice TabDSFidelity.
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Random Oversampling | 1 | 794 | 0.797 | 0.733 | 0.730 | 6.748 | 0.102 | 0.719 | 0.014 | 0.979 | 58.679 | 0 | 794 | 0.453 | |
| Smote | 1 | 794 | 0.774 | 0.724 | 0.720 | 2.828 | 0.270 | 0.461 | 0.018 | 0.984 | 53.710 | 0.012 | 600 | 0.455 | |
| Borderline SMOTE | 1 | 794 | 0.776 | 0.724 | 0.720 | 3.082 | 0.271 | 0.522 | 0.016 | 0.982 | 52.491 | 0.012 | 601 | 0.465 | |
| ADASYN | 1.068 | 821 | 0.772 | 0.713 | 0.710 | 1.709 | 0.285 | 0.522 | 0.021 | 0.980 | 52.910 | 0.013 | 600 | 0.463 | |
| SMOTE RSB* Adaptado | 1.003 | 793 | 0.772 | 0.730 | 0.725 | 3.539 | 0.226 | 0.530 | 0.015 | 0.985 | 50.497 | 0.013 | 600 | 0.469 | |
| SMOTE RSB* Adaptado + Reglas | 1.003 | 793 | 0.787 | 0.759 | 0.755 | 7.304 | 0.225 | 0.524 | 0.015 | 0.985 | 50.893 | 0.013 | 600 | 0.473 | 🏆 |
| OOF PSO para Balanceo | 1 | 794 | 0.789 | 0.720 | 0.720 | 2.236 | 0.266 | 0.001 | 0.031 | 0.774 | 60.510 | 0.059 | 600 | 0.469 | |
| OOF PSO para Balanceo + Reglas | 1.052 | 794 | 0.795 | 0.750 | 0.750 | 5.461 | 0.260 | 0.004 | 0.022 | 0.799 | 60.378 | 0.067 | 533 | 0.467 |
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SMOTE RSB* + Ruido Gaussiano | 1.023 | 9154 | 0.786 | 0.731 | 0.730 | 7.522 | 0.464 | 0.165 | 0.015 | 0.979 | 95.064 | 0.268 | 0 | 0.495 | |
| SMOTE RSB* + Ruido Gaussiano + Reglas | 1.031 | 9154 | 0.758 | 0.716 | 0.715 | 6.221 | 0.464 | 0.165 | 0.018 | 0.976 | 260.876 | 0.268 | 0 | 0.483 | |
| CTGAN | 1.241 | 10000 | 0.774 | 0.758 | 0.755 | 6.746 | 0.427 | 0.001 | 0.018 | 0.910 | 375.631 | 0.085 | 0 | 0.484 | |
| CTGAN + Reglas del Dominio | 1.004 | 10000 | 0.747 | 0.706 | 0.700 | 4.577 | 0.427 | 0.001 | 0.035 | 0.911 | 541.218 | 0.085 | 0 | 0.500 | |
| TVAE | 1.011 | 10000 | 0.789 | 0.735 | 0.730 | 6.210 | 0.597 | 0.002 | 0.027 | 0.954 | 262.845 | 0.053 | 0 | 0.469 | |
| TVAE + Reglas del Dominio | 1.035 | 10000 | 0.787 | 0.730 | 0.725 | 6.030 | 0.596 | 0.002 | 0.026 | 0.954 | 448.261 | 0.054 | 0 | 0.463 | |
| OOF PSO para Aumento | 1.014 | 9933 | 0.806 | 0.580 | 0.590 | 2.000 | 0.728 | 0.000 | 0.301 | 0.583 | 354.691 | 0.223 | 0 | 0.481 | |
| OOF PSO para Aumento + Reglas | 1.001 | 9933 | 0.790 | 0.582 | 0.590 | 1.629 | 0.718 | 0.000 | 0.302 | 0.623 | 528.847 | 0.212 | 0 | 0.466 | |
| SMOTE RSB* Refinado | 1.004 | 9036 | 0.780 | 0.746 | 0.745 | 7.762 | 0.467 | 0.181 | 0.016 | 0.976 | 92.140 | 0.207 | 0 | 0.422 | 🏆 |
| SMOTE RSB* Refinado + Reglas | 1.041 | 9036 | 0.776 | 0.733 | 0.730 | 7.267 | 0.466 | 0.181 | 0.018 | 0.972 | 265.621 | 0.207 | 0 | 0.418 |
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SMOTE RSB* + Ruido Gaussiano | 1.021 | 9947 | 0.795 | 0.732 | 0.735 | 5.368 | 0.444 | 0.183 | 0.015 | 0.980 | 181.116 | 0.267 | 0 | 0.488 | |
| SMOTE RSB* + Ruido Gaussiano + Reglas | 1.028 | 9947 | 0.769 | 0.724 | 0.725 | 3.029 | 0.443 | 0.183 | 0.017 | 0.977 | 345.462 | 0.267 | 0 | 0.488 | |
| CTGAN | 1.221 | 10793 | 0.795 | 0.740 | 0.735 | 4.753 | 0.407 | 0.002 | 0.016 | 0.914 | 461.417 | 0.079 | 121 | 0.468 | |
| CTGAN + Reglas del Dominio | 1.004 | 10793 | 0.773 | 0.750 | 0.745 | 4.365 | 0.406 | 0.002 | 0.032 | 0.916 | 634.391 | 0.079 | 121 | 0.481 | |
| TVAE | 1.010 | 10793 | 0.800 | 0.768 | 0.765 | 7.170 | 0.556 | 0.003 | 0.026 | 0.957 | 357.507 | 0.050 | 121 | 0.471 | 🏆 |
| TVAE + Reglas del Dominio | 1.032 | 10793 | 0.784 | 0.725 | 0.720 | 2.269 | 0.556 | 0.003 | 0.025 | 0.957 | 540.631 | 0.051 | 121 | 0.467 | |
| OOF PSO para Aumento | 1.013 | 10726 | 0.803 | 0.761 | 0.755 | 5.252 | 0.669 | 0.000 | 0.226 | 0.595 | 445.378 | 0.208 | 124 | 0.467 | |
| OOF PSO para Aumento + Reglas | 1.000 | 10726 | 0.798 | 0.746 | 0.740 | 3.727 | 0.659 | 0.000 | 0.226 | 0.633 | 620.009 | 0.198 | 124 | 0.461 | |
| SMOTE RSB* Refinado | 1.003 | 9829 | 0.785 | 0.742 | 0.740 | 5.513 | 0.445 | 0.196 | 0.016 | 0.977 | 180.210 | 0.206 | 0 | 0.422 | |
| SMOTE RSB* Refinado + Reglas | 1.037 | 9829 | 0.781 | 0.746 | 0.745 | 5.712 | 0.445 | 0.196 | 0.017 | 0.974 | 354.683 | 0.206 | 0 | 0.409 |
Para interpretar correctamente los resultados de los conjuntos de datos generados, es fundamental comprender qué mide cada métrica y cómo se relacionan entre sí. A continuación, se detalla cada una de las métricas utilizadas en la evaluación:
¿Qué mide? Capacidad del modelo para distinguir entre clases (Ej: mortalidad vs supervivencia).
Interpretación:
Ejemplo: AUC-ROC = 0.82 significa que hay un 82% de probabilidad de que el modelo clasifique correctamente un paciente fallecido frente a uno superviviente.
¿Qué mide? Media armónica entre precisión y sensibilidad (recall).
Interpretación:
Ejemplo: F1 = 0.76 indica que el modelo mantiene un buen balance entre identificar correctamente a los pacientes que fallecen (sensibilidad) y no etiquetar erróneamente a los que sobreviven (precisión).
¿Qué mide? Proporción de predicciones correctas sobre el total.
Interpretación:
Ejemplo: Accuracy = 0.75 significa que el 75% de las predicciones del modelo son correctas.
⚠️ Nota: En conjuntos desbalanceados, esta métrica puede ser engañosa. Es mejor usar F1-Score o AUC-ROC.
¿Qué mide? Calidad global del conjunto sintético comparado con el original.
Interpretación:
Ejemplo: TabDSFidelity = 8.08 indica que el conjunto sintético mantiene una alta similitud con el original, preservando las relaciones y distribuciones de los datos reales, además de maximizar su eficacia predictiva.
💡 Importante: Este es el índice para seleccionar el mejor conjunto de datos sintéticos. Para este caso, el peso empleado para las métricas "AUC-ROC", "F1-Score" y "Accuracy" fue (2) y para el resto de las métricas fue (1).
¿Qué mide? Similitud entre las distribuciones de variables numéricas del conjunto sintético y el original.
Interpretación:
Ejemplo: JS = 0.118 indica que las distribuciones de las variables numéricas (edad, presión arterial, etc.) son bastante similares a las del conjunto original.
📌 Nota: Es el promedio de la divergencia de Jensen-Shannon calculada para todas las variables numéricas.
¿Qué mide? Probabilidad estadística de que las muestras numéricas del conjunto sintético provengan de la misma distribución continua que el original.
Interpretación:
Ejemplo: KS p-valor = 0.753 indica que hay evidencia fuerte a favor de que las distribuciones acumulativas de la variable sintética y la original son equivalentes.
📌 Nota: Se reporta el promedio de los p-valores obtenidos mediante la prueba de Kolmogorov-Smirnov de dos muestras para las variables numéricas.
¿Qué mide? Divergencia entre las distribuciones de variables categóricas del conjunto sintético y el original.
Interpretación:
Ejemplo: KL = 0.014 indica que la distribución de las variables categóricas (género, mortalidad) es muy similar a la del conjunto original.
📌 Nota: Es el promedio de la divergencia de Kullback-Leibler para todas las variables categóricas. A diferencia de JS y KS, esta métrica se aplica solo a variables categóricas.
¿Qué mide? Preservación de las relaciones entre variables del conjunto original.
Interpretación:
Ejemplo: Correlación = 0.976 significa que las relaciones entre variables (ej. edad y mortalidad) se mantienen en un 97.6% respecto al conjunto original.
¿Qué mide? Tiempo total de ejecución del proceso de generación del conjunto.
Interpretación:
Ejemplo: Tiempo total = 69.45s significa que el proceso completo de generación del conjunto balanceado tomó aproximadamente 1.16 minutos.
⏱️ Nota: Incluye el tiempo de generación sintética + cálculo de métricas.
Estas métricas evalúan el riesgo de exposición de información sensible y la capacidad de un atacante para inferir datos de los pacientes a partir del conjunto de datos sintéticos.
¿Qué mide? La distancia promedio entre cada registro sintético y su registro más cercano en el conjunto de datos original.
Interpretación:
Ejemplo: Distancia promedio = 0.015 en SMOTE indica que los registros sintéticos están relativamente cerca de los originales, lo que podría implicar un riesgo de privacidad moderado.
Metodología: Calculada utilizando la Distancia de Gower, la cual maneja internamente tipos de datos mixtos, normalizando las variables numéricas y penalizando diferencias categóricas para devolver un índice estandarizado entre 0 y 1.
Recomendación: Valores < 0.01 deben ser evaluados con precaución. Idealmente, buscar valores > 0.02 para garantizar la privacidad.
¿Qué mide? Número de registros sintéticos que son copias idénticas de registros en el conjunto de datos original.
Interpretación:
Ejemplo: SMOTE RSB* Refinado genera 76 copias exactas de 8817 registros (0.86%), lo que representa un riesgo de privacidad que debe ser evaluado.
Importante: La presencia de copias exactas es uno de los indicadores más críticos de fuga de datos. Idealmente, este valor debe ser 0.
¿Qué mide? Tasa de éxito (medida en AUC-ROC) de un atacante para determinar si un registro específico pertenece al conjunto de datos original.
Interpretación:
Ejemplo: MIA = 0.553 significa que el atacante tiene un éxito ligeramente superior al 50% aleatorio, lo que indica un riesgo de privacidad bajo/moderado.
Objetivo: Buscar valores lo más cercanos a 0.5. Valores > 0.6 indican que el conjunto sintético no protege adecuadamente la privacidad.
Formatos incluidos: CSV.
Díaz Bastida, M., Pérez Vázquez, R. A., & Bello Pérez, R. (2026). High-Fidelity Synthetic Dataset for Hypertension Prediction (Version 1). figshare. https://doi.org/10.6084/m9.figshare.32934149.v1