CD_25 Original + Derivados

CD_25: NHANES 2013-2014: Hypertension Prediction (CDC)

Matriz analítica del estudio poblacional NHANES para la predicción de Hipertensión Arterial (Hypertension_Diagnosis). Integra ~9,800 registros y 16 variables: 1) Demografía (edad, etnia, nivel socioeconómico); 2) Antropometría/Vitales (IMC, cintura, lecturas actuales de presión sistólica/diastólica); 3) Biomarcadores (creatinina sérica como indicador renal, lípidos); y 4) Nutrición/Hábitos (ingesta crítica de Sodio/Potasio, alcohol, tabaco).

📈 Eficacia Predictiva Detallada

Comparación detallada de las métricas de clasificación para los modelos entrenados con el conjunto de datos original y el conjunto sintético generado.

📊 Conjunto Original

Clase Precisión Recall F1-Score Soporte
Clase 0 0.74 0.86 0.80 133
Clase 1 0.59 0.39 0.47 67
Accuracy 0.70
Macro Avg 0.66 0.63 0.63 200
Weighted Avg 0.69 0.70 0.69 200
AUC-ROC: 0.68
F1-Score (weighted): 0.69
Accuracy: 0.70
➡️ Mejora
⬆ +0.10 AUC ⬆ +0.04 F1 ⬆ +0.03 Acc
🏆 MEJOR RENDIMIENTO

🔮 Conjunto Sintético

Clase Precisión Recall F1-Score Soporte
Clase 0 0.80 0.80 0.80 133
Clase 1 0.60 ⬆ +0.01 0.60 ⬆ +0.21 0.60 ⬆ +0.13 67
Accuracy 0.73 ⬆ +0.03
Macro Avg 0.70 ⬆ +0.04 0.70 ⬆ +0.07 0.70 ⬆ +0.07 200
Weighted Avg 0.73 ⬆ +0.04 0.73 ⬆ +0.03 0.73 ⬆ +0.04 200
AUC-ROC: 0.78 ⬆ +0.10
F1-Score (weighted): 0.73 ⬆ +0.04
Accuracy: 0.73 ⬆ +0.03

📊 Resumen de Mejoras en Clase Minoritaria (Clase 1)

🎯
Precisión
Original: 0.59
Sintético: 0.60
⬆ +0.01
📈
Recall
Original: 0.39
Sintético: 0.60
⬆ +0.21
⚖️
F1-Score
Original: 0.47
Sintético: 0.60
⬆ +0.13

📚 Fuente Original del Conjunto

NHANES 2013-2014 (National Health and Nutrition Examination Survey)

v1.0
National Center for Health Statistics (NCHS) / Centers for Disease Control and Prevention (CDC)
Publicado: 2013-2014

📄 Resumen (Abstract)

La Encuesta Nacional de Examen de Salud y Nutrición (NHANES) es un programa de estudios diseñado para evaluar el estado de salud y nutricional de adultos y niños en Estados Unidos. La encuesta es única en su tipo porque combina entrevistas y exámenes físicos. NHANES es un programa principal del Centro Nacional de Estadísticas de Salud (NCHS), que forma parte de los Centros para el Control y la Prevención de Enfermedades (CDC) y tiene la responsabilidad de producir estadísticas vitales y de salud para la nación.

El programa NHANES comenzó a principios de la década de 1960 y se ha llevado a cabo como una serie de encuestas centradas en diferentes grupos de población o temas de salud. En 1999, la encuesta se convirtió en un programa continuo que tiene un enfoque cambiante en una variedad de mediciones de salud y nutrición para satisfacer las necesidades emergentes. La encuesta examina una muestra representativa a nivel nacional de aproximadamente 5,000 personas cada año, ubicadas en condados de todo el país, de los cuales 15 son visitados cada año.

🔬 Métodos y Contexto

La entrevista de NHANES incluye preguntas sobre demografía, situación socioeconómica, dieta y salud. El componente de examen consiste en mediciones médicas, dentales y fisiológicas, así como pruebas de laboratorio administradas por personal médico altamente capacitado. Hasta la fecha, miles de hallazgos de investigación han sido publicados utilizando los datos de NHANES.

📋 Componentes del Dataset NHANES 2013-2014
1. Demographics Dataset
  • Información demográfica, socioeconómica y de salud general
2. Examinations Dataset
  • Presión arterial
  • Medidas corporales (antropometría)
  • Fuerza muscular - prueba de agarre
  • Salud oral - dentición
  • Gusto y olfato
3. Dietary Data - Total Nutrient Intake (First Day)
  • Ingesta total de nutrientes del primer día
4. Laboratory Dataset

Incluye una amplia gama de pruebas de laboratorio:

  • Albúmina y Creatinina - Orina
  • Apolipoproteína B
  • Metales en sangre (Plomo, Cadmio, Mercurio, Selenio, Manganeso)
  • Mercurio en sangre (inorgánico, etílico y metílico)
  • Colesterol - HDL, LDL, Triglicéridos, Total
  • Conteo sanguíneo completo con diferencial de 5 partes
  • Cobre, Selenio y Zinc - Suero
  • Cuestionario de ayuno
  • Fluoruro - Plasma y Agua
  • Glicohemoglobina (HbA1c)
  • Hepatitis A, B, C, D y E
  • Herpes Simple Virus Tipo-1 y Tipo-2
  • Prueba de anticuerpos VIH
  • Virus del Papiloma Humano (HPV) - Enjuague oral y ADN vaginal/penil
  • Insulina
  • Yodo - Orina
  • Perclorato, Nitrato y Tiocianato - Orina
  • Sustancias perfluoroalquiladas y polifluoroalquiladas (PFC)
  • Productos químicos de cuidado personal y metabolitos
  • Metabolitos de ftalatos y plastificantes - Orina
  • Glucosa plasmática en ayunas
  • Hidrocarburos aromáticos policíclicos (HAP) - Orina
  • Perfil bioquímico estándar
  • Ensayo de transglutaminasa tisular (IgA-TTG) y anticuerpos endomisiales IgA
  • Trichomonas - Orina
  • Prueba de tolerancia a la glucosa oral de 2 horas
  • Clamidia - Orina
  • Mercurio urinario
  • Arsénicos especificados en orina
  • Arsénico total en orina
  • Tasa de flujo urinario
  • Metales en orina
  • Prueba de embarazo en orina
  • Vitamina B12
5. Questionnaire Dataset
  • Aculturación
  • Consumo de alcohol
  • Presión arterial y Colesterol
  • Salud cardiovascular
  • Comportamiento del consumidor
  • Estado de salud actual
  • Dermatología
  • Diabetes
  • Comportamiento dietético y Nutrición
  • Discapacidad
  • Uso de drogas
  • Primera infancia
  • Seguridad alimentaria
  • Seguro de salud
  • Hepatitis
  • Utilización hospitalaria y Acceso a la atención
  • Características de la vivienda
  • Inmunización
  • Ingresos
  • Condiciones médicas
  • Salud mental - Evaluación de depresión
  • Ocupación
  • Salud oral
  • Osteoporosis
  • Uso de pesticidas
  • Actividad física
  • Funcionamiento físico
  • Uso preventivo de aspirina
  • Salud reproductiva
  • Comportamiento sexual
  • Trastornos del sueño
  • Tabaquismo - Consumo de cigarrillos
  • Tabaquismo - Fumadores en el hogar
  • Tabaquismo - Uso reciente de tabaco
  • Tabaquismo - Exposición al humo de segunda mano
  • Gusto y olfato
  • Historia de peso
  • Historia de peso - Jóvenes
6. Medication Dataset
  • Medicamentos recetados

📊 Descripción de Datos

El conjunto de datos NHANES 2013-2014 es una colección integral de múltiples datasets interconectados que cubren diferentes aspectos de la salud y nutrición de la población estadounidense. Cada componente incluye su propio diccionario de variables y se puede acceder a través del sitio web oficial de NHANES.

📋 Resumen de Componentes
Componente Descripción
Demographics Información demográfica, socioeconómica y de salud
Examinations Mediciones físicas, presión arterial, fuerza muscular, salud oral, gusto y olfato
Dietary Ingesta total de nutrientes (primer día)
Laboratory Pruebas de laboratorio (más de 40 tipos de análisis)
Questionnaire Cuestionarios sobre salud, comportamiento y estilo de vida (más de 40 temas)
Medication Medicamentos recetados

📋 Características del Dataset

  • Tipo de problema: Múltiples (Clasificación, Regresión, Análisis de supervivencia, Encuestas)
  • Dimensión: Multivariante de alta dimensionalidad
  • Tipo de características: Mixtas (Numéricas, Categóricas, Binarias, Ordinales)
  • Valores faltantes: Sí (presentes en diversos componentes)
  • Área de aplicación: Salud Pública, Epidemiología, Nutrición, Enfermedades crónicas
  • Muestra: Representativa a nivel nacional de EE.UU.
  • Diseño: Encuesta continua con enfoque cambiante

⚖️ Ética y Privacidad

NHANES es una encuesta gubernamental de EE.UU. que cumple con estrictos protocolos de confidencialidad y privacidad. Todos los identificadores personales son eliminados de los conjuntos de datos públicos para proteger la identidad de los participantes. Los datos están en dominio público y pueden ser utilizados libremente para investigación, con la condición de que se cite adecuadamente a la fuente. El NCHS/CDC ha implementado procedimientos de enmascaramiento de datos para minimizar el riesgo de reidentificación. Restricción de confidencialidad: La publicación de resultados debe limitarse a métricas de evaluación, resultados agregados y metodología del modelo, sin divulgación de información que permita la reidentificación de participantes.

📋 Notas de Uso

El conjunto de datos NHANES es uno de los recursos más valiosos para la investigación en salud pública. Se recomienda:

  • Consultar los diccionarios de variables completos disponibles en el sitio web de NHANES para cada componente
  • Tener en cuenta el diseño complejo de la encuesta (muestreo estratificado por conglomerados) al realizar inferencias estadísticas
  • Utilizar los pesos de muestreo proporcionados para obtener estimaciones representativas de la población de EE.UU.
  • Manejar adecuadamente los valores faltantes presentes en los diferentes componentes
  • Considerar la naturaleza temporal de los datos (ciclos de 2 años) para análisis longitudinales
  • Combinar múltiples componentes (Demographics + Laboratory + Questionnaire) para análisis integrados
  • Documentar claramente las variables y códigos utilizados en el análisis
  • Consultar la documentación metodológica de NHANES para comprender los procedimientos de recolección y procesamiento de datos

💡 Importancia en Salud Pública

NHANES es una de las encuestas de salud más importantes del mundo y ha sido fundamental para:

  • Establecer referencias nacionales para medidas antropométricas, bioquímicas y nutricionales
  • Identificar tendencias epidemiológicas en enfermedades crónicas (obesidad, diabetes, hipertensión, etc.)
  • Evaluar el estado nutricional de la población y la ingesta de nutrientes
  • Detectar exposiciones ambientales a metales pesados, pesticidas y otros contaminantes
  • Guiar políticas de salud pública y recomendaciones dietéticas
  • Monitorear la prevalencia de enfermedades infecciosas (hepatitis, VIH, HPV, etc.)

Los datos de NHANES han sido utilizados en miles de publicaciones científicas y continúan siendo un recurso invaluable para la comunidad de investigación en salud global.

📖 Cómo citar la fuente original

National Center for Health Statistics (NCHS). National Health and Nutrition Examination Survey Data 2013-2014. Hyattsville, MD: U.S. Department of Health and Human Services, Centers for Disease Control and Prevention. https://www.cdc.gov/nchs/nhanes/

📚 Referencias Adicionales

🔄 Transformaciones Aplicadas

Modificaciones realizadas al conjunto original (NHANES 2013-2014 - Hypertension Prediction)

  • Integración y fusión de múltiples tablas:
    • Fusión secuencial de 5 archivos del ciclo NHANES 2013-2014: demografía (demographic.csv), dieta (diet.csv), examen físico (examination.csv), laboratorios (labs.csv) y cuestionario (questionnaire.csv).
    • Uso de SEQN (identificador único de participante) como clave para los merges (left joins).
    • Selección estratégica de 15 variables relevantes de las miles disponibles en NHANES, enfocadas en factores de riesgo cardiovascular e hipertensión.
  • Selección y renombrado de variables específicas para hipertensión:
    • Variables demográficas: Gender (RIAGENDR), Age (RIDAGEYR), Ethnicity (RIDRETH1), Family_Income_Ratio (INDFMPIR).
    • Variables de examen físico: BMI (BMXBMI), Waist_Circumference (BMXWAIST), Systolic_BP_Reading (BPXSY1), Diastolic_BP_Reading (BPXDI1).
    • Variables de laboratorio: Total_Cholesterol (LBXTC), Serum_Creatinine (LBXSCR - función renal, clave en presión arterial), Triglycerides (LBXSTR).
    • Variables de dieta (claves para hipertensión): Daily_Sodium_Intake (DR1TSODI - Sodio/Sal), Daily_Potassium_Intake (DR1TPOTA - Potasio, factor protector), Daily_Alcohol_Intake (DR1TALCO - Alcohol en gramos).
    • Variables de hábitos: Smoker_History (SMQ020).
    • Eliminación del identificador SEQN tras la fusión para evitar sobreajuste.
  • Ingeniería y limpieza de la variable objetivo (Hipertensión):
    • Transformación de Hypertension_Diagnosis (BPQ020) de multiclase a binaria.
    • Mapeo: 1 (Sí diagnosticado por doctor) → 1 (Clase Positiva), 2 (No) → 0 (Clase Negativa).
    • Eliminación de valores 7 (Rechaza) y 9 (No sabe) como ruido no informativo.
  • Imputación diferenciada de valores faltantes:
    • Variables numéricas (10 columnas): Imputación con mediana para preservar robustez frente a outliers. Variables: Age, Family_Income_Ratio, BMI, Waist_Circumference, Systolic_BP_Reading, Diastolic_BP_Reading, Total_Cholesterol, Serum_Creatinine, Triglycerides, Daily_Sodium_Intake, Daily_Potassium_Intake, Daily_Alcohol_Intake.
    • Variables categóricas (4 columnas): Imputación con moda (valor más frecuente) para preservar la distribución categórica. Variables: Gender, Ethnicity, Smoker_History, Hypertension_Diagnosis.
  • Codificación específica de variables NHANES y generación de leyenda:
    • Gender: Mapeo de NHANES (1=Male, 2=Female) → 0=Male, 1=Female.
    • Smoker_History: Mapeo de NHANES (1=Yes, 2=No) → 1=Yes, 0=No.
    • Ethnicity: Preservación de códigos numéricos originales (1=Mexican American, 2=Other Hispanic, 3=Non-Hispanic White, 4=Non-Hispanic Black, 5=Other Race) con documentación en leyenda.
    • Generación del archivo leyenda_nhanes_hypertension.txt con semántica completa de todas las variables codificadas y descripción de variables continuas clave (sodio, potasio, creatinina sérica).
  • Estructura y calidad de datos:
    • Submuestreo controlado a 1,000 instancias (extraídas del conjunto original de 7,311 participantes NHANES) aplicando muestreo aleatorio estratificado (train_test_split con random_state=42).
    • Preservación exacta de la distribución y proporción original del desbalance de la variable objetivo (Hypertension_Diagnosis).
    • Dataset final con 14 variables predictoras (mixtas: categóricas codificadas y numéricas continuas) y 1 variable objetivo binaria.
    • Guardado en formato CSV con separador punto y coma (;) para compatibilidad internacional.

📊 Resultado: Dataset reducido mediante muestreo estratificado a 1,000 participantes del ciclo NHANES 2013-2014 con 14 variables predictoras (demográficas, antropométricas, metabólicas, dietéticas y de hábitos) y 1 variable objetivo binaria (Hypertension_Diagnosis). Se mantiene fielmente el desbalance original de clases — escenario ideal para validación de técnicas de generación de datos sintéticos y evaluación del índice TabDSFidelity en contextos epidemiológicos con datos complejos y multidimensionales.

🏥 Fuente: National Health and Nutrition Examination Survey (NHANES) 2013-2014 - CDC/NCHS.

🧂 Variables dietéticas clave: Ingesta diaria de sodio (sal), potasio (factor protector), y alcohol — factores críticos en la regulación de la presión arterial.

🔬 Variables clínicas clave: Creatinina sérica (función renal), colesterol total, triglicéridos, índice de masa corporal, circunferencia de cintura, presión arterial sistólica y diastólica.

📁 Leyenda disponible: Archivo leyenda_nhanes_hypertension.txt con mapeo semántico completo de todas las variables categóricas y descripción de variables continuas.

🎯 Variable objetivo: Hypertension_Diagnosis (1 = Diagnosticado con presión arterial alta por doctor, 0 = Sin diagnóstico).

📋 Contexto epidemiológico: Datos representativos de la población civil no institucionalizada de EE. UU., con enfoque en factores nutricionales y metabólicos asociados a la hipertensión.

📋 Diccionario de Datos Detallado

Variable Descripción Clínica Tipo Rango / Categorías Unidad ¿Objetivo?
Ethnicity Origen étnico/racial del participante Categórico 1: Mexican American, 2: Other Hispanic, 3: Non-Hispanic White, 4: Non-Hispanic Black, 5: Other Race N/A No
Age Edad del participante (censurada en 80) Numérico 16 - 80 años No
Family_Income_Ratio Índice de pobreza (ratio de ingresos respecto al umbral federal) Numérico 0 - 5 N/A No
BMI Índice de Masa Corporal Numérico 15.4 - 74.1 kg/m² No
Waist_Circumference Circunferencia de la cintura (grasa visceral) Numérico 65.2 - 177.9 cm No
Systolic_BP_Reading Presión arterial sistólica (lectura del examen) Numérico 90 - 190 mm Hg No
Diastolic_BP_Reading Presión arterial diastólica (lectura del examen) Numérico 0 - 98 mm Hg No
Total_Cholesterol Colesterol total en sangre Numérico 108 - 348 mg/dL No
Serum_Creatinine Creatinina sérica (función renal) Numérico 0.38 - 6.14 mg/dL No
Triglycerides Triglicéridos en sangre Numérico 27 - 1,090 mg/dL No
Daily_Sodium_Intake Ingesta diaria de sodio (factor clave en hipertensión) Numérico 486 - 21,004 mg No
Daily_Potassium_Intake Ingesta diaria de potasio (factor protector) Numérico 200 - 11,242 mg No
Daily_Alcohol_Intake Ingesta diaria de alcohol Numérico 0 - 259.8 gramos No
Gender Sexo biológico del participante Binario 0: Masculino, 1: Femenino N/A No
Smoker_History Historial de tabaquismo (>100 cigarrillos en la vida) Binario 0: No, 1: Sí N/A No
Hypertension_Diagnosis Diagnóstico médico de hipertensión (objetivo) Binario 0: No, 1: Sí N/A
16 Variables totales
12 Numéricas
1 Categóricas
3 Binarias
Objetivo: Hipertensión (Hypertension_Diagnosis)
Datos ausentes: 0%

📈 Distribución de la variable objetivo en el conjunto original

📖 Leyenda de Variables Categóricas

Esta sección detalla los códigos y significados de las variables categóricas y binarias presentes en el conjunto de datos de NHANES 2013-2014 para Predicción de Hipertensión. Comprender estas codificaciones es fundamental para la correcta interpretación de los resultados clínicos.

Ethnicity Categórica

Origen étnico/racial del participante

Código Significado
1Mexican American (Mexicano-Americano)
2Other Hispanic (Otro Hispano)
3Non-Hispanic White (Blanco No Hispano)
4Non-Hispanic Black (Negro No Hispano)
5Other Race (Otra Raza)
💡

Relevancia: La etnicidad es un factor de riesgo documentado para hipertensión. Non-Hispanic Blacks tienen mayor prevalencia y peor control.

Variables Binarias Binario

Formato común: 0 = No / Ausencia, 1 = Sí / Presencia

Gender Sexo (0: Masculino, 1: Femenino)
Smoker_History Historial de tabaquismo (>100 cigarros en la vida) (0: No, 1: Sí)
Hypertension_Diagnosis 🎯 Variable Objetivo: Hipertensión diagnosticada (0: No, 1: Sí)
ℹ️

Nota: Todas las variables binarias están codificadas como 0 = No y 1 = Sí.

📊
Variables categóricas: 1
  • Ethnicity (5 categorías étnico-raciales)
🎯
Variables binarias: 3
  • Gender (Sexo)
  • Smoker_History (Tabaquismo)
  • 🎯 Hypertension_Diagnosis (Objetivo)
📈
Variables numéricas: 12
  • Demográficas: Age, Family_Income_Ratio
  • Antropometría: BMI, Waist_Circumference
  • Presión arterial: Systolic_BP, Diastolic_BP
  • Laboratorio: Total_Cholesterol, Serum_Creatinine, Triglycerides
  • Nutrición: Daily_Sodium_Intake, Daily_Potassium_Intake, Daily_Alcohol_Intake
⚠️
Recomendaciones Clínicas:
  • Factores de riesgo principales: Age, BMI, Waist_Circumference, Daily_Sodium_Intake
  • Sodio: Ingesta > 2,300 mg/día es factor de riesgo. El dataset muestra valores extremos hasta 21,000 mg
  • Potasio: Ingesta adecuada (> 3,500 mg/día) es protectora
  • Obesidad: BMI ≥ 30 kg/m² y Waist_Circumference elevada son factores de riesgo
  • Función Renal: Serum_Creatinine elevada indica daño renal asociado a hipertensión
  • Relación Na/K: El ratio sodio/potasio es un predictor más fuerte que el sodio solo
  • Etnicidad: Non-Hispanic Blacks tienen mayor prevalencia de hipertensión

🔬 Metodología de Generación (Reproducibilidad Científica)

📐 Método Principal

SMOTE RSB* Adaptado

Versión: 2.0

DOI: 10.1007/s42979-026-04896-8

📏 Reglas de restricción

  • Systolic_BP_Reading > 150 → Diastolic_BP_Reading < 100 (Rigidez arterial → diastólica no alta)
  • Systolic_BP_Reading < 110 → Diastolic_BP_Reading < 90 (Presión de pulso ≥ 20 mmHg)
  • Age > 70 → Systolic_BP_Reading > 95 (Ancianos no tienen hipotensión extrema)
  • Daily_Sodium_Intake > 6000 → Daily_Potassium_Intake > 1500 (Sodio alto → potasio adecuado)
  • Serum_Creatinine > 2.5 → Hypertension_Diagnosis = 1 (Fallo renal → hipertensión)
  • Gender == 1 (Mujer) → Serum_Creatinine < 1.5 (Menor masa muscular → creatinina más baja)
  • Total_Cholesterol < 160 → Smoker_History = 0 (Perfil sano → no fumador)
  • Hypertension_Diagnosis == 0 → Systolic_BP_Reading < 160 (Sin HTA → sin crisis)
  • Age < 14 → Smoker_History = 0 (Menores de 14 sin historial tabáquico)
  • Age < 18 → Daily_Alcohol_Intake = 0 (Menores de 18 sin consumo de alcohol)
  • BMI > 40 → (Hypertension_Diagnosis = 1) OR (Smoker_History = 1)
  • Age > 75 → (Hypertension_Diagnosis = 1) OR (Smoker_History = 1)

⚙️ Hiperparámetros SMOTE RSB* Adaptado

Valor escala0.03
Probabilidad Base0.1

🔄 Hiperparámetros CTGAN

epochs500
batch_size50
generator_lr0.0002
discriminator_lr0.0002
pac10
generator_dim(256, 256)
discriminator_dim(256, 256)
embedding_dim128
l2scale1e-05

📊 Hiperparámetros TVAE

epochs 500
batch_size 50
embedding_dim 128
compress_dims (128, 128)
decompress_dims (128, 128)
l2scale 1e-5
loss_factor 2

🔐 Reproducibilidad

Random Seed42
Python3.12.12

Librerías utilizadas:

  • pandas: 2.3.3
  • numpy: 2.4.4
  • scikit-learn: 1.7.2
  • imbalanced-learn: 0.14.0
  • ctgan: 0.11.1
  • torch: 2.9.0
  • sdv: 1.28.0
  • scipy: 1.16.3
  • matplotlib: 3.10.9
📝

Para reproducir exactamente este conjunto de datos, ejecute el script de generación con la semilla aleatoria 42. Los resultados pueden variar ligeramente según la versión de las librerías.

📊 Conjuntos de Datos Derivados

El conjunto original ha sido sometido a un proceso de balanceo de clases y generación sintética para mejorar la representación de clases minoritarias. Nota: se ha empleado un conjunto de validación para evaluar el índice de fidelidad. Se han generado tres familias de conjuntos:

  • 📊 Balanceados: Conjuntos creados mediante técnicas de sobremuestreo
  • 🔮 Sintéticos Puros: Conjuntos generados completamente con modelos generativos
  • ✨ Aumentados: Combinación del conjunto original + datos sintéticos

El mejor conjunto de cada etapa fue seleccionado mediante el índice TabDSFidelity.

📊 Conjuntos Balanceados 8 conjuntos

Algoritmo Ratio N° Ejemplos AUC-ROC F1 Accuracy TabDSFidelity Jensen-Shannon Kolmogorov-Smirnov Kullback-Leibler Correlación Tiempo Total (s) Dist. Promedio Copias Exactas Ataque MIA Mejor
Random Oversampling 1 794 0.797 0.733 0.730 6.748 0.102 0.719 0.014 0.979 58.679 0 794 0.453
Smote 1 794 0.774 0.724 0.720 2.828 0.270 0.461 0.018 0.984 53.710 0.012 600 0.455
Borderline SMOTE 1 794 0.776 0.724 0.720 3.082 0.271 0.522 0.016 0.982 52.491 0.012 601 0.465
ADASYN 1.068 821 0.772 0.713 0.710 1.709 0.285 0.522 0.021 0.980 52.910 0.013 600 0.463
SMOTE RSB* Adaptado 1.003 793 0.772 0.730 0.725 3.539 0.226 0.530 0.015 0.985 50.497 0.013 600 0.469
SMOTE RSB* Adaptado + Reglas 1.003 793 0.787 0.759 0.755 7.304 0.225 0.524 0.015 0.985 50.893 0.013 600 0.473 🏆
OOF PSO para Balanceo 1 794 0.789 0.720 0.720 2.236 0.266 0.001 0.031 0.774 60.510 0.059 600 0.469
OOF PSO para Balanceo + Reglas 1.052 794 0.795 0.750 0.750 5.461 0.260 0.004 0.022 0.799 60.378 0.067 533 0.467
Mejor seleccionado: SMOTE RSB* Adaptado + Reglas del Dominio (TabDSFidelity: 7.304, AUC: 0.787, F1: 0.759, MIA: 0.473). Nota: Ratio <= 1.5 = Conjunto Balanceado.

🔮 Conjuntos Sintéticos Puros 10 conjuntos

Algoritmo Ratio N° Ejemplos AUC-ROC F1 Accuracy TabDSFidelity Jensen-Shannon Kolmogorov-Smirnov Kullback-Leibler Correlación Tiempo Total (s) Dist. Promedio Copias Exactas Ataque MIA Mejor
SMOTE RSB* + Ruido Gaussiano 1.023 9154 0.786 0.731 0.730 7.522 0.464 0.165 0.015 0.979 95.064 0.268 0 0.495
SMOTE RSB* + Ruido Gaussiano + Reglas 1.031 9154 0.758 0.716 0.715 6.221 0.464 0.165 0.018 0.976 260.876 0.268 0 0.483
CTGAN 1.241 10000 0.774 0.758 0.755 6.746 0.427 0.001 0.018 0.910 375.631 0.085 0 0.484
CTGAN + Reglas del Dominio 1.004 10000 0.747 0.706 0.700 4.577 0.427 0.001 0.035 0.911 541.218 0.085 0 0.500
TVAE 1.011 10000 0.789 0.735 0.730 6.210 0.597 0.002 0.027 0.954 262.845 0.053 0 0.469
TVAE + Reglas del Dominio 1.035 10000 0.787 0.730 0.725 6.030 0.596 0.002 0.026 0.954 448.261 0.054 0 0.463
OOF PSO para Aumento 1.014 9933 0.806 0.580 0.590 2.000 0.728 0.000 0.301 0.583 354.691 0.223 0 0.481
OOF PSO para Aumento + Reglas 1.001 9933 0.790 0.582 0.590 1.629 0.718 0.000 0.302 0.623 528.847 0.212 0 0.466
SMOTE RSB* Refinado 1.004 9036 0.780 0.746 0.745 7.762 0.467 0.181 0.016 0.976 92.140 0.207 0 0.422 🏆
SMOTE RSB* Refinado + Reglas 1.041 9036 0.776 0.733 0.730 7.267 0.466 0.181 0.018 0.972 265.621 0.207 0 0.418
Mejor seleccionado: SMOTE RSB* Refinado (TabDSFidelity: 7.762, AUC: 0.780, F1: 0.746, MIA: 0.422). Nota: Ratio <= 1.5 = Conjunto Balanceado.

✨ Conjuntos Aumentados 10 conjuntos

Algoritmo Ratio N° Ejemplos AUC-ROC F1 Accuracy TabDSFidelity Jensen-Shannon Kolmogorov-Smirnov Kullback-Leibler Correlación Tiempo Total (s) Dist. Promedio Copias Exactas Ataque MIA Mejor
SMOTE RSB* + Ruido Gaussiano 1.021 9947 0.795 0.732 0.735 5.368 0.444 0.183 0.015 0.980 181.116 0.267 0 0.488
SMOTE RSB* + Ruido Gaussiano + Reglas 1.028 9947 0.769 0.724 0.725 3.029 0.443 0.183 0.017 0.977 345.462 0.267 0 0.488
CTGAN 1.221 10793 0.795 0.740 0.735 4.753 0.407 0.002 0.016 0.914 461.417 0.079 121 0.468
CTGAN + Reglas del Dominio 1.004 10793 0.773 0.750 0.745 4.365 0.406 0.002 0.032 0.916 634.391 0.079 121 0.481
TVAE 1.010 10793 0.800 0.768 0.765 7.170 0.556 0.003 0.026 0.957 357.507 0.050 121 0.471 🏆
TVAE + Reglas del Dominio 1.032 10793 0.784 0.725 0.720 2.269 0.556 0.003 0.025 0.957 540.631 0.051 121 0.467
OOF PSO para Aumento 1.013 10726 0.803 0.761 0.755 5.252 0.669 0.000 0.226 0.595 445.378 0.208 124 0.467
OOF PSO para Aumento + Reglas 1.000 10726 0.798 0.746 0.740 3.727 0.659 0.000 0.226 0.633 620.009 0.198 124 0.461
SMOTE RSB* Refinado 1.003 9829 0.785 0.742 0.740 5.513 0.445 0.196 0.016 0.977 180.210 0.206 0 0.422
SMOTE RSB* Refinado + Reglas 1.037 9829 0.781 0.746 0.745 5.712 0.445 0.196 0.017 0.974 354.683 0.206 0 0.409
Mejor seleccionado: TVAE (TabDSFidelity: 7.170, AUC: 0.800, F1: 0.768, MIA: 0.471). Nota: Ratio <= 1.5 = Conjunto Balanceado.

📈 Diagrama del Proceso de Generación

Conjunto Original
CD_25
Balanceo
(8 métodos)
↓ Selección por TabDSFidelity
⭐ Mejor Balanceado
SMOTE RSB* Adaptado + Reglas del Dominio
Generación Sintética
(10 métodos)
↓ Evaluación TabDSFidelity
⭐ Mejor Sintético
SMOTE RSB* Refinado
⭐ Mejor Aumentado
TVAE
Conjunto Sintético Final
Seleccionado por calidad

📊 Guía de Métricas de Evaluación

Para interpretar correctamente los resultados de los conjuntos de datos generados, es fundamental comprender qué mide cada métrica y cómo se relacionan entre sí. A continuación, se detalla cada una de las métricas utilizadas en la evaluación:

🎯 Métricas de Rendimiento Predictivo

AUC-ROC (0.5 - 1.0)

¿Qué mide? Capacidad del modelo para distinguir entre clases (Ej: mortalidad vs supervivencia).

Interpretación:

  • 0.5: Sin capacidad predictiva (aleatorio)
  • 0.7-0.8: Aceptable
  • 0.8-0.9: Excelente
  • >0.9: Sobresaliente

Ejemplo: AUC-ROC = 0.82 significa que hay un 82% de probabilidad de que el modelo clasifique correctamente un paciente fallecido frente a uno superviviente.

F1-Score (0 - 1.0)

¿Qué mide? Media armónica entre precisión y sensibilidad (recall).

Interpretación:

  • 0.7-0.8: Buen equilibrio entre precisión y sensibilidad
  • 0.8-0.9: Muy buen equilibrio
  • >0.9: Excelente equilibrio

Ejemplo: F1 = 0.76 indica que el modelo mantiene un buen balance entre identificar correctamente a los pacientes que fallecen (sensibilidad) y no etiquetar erróneamente a los que sobreviven (precisión).

Accuracy (0 - 1.0)

¿Qué mide? Proporción de predicciones correctas sobre el total.

Interpretación:

  • 0.7-0.8: Buen rendimiento general
  • 0.8-0.9: Muy buen rendimiento
  • >0.9: Excelente rendimiento

Ejemplo: Accuracy = 0.75 significa que el 75% de las predicciones del modelo son correctas.

⚠️ Nota: En conjuntos desbalanceados, esta métrica puede ser engañosa. Es mejor usar F1-Score o AUC-ROC.

🔬 Índice de Fidelidad del Conjunto

TabDSFidelity (0 - 10+)

¿Qué mide? Calidad global del conjunto sintético comparado con el original.

Interpretación:

  • < 3.0: Baja fidelidad (poca similitud con el original)
  • 3.0 - 6.0: Fidelidad moderada
  • 6.0 - 8.0: Alta fidelidad
  • > 8.0: Muy alta fidelidad (excelente representación)

Ejemplo: TabDSFidelity = 8.08 indica que el conjunto sintético mantiene una alta similitud con el original, preservando las relaciones y distribuciones de los datos reales, además de maximizar su eficacia predictiva.

💡 Importante: Este es el índice para seleccionar el mejor conjunto de datos sintéticos. Para este caso, el peso empleado para las métricas "AUC-ROC", "F1-Score" y "Accuracy" fue (2) y para el resto de las métricas fue (1).

📊 Métricas de Similitud de Distribuciones

Jensen-Shannon (Promedio) (0 - 1.0)

¿Qué mide? Similitud entre las distribuciones de variables numéricas del conjunto sintético y el original.

Interpretación:

  • Cerca de 0: Distribuciones muy similares (ideal)
  • 0.1 - 0.3: Diferencias moderadas
  • > 0.3: Diferencias significativas

Ejemplo: JS = 0.118 indica que las distribuciones de las variables numéricas (edad, presión arterial, etc.) son bastante similares a las del conjunto original.

📌 Nota: Es el promedio de la divergencia de Jensen-Shannon calculada para todas las variables numéricas.

Kolmogorov-Smirnov (p-valor promedio) (0 - 1.0)

¿Qué mide? Probabilidad estadística de que las muestras numéricas del conjunto sintético provengan de la misma distribución continua que el original.

Interpretación:

  • Cerca de 1.0: Altísima probabilidad de que sean la misma distribución (ideal)
  • > 0.05: Similitud aceptable (no se rechaza que sean iguales)
  • < 0.05: Diferencias estadísticamente significativas

Ejemplo: KS p-valor = 0.753 indica que hay evidencia fuerte a favor de que las distribuciones acumulativas de la variable sintética y la original son equivalentes.

📌 Nota: Se reporta el promedio de los p-valores obtenidos mediante la prueba de Kolmogorov-Smirnov de dos muestras para las variables numéricas.

Kullback-Leibler (Promedio) (0 - ∞)

¿Qué mide? Divergencia entre las distribuciones de variables categóricas del conjunto sintético y el original.

Interpretación:

  • Cerca de 0: Distribuciones muy similares (ideal)
  • 0.01 - 0.1: Diferencias pequeñas
  • > 0.1: Diferencias notables

Ejemplo: KL = 0.014 indica que la distribución de las variables categóricas (género, mortalidad) es muy similar a la del conjunto original.

📌 Nota: Es el promedio de la divergencia de Kullback-Leibler para todas las variables categóricas. A diferencia de JS y KS, esta métrica se aplica solo a variables categóricas.

📊 Métricas de Estructura

Similitud de Correlación (0 - 1.0)

¿Qué mide? Preservación de las relaciones entre variables del conjunto original.

Interpretación:

  • Cerca de 1.0: Las relaciones entre variables se mantienen casi idénticas
  • > 0.9: Excelente preservación de relaciones
  • 0.7 - 0.9: Buena preservación
  • < 0.7: Pérdida significativa de relaciones

Ejemplo: Correlación = 0.976 significa que las relaciones entre variables (ej. edad y mortalidad) se mantienen en un 97.6% respecto al conjunto original.

⏱️ Métricas de Rendimiento Temporal

Tiempo Total (s) (segundos)

¿Qué mide? Tiempo total de ejecución del proceso de generación del conjunto.

Interpretación:

  • < 100s: Generación rápida
  • 100-300s: Tiempo moderado
  • > 300s: Proceso lento (puede ser aceptable para conjuntos grandes)

Ejemplo: Tiempo total = 69.45s significa que el proceso completo de generación del conjunto balanceado tomó aproximadamente 1.16 minutos.

⏱️ Nota: Incluye el tiempo de generación sintética + cálculo de métricas.

🔒 Métricas de Privacidad

Estas métricas evalúan el riesgo de exposición de información sensible y la capacidad de un atacante para inferir datos de los pacientes a partir del conjunto de datos sintéticos.

Distancia al Registro Más Cercano (≥ 0)

¿Qué mide? La distancia promedio entre cada registro sintético y su registro más cercano en el conjunto de datos original.

Interpretación:

  • Cerca de 0: Los datos sintéticos son muy similares a los originales → ⚠️ ALTO RIESGO de privacidad
  • 0.01 - 0.05: Similaridad moderada → Riesgo moderado
  • > 0.05: Buena separación de los datos originales → ✅ BAJO RIESGO de privacidad

Ejemplo: Distancia promedio = 0.015 en SMOTE indica que los registros sintéticos están relativamente cerca de los originales, lo que podría implicar un riesgo de privacidad moderado.

🔬

Metodología: Calculada utilizando la Distancia de Gower, la cual maneja internamente tipos de datos mixtos, normalizando las variables numéricas y penalizando diferencias categóricas para devolver un índice estandarizado entre 0 y 1.

💡

Recomendación: Valores < 0.01 deben ser evaluados con precaución. Idealmente, buscar valores > 0.02 para garantizar la privacidad.

Copias Exactas (≥ 0)

¿Qué mide? Número de registros sintéticos que son copias idénticas de registros en el conjunto de datos original.

Interpretación:

  • 0: Ninguna copia exacta → ✅ SEGURO
  • 1 - 10: Pocas copias → Riesgo bajo
  • 11 - 50: Copias moderadas → ⚠️ RIESGO MODERADO
  • > 50: Muchas copias → 🔴 ALTO RIESGO de reidentificación

Ejemplo: SMOTE RSB* Refinado genera 76 copias exactas de 8817 registros (0.86%), lo que representa un riesgo de privacidad que debe ser evaluado.

⚠️

Importante: La presencia de copias exactas es uno de los indicadores más críticos de fuga de datos. Idealmente, este valor debe ser 0.

Ataque de Inferencia de Membresía (MIA) (0 - 1.0)

¿Qué mide? Tasa de éxito (medida en AUC-ROC) de un atacante para determinar si un registro específico pertenece al conjunto de datos original.

Interpretación:

  • 0.5: Aleatorio (ideal) → ✅ PRIVACIDAD ÓPTIMA
  • 0.5 - 0.55: Riesgo bajo
  • 0.55 - 0.6: Riesgo moderado → ⚠️ PRIVACIDAD CUESTIONABLE
  • > 0.6: Riesgo alto → 🔴 PRIVACIDAD COMPROMETIDA

Ejemplo: MIA = 0.553 significa que el atacante tiene un éxito ligeramente superior al 50% aleatorio, lo que indica un riesgo de privacidad bajo/moderado.

🎯

Objetivo: Buscar valores lo más cercanos a 0.5. Valores > 0.6 indican que el conjunto sintético no protege adecuadamente la privacidad.

📝 Resumen Rápido para Selección

🏆
Para seleccionar el mejor conjunto:
  • Priorizar TabDSFidelity más alto
  • Buscar AUC-ROC y F1 altos
  • Valores de divergencia JS y KL cercanos a 0
  • P-valor de KS lo más cercano a 1.0 posible (>0.05)
  • Correlación > 0.9
⚖️
Balance entre calidad y tiempo:
  • Un TabDSFidelity > 8.0 indica excelente calidad
  • Tiempos de generación < 200s son aceptables
  • La Correlación > 0.95 asegura buena preservación de relaciones
🔒
Para garantizar la privacidad:
  • MIA lo más cercano a 0.5 (ideal)
  • Copias exactas = 0 (ideal) o lo más bajo posible
  • Distancia promedio > 0.02 para buena separación
  • Evaluar balance entre calidad (TabDSFidelity) y privacidad (MIA)

📥 Descargar conjuntos y código Python

Formatos incluidos: CSV.

📚 Cómo citar este conjunto

Díaz Bastida, M., Pérez Vázquez, R. A., & Bello Pérez, R. (2026). High-Fidelity Synthetic Dataset for Hypertension Prediction (Version 1). figshare. https://doi.org/10.6084/m9.figshare.32934149.v1