CD_30 Original + Derivados

CD_30: Autism Spectrum Disorder Screening (Adult)

Conjunto de datos (704 instancias) para el cribado de autismo (TEA). La predicción se basa en las respuestas binarias al cuestionario AQ-10, datos demográficos y antecedentes familiares/médicos (ictericia). Metodológicamente destaca por la eliminación de la variable de suma total (result) para evitar data leakage y forzar al modelo a aprender la estructura latente de las respuestas.

📈 Eficacia Predictiva Detallada

Comparación detallada de las métricas de clasificación para los modelos entrenados con el conjunto de datos original y el conjunto sintético generado.

📊 Conjunto Original

Clase Precisión Recall F1-Score Soporte
Clase 0 0.90 0.99 0.94 103
Clase 1 0.96 0.71 0.82 38
Accuracy 0.91
Macro Avg 0.93 0.85 0.88 141
Weighted Avg 0.92 0.91 0.91 141
AUC-ROC: 0.97
F1-Score (weighted): 0.91
Accuracy: 0.91
➡️ Mejora
⬆ +0.03 AUC ⬆ +0.08 F1 ⬆ +0.08 Acc
🏆 MEJOR RENDIMIENTO

🔮 Conjunto Sintético

Clase Precisión Recall F1-Score Soporte
Clase 0 1.00 0.99 1.00 103
Clase 1 0.97 ⬆ +0.01 1.00 ⬆ +0.29 0.99 ⬆ +0.17 38
Accuracy 0.99 ⬆ +0.08
Macro Avg 0.99 ⬆ +0.06 1.00 ⬆ +0.15 0.99 ⬆ +0.11 141
Weighted Avg 0.99 ⬆ +0.07 0.99 ⬆ +0.08 0.99 ⬆ +0.08 141
AUC-ROC: 1.00 ⬆ +0.03
F1-Score (weighted): 0.99 ⬆ +0.08
Accuracy: 0.99 ⬆ +0.08

📊 Resumen de Mejoras en Clase Minoritaria (Clase 1)

🎯
Precisión
Original: 0.96
Sintético: 0.97
⬆ +0.01
📈
Recall
Original: 0.71
Sintético: 1.00
⬆ +0.29
⚖️
F1-Score
Original: 0.82
Sintético: 0.99
⬆ +0.17

📚 Fuente Original del Conjunto

Autism Screening Adult Dataset

v1.0
Datos de screening de Trastorno del Espectro Autista (TEA)
Publicado: 23 de diciembre de 2017

📄 Resumen (Abstract)

El conjunto de datos de Screening de Autismo para Adultos (Autism Screening Adult) contiene información de 704 instancias con 20 atributos relacionados con la clasificación y tareas predictivas para el Trastorno del Espectro Autista (TEA). El conjunto incluye las puntuaciones de las 10 preguntas del cuestionario de screening AQ-10 (A1_Score a A10_Score), junto con información demográfica (edad, género, etnia), antecedentes médicos (ictericia, antecedentes familiares de TEA), país de residencia, uso previo de aplicaciones de screening y la relación del encuestado con el paciente. El objetivo es predecir si un adulto presenta o no Trastorno del Espectro Autista (variable class).

🧠 Contexto y Motivación

El Trastorno del Espectro Autista (TEA) es una condición del neurodesarrollo que afecta la comunicación, la interacción social y el comportamiento. Se estima que 1 de cada 100 niños en todo el mundo tiene TEA, según la Organización Mundial de la Salud. El diagnóstico temprano es fundamental para:

  • Acceder a intervenciones tempranas que mejoren el desarrollo
  • Recibir apoyo educativo y social adaptado a las necesidades
  • Mejorar la calidad de vida y la integración social
  • Reducir el impacto en la salud mental y el bienestar

El cuestionario AQ-10 (Autism Spectrum Quotient - 10 items) es una herramienta de screening breve y validada que ayuda a identificar a adultos que pueden estar en el espectro autista y que podrían beneficiarse de una evaluación diagnóstica completa. Este dataset permite desarrollar modelos predictivos que automaticen el screening y faciliten la identificación temprana de casos.

📊 Descripción de Datos

El dataset contiene 704 instancias con 20 atributos (19 variables predictoras y 1 variable objetivo). Las características son de tipo entero y categórico. El conjunto presenta valores faltantes en algunas variables.

📋 Variables del Dataset
Variable Tipo Descripción Valores Faltantes
A. Preguntas del Cuestionario AQ-10 (Screening)
A1_Score Entero Puntuación de la pregunta 1 del AQ-10 No
A2_Score Entero Puntuación de la pregunta 2 del AQ-10 No
A3_Score Entero Puntuación de la pregunta 3 del AQ-10 No
A4_Score Entero Puntuación de la pregunta 4 del AQ-10 No
A5_Score Entero Puntuación de la pregunta 5 del AQ-10 No
A6_Score Entero Puntuación de la pregunta 6 del AQ-10 No
A7_Score Entero Puntuación de la pregunta 7 del AQ-10 No
A8_Score Entero Puntuación de la pregunta 8 del AQ-10 No
A9_Score Entero Puntuación de la pregunta 9 del AQ-10 No
A10_Score Entero Puntuación de la pregunta 10 del AQ-10 No
B. Datos Demográficos
age Entero Edad del paciente
gender Categórica Género del paciente No
ethnicity Categórica Etnia del paciente
C. Antecedentes Médicos
jaundice Categórica Ictericia al nacer (sí/no) No
family_pdd Categórica Antecedentes familiares de TEA No
D. Contexto de la Evaluación
country_of_res Categórica País de residencia del paciente No
used_app_before Categórica ¿Ha usado una aplicación de screening antes? No
result Entero Puntuación total del AQ-10 (suma de A1-A10) No
age_desc Categórica Descripción de la edad (siempre "18 and above") No
relation Categórica Relación del encuestado con el paciente
E. Variable Objetivo
class Categórica (Target) Diagnóstico de Trastorno del Espectro Autista No

📋 Características del Dataset

  • Tipo de problema: Clasificación binaria (TEA vs. No TEA)
  • Dimensión: Multivariante
  • Tipo de características: Enteros y Categóricas
  • Valores faltantes: Sí (en age, ethnicity, relation)
  • Área de aplicación: Salud Mental, Psicología, Neurodesarrollo
  • Herramienta de screening: AQ-10 (Autism Spectrum Quotient - 10 items)

📖 Instrumento: Cuestionario AQ-10

El Autism Spectrum Quotient (AQ-10) es una herramienta de screening breve diseñada para identificar adultos que pueden estar en el espectro autista. El cuestionario consta de 10 preguntas que evalúan diferentes aspectos del comportamiento y la comunicación social. Las preguntas (A1 a A10) cubren áreas como:

  • Habilidades sociales (dificultad para comprender convenciones sociales)
  • Atención a los detalles (tendencia a notar patrones y detalles)
  • Comunicación (dificultad para entender el lenguaje figurado)
  • Flexibilidad cognitiva (resistencia a cambios en la rutina)
  • Intereses restringidos (enfoque intenso en temas específicos)

Una puntuación total (variable result) mayor a cierto umbral sugiere la necesidad de una evaluación diagnóstica completa.

⚖️ Ética y Privacidad

El conjunto de datos ha sido anonimizado para proteger la privacidad de los participantes. No contiene información personal identificable como nombres, direcciones o números de identificación. Restricción de confidencialidad: En cumplimiento de los protocolos de privacidad, el uso de los datos está restringido a fines académicos y de investigación. La publicación de resultados debe limitarse a métricas de evaluación, resultados agregados y metodología del modelo, sin divulgación de información que permita la reidentificación de pacientes.

📋 Notas de Uso

Este conjunto de datos está diseñado para la clasificación de Trastorno del Espectro Autista en adultos. Se recomienda:

  • Manejar adecuadamente los valores faltantes:
    • Edad: imputación por media o mediana
    • Etnia y relación: imputación por moda o categoría "Unknown"
  • Las puntuaciones A1_Score a A10_Score son la base del screening y deben mantenerse como variables clave
  • La variable result es la suma total de las 10 preguntas (A1 + A2 + ... + A10) y puede ser redundante si ya se utilizan las puntuaciones individuales
  • La variable age_desc es constante ("18 and above") y no aporta valor predictivo (puede excluirse)
  • Codificar variables categóricas:
    • Binarias: Label Encoding (gender, jaundice, family_pdd, used_app_before)
    • Nominales: One-Hot Encoding (ethnicity, country_of_res, relation)
  • Estandarizar/normalizar la variable numérica age si se utiliza
  • La variable objetivo class está codificada como "YES" (TEA) y "NO" (sin TEA)
  • Utilizar validación cruzada estratificada para evaluar el rendimiento del modelo

💡 Importancia en Salud Mental

El Trastorno del Espectro Autista (TEA) es una condición del neurodesarrollo que afecta la comunicación, la interacción social y el comportamiento. Según la Organización Mundial de la Salud:

  • Se estima que 1 de cada 100 niños en todo el mundo tiene TEA
  • La prevalencia es 4 veces mayor en hombres que en mujeres
  • El diagnóstico temprano y las intervenciones adecuadas pueden mejorar significativamente la calidad de vida
  • El TEA a menudo se diagnostica en la infancia, pero los casos leves pueden pasar desapercibidos hasta la edad adulta

El desarrollo de modelos de screening basados en el AQ-10 puede facilitar la identificación temprana de adultos que podrían beneficiarse de una evaluación diagnóstica completa, reduciendo los tiempos de espera y mejorando el acceso a servicios de apoyo.

📖 Cómo citar la fuente original

Autism Screening Adult Dataset. UCI Machine Learning Repository. https://archive.ics.uci.edu/ml/datasets/Autism+Screening+Adult

📚 Referencias Adicionales

🔄 Transformaciones Aplicadas

Modificaciones realizadas al conjunto original (Autism Spectrum Disorder - Adults)

  • Lectura personalizada del formato ARFF:
    • Procesamiento manual del archivo .arff (Attribute-Relation File Format) extrayendo exclusivamente la sección @data.
    • Asignación de nombres de columnas basados en la especificación del dataset (21 variables en total).
    • Limpieza de caracteres especiales: eliminación de comillas y espacios en blanco en valores de texto (ej. 'United States' → United States).
  • Limpieza y tratamiento de valores faltantes:
    • Conversión de valores '?' (indicadores de "no disponible" en el dataset original) a NaN para su correcto tratamiento estadístico.
    • Imputación de edad: Relleno de valores faltantes en age con la mediana para preservar robustez frente a outliers.
    • Imputación de categóricas: Relleno de valores faltantes en ethnicity, relation y contry_of_res con la moda (valor más frecuente).
    • Conversión de age a tipo numérico para garantizar integridad de datos.
  • Eliminación de variables redundantes:
    • Eliminación de result (resultado del screening) para evitar Data Leakage — esta variable es idéntica al target.
    • Eliminación de age_desc (variable constante con valor "18 and more" en todos los registros) por no aportar información predictiva.
  • Codificación específica de variables categóricas:
    • Class/ASD (Target): Mapeo manual ('NO' → 0 = Sin rasgos suficientes, 'YES' → 1 = Con rasgos de espectro autista).
    • Variables binarias: Mapeo manual de jundice, austim, used_app_before ('no' → 0, 'yes' → 1).
    • Gender: Mapeo manual ('f' → 0 = Femenino, 'm' → 1 = Masculino).
    • Variables nominales: Codificación ordinal (Label Encoding) para ethnicity, contry_of_res (país de residencia) y relation (relación del informante con el paciente).
  • Estandarización y optimización de tipos de datos:
    • Conversión forzada de las 10 variables de puntuación AQ-10 (A1_Score a A10_Score) a tipo entero (int) para eliminar decimales y optimizar memoria.
    • Preservación de todas las variables en tipos numéricos (enteros y flotantes).
  • Generación de documentación completa:
    • Creación del archivo leyenda_autism.txt con semántica completa de la variable objetivo y todas las variables predictoras.
    • Documentación de las 10 variables del test AQ-10 (puntuaciones 0/1).
    • Mapeo completo de variables binarias (jundice, austim, used_app_before, gender).
    • Mapeo completo de variables nominales codificadas (ethnicity, contry_of_res, relation).
    • Nota sobre eliminación de result (Data Leakage) y age_desc (constante).
  • Preservación de la estructura y calidad de datos:
    • Mantenimiento de las instancias originales (sin eliminación de filas).
    • Dataset final con 18 variables predictoras (10 del test AQ-10 + 8 demográficas/clínicas) y 1 variable objetivo binaria.
    • Guardado en formato CSV con separador punto y coma (;) para compatibilidad internacional.

📊 Resultado: Dataset de pacientes adultos (≈700 registros) con 18 variables predictoras (10 puntuaciones AQ-10 + 8 demográficas/clínicas) y 1 variable objetivo binaria (Class/ASD). Desbalance moderado (~65% sin rasgos autistas / ~35% con rasgos) — escenario ideal para validación de técnicas de generación de datos sintéticos y evaluación del índice TabDSFidelity en contextos de detección temprana de trastornos del espectro autista, donde los cuestionarios de screening (AQ-10) y factores demográficos juegan un papel crucial.

🧩 Fuente: Autism Spectrum Disorder Screening Dataset (UCI Machine Learning Repository).

📋 Variables del test AQ-10: 10 preguntas de screening (0 = No, 1 = Sí) que evalúan rasgos de espectro autista en adultos.

👤 Variables demográficas: Edad, género, etnicidad, país de residencia, relación del informante, historial de ictericia, diagnóstico previo de autismo, uso previo de aplicación de screening.

📁 Leyenda disponible: Archivo leyenda_autism.txt con mapeo semántico completo de la variable objetivo, variables binarias (jundice, austim, used_app_before, gender), y variables nominales codificadas (ethnicity, contry_of_res, relation).

🎯 Variable objetivo: Class/ASD (1 = Presenta rasgos de espectro autista, 0 = No presenta rasgos suficientes).

⚠️ Prevención de Data Leakage: Eliminación de la variable result (idéntica al target) para evitar sobreajuste y garantizar la validez del modelo predictivo.

📋 Diccionario de Datos Detallado

Variable Descripción Clínica Tipo Rango / Categorías Unidad ¿Objetivo?
ethnicity Origen étnico del participante Categórico 0-9 (ver leyenda) N/A No
contry_of_res País de residencia del participante Categórico Múltiples códigos (ver leyenda) N/A No
relation Relación de quien completó el test con el participante Categórico 0: Health care professional, 1: Others, 2: Parent, 3: Relative, 4: Self N/A No
age Edad del participante Numérico 17 - 383 años No
A1_Score Pregunta 1: Capacidad para leer el lenguaje corporal / gestos Binario 0: No, 1: Sí N/A No
A2_Score Pregunta 2: Preferencia por detalles en lugar del panorama general Binario 0: No, 1: Sí N/A No
A3_Score Pregunta 3: Dificultad para entender intenciones de otros Binario 0: No, 1: Sí N/A No
A4_Score Pregunta 4: Facilidad para conversar con extraños Binario 0: No, 1: Sí N/A No
A5_Score Pregunta 5: Preferencia por seguir rutinas repetitivas Binario 0: No, 1: Sí N/A No
A6_Score Pregunta 6: Dificultad para mantener conversación Binario 0: No, 1: Sí N/A No
A7_Score Pregunta 7: Sensibilidad a sonidos y ruidos Binario 0: No, 1: Sí N/A No
A8_Score Pregunta 8: Dificultad para entender el sarcasmo Binario 0: No, 1: Sí N/A No
A9_Score Pregunta 9: Dificultad para reconocer emociones en otros Binario 0: No, 1: Sí N/A No
A10_Score Pregunta 10: Preferencia por patrones y rutinas rígidas Binario 0: No, 1: Sí N/A No
gender Género del participante Binario 0: Femenino, 1: Masculino N/A No
jundice Ictericia al nacer (factor de riesgo) Binario 0: No, 1: Sí N/A No
austim Familiar con diagnóstico de autismo (factor genético) Binario 0: No, 1: Sí N/A No
used_app_before Ha usado la aplicación anteriormente (control de validez) Binario 0: No, 1: Sí N/A No
Class_ASD Clasificación de Trastorno del Espectro Autista (objetivo) Binario 0: NO (No presenta rasgos), 1: YES (Presenta rasgos) N/A
19 Variables totales
1 Numéricas
3 Categóricas
15 Binarias
Objetivo: Autismo (Class_ASD)
Datos ausentes: 0%

📈 Distribución de la variable objetivo en el conjunto original

📖 Leyenda de Variables Categóricas

Esta sección detalla los códigos y significados de las variables categóricas y binarias presentes en el conjunto de datos de Cribado de Trastorno del Espectro Autista (ASD). Comprender estas codificaciones es fundamental para la correcta interpretación de los resultados clínicos y psicológicos.

ethnicity Categórica
Código Significado
0Asian (Asiática)
1Black (Negra)
2Hispanic (Hispana)
3Latino (Latina)
4Middle Eastern (Medio Oriente)
5Others (Otros)
6Pasifika (Islas del Pacífico)
7South Asian (Sur de Asia)
8Turkish (Turca)
9White-European (Blanca Europea)
10others (Otros - adicional)
contry_of_res Categórica

Códigos de país de residencia (selección representativa)

0 Afghanistan
1 AmericanSamoa
2 Angola
3 Argentina
4 Armenia
5 Aruba
6 Australia
7 Austria
8 Azerbaijan
9 Bahamas
10 Bangladesh
11 Belgium
12 Bolivia
13 Brazil
14 Burundi
15 Canada
17 China
18 Costa Rica
19 Cyprus
20 Czech Republic
21 Ecuador
22 Egypt
23 Ethiopia
24 Finland
25 France
26 Germany
27 Hong Kong
28 Iceland
29 India
3 Argentina
31 Indonesia
32 Iran
33 Iraq
34 Ireland
35 Italy
36 Japan
39 Malaysia
4 Armenia
40 Mexico
42 Nepal
43 Netherlands
44 New Zealand
47 Pakistan
48 Philippines
5 Aruba
50 Portugal
51 Romania
52 Russia
53 Saudi Arabia
54 Serbia
55 Sierra Leone
56 South Africa
57 Spain
58 Sri Lanka
59 Sweden
6 Australia
60 Tonga
62 Turkey
63 Ukraine
64 United Arab Emirates
65 United Kingdom
66 United States
7 Austria
9 Bahamas
⚠️

Nota: ~67 países.

relation Categórica
Código Significado
0Health care professional (Profesional de la salud)
1Others (Otros)
2Parent (Padre/Madre)
3Relative (Familiar)
4Self (El mismo participante)
Variables Binarias Binario

Formato común: 0 = No / Ausencia, 1 = Sí / Presencia

A1_Score Lenguaje corporal / gestos
A2_Score Preferencia por detalles vs. panorama general
A3_Score Dificultad para entender intenciones de otros
A4_Score Facilidad para conversar con extraños
A5_Score Preferencia por rutinas repetitivas
A6_Score Dificultad para mantener conversación
A7_Score Sensibilidad a sonidos y ruidos
A8_Score Dificultad para entender sarcasmo
A9_Score Dificultad para reconocer emociones
A10_Score Preferencia por patrones rígidos
gender Género (0: Femenino, 1: Masculino)
jundice Ictericia al nacer (0: No, 1: Sí)
austim Familiar con autismo (0: No, 1: Sí)
used_app_before Usó la aplicación antes (0: No, 1: Sí)
Class_ASD 🎯 Variable Objetivo: Trastorno del Espectro Autista (0: No, 1: Sí)
ℹ️

Nota: Todas las variables binarias están codificadas como 0 = No y 1 = Sí.

📊
Variables categóricas: 3
  • ethnicity (11 categorías étnicas)
  • contry_of_res (~67 países codificados)
  • relation (5 tipos de relación)
🎯
Variables binarias: 15
  • 10 variables del test AQ-10 (A1_Score a A10_Score)
  • gender, jundice, austim, used_app_before
  • 🎯 Class_ASD (Objetivo - Autismo)
📈
Variables numéricas: 1
  • age (Edad en años - 17 a 383)
⚠️
Recomendaciones para el Modelado:
  • Predictores clave: Las preguntas AQ-10 son el componente más importante del modelo
  • Factores de riesgo: austim (familiar con autismo) y jundice (ictericia neonatal) aumentan la probabilidad
  • Edad: Valores extremos (>100) pueden ser errores o valores atípicos
  • relation: Tests realizados por profesionales o padres pueden tener mayor precisión

🔬 Metodología de Generación (Reproducibilidad Científica)

📐 Método Principal

SMOTE RSB* Adaptado

Versión: 2.0

DOI: 10.1007/s42979-026-04896-8

📏 Reglas de restricción

  • A1_Score == 0 → Class_ASD = 0 (Sin puntuación → sin diagnóstico)
  • austim == 1 → A1_Score = 1 (Familiar con autismo → dificultad social presente)
  • relation == 0 → A2_Score = 1 (Profesional → al menos un ítem positivo)
  • Age < 4 → relation ≠ 0 (Niño pequeño → no evaluación profesional en app)
  • A2_Score == 1 → (Class_ASD = 1) OR (A7_Score = 1)
  • A3_Score == 1 → (Class_ASD = 1) OR (austim = 1)

⚙️ Hiperparámetros SMOTE RSB* Adaptado

Valor escala0.03
Probabilidad Base0.1

🔄 Hiperparámetros CTGAN

epochs500
batch_size50
generator_lr0.0002
discriminator_lr0.0002
pac10
generator_dim(256, 256)
discriminator_dim(256, 256)
embedding_dim128
l2scale1e-05

📊 Hiperparámetros TVAE

epochs 500
batch_size 50
embedding_dim 128
compress_dims (128, 128)
decompress_dims (128, 128)
l2scale 1e-5
loss_factor 2

🔐 Reproducibilidad

Random Seed42
Python3.12.12

Librerías utilizadas:

  • pandas: 2.3.3
  • numpy: 2.4.4
  • scikit-learn: 1.7.2
  • imbalanced-learn: 0.14.0
  • ctgan: 0.11.1
  • torch: 2.9.0
  • sdv: 1.28.0
  • scipy: 1.16.3
  • matplotlib: 3.10.9
📝

Para reproducir exactamente este conjunto de datos, ejecute el script de generación con la semilla aleatoria 42. Los resultados pueden variar ligeramente según la versión de las librerías.

📊 Conjuntos de Datos Derivados

El conjunto original ha sido sometido a un proceso de balanceo de clases y generación sintética para mejorar la representación de clases minoritarias. Nota: se ha empleado un conjunto de validación para evaluar el índice de fidelidad. Se han generado tres familias de conjuntos:

  • 📊 Balanceados: Conjuntos creados mediante técnicas de sobremuestreo
  • 🔮 Sintéticos Puros: Conjuntos generados completamente con modelos generativos
  • ✨ Aumentados: Combinación del conjunto original + datos sintéticos

El mejor conjunto de cada etapa fue seleccionado mediante el índiceTabDSFidelity.

📊 Conjuntos Balanceados 8 conjuntos

Algoritmo Ratio N° Ejemplos AUC-ROC F1 Accuracy TabDSFidelity Jensen-Shannon Kolmogorov-Smirnov Kullback-Leibler Correlación Tiempo Total (s) Dist. Promedio Copias Exactas Ataque MIA Mejor
Random Oversampling 1 618 1.000 0.993 0.993 9.510 0.083 0.813 0.026 0.966 47.020 0 618 0.520
Smote 1 618 0.997 0.979 0.979 8.601 0.319 0.974 0.019 0.967 49.378 0.030 436 0.508
Borderline SMOTE 1 618 0.997 0.979 0.979 7.913 0.325 0.322 0.020 0.966 49.867 0.030 436 0.499
ADASYN 1.023 625 1.000 0.972 0.972 8.196 0.331 0.651 0.021 0.966 49.942 0.032 435 0.489
SMOTE RSB* Adaptado 1.367 535 1.000 1.000 1.000 9.985 0.050 1.000 0.012 0.975 46.642 0.017 433 0.492 🏆
SMOTE RSB* Adaptado + Reglas 1.367 535 1.000 0.986 0.986 9.799 0.051 1.000 0.012 0.976 46.943 0.017 426 0.493
OOF PSO para Balanceo 1 618 1.000 0.978 0.979 6.278 0.298 0.000 0.095 0.777 66.497 0.083 422 0.471
OOF PSO para Balanceo + Reglas 1.664 618 0.911 0.705 0.688 0.000 0.345 0.000 0.126 0.749 58.254 0.115 258 0.482
Mejor seleccionado: SMOTE RSB* Adaptado (TabDSFidelity: 9.985, AUC: 1.000, F1: 1.000, MIA: 0.492). Nota: Ratio <= 1.5 = Conjunto Balanceado.

🔮 Conjuntos Sintéticos Puros 10 conjuntos

Algoritmo Ratio N° Ejemplos AUC-ROC F1 Accuracy TabDSFidelity Jensen-Shannon Kolmogorov-Smirnov Kullback-Leibler Correlación Tiempo Total (s) Dist. Promedio Copias Exactas Ataque MIA Mejor
SMOTE RSB* + Ruido Gaussiano 1.350 3676 0.998 0.972 0.972 9.359 0.078 0.997 0.109 0.964 58.447 0.155 0 0.458
SMOTE RSB* + Ruido Gaussiano + Reglas 1.214 3676 0.863 0.691 0.674 3.812 0.078 0.997 0.123 0.946 155.403 0.169 0 0.462
CTGAN 1.805 9716 0.964 0.859 0.865 6.658 0.235 0.000 0.045 0.921 324.098 0.140 0 0.510
CTGAN + Reglas del Dominio 1.124 9716 0.837 0.678 0.660 2.535 0.235 0.000 0.056 0.917 468.981 0.146 0 0.507
TVAE 1.553 9201 0.998 0.971 0.972 8.699 0.147 0.033 0.042 0.944 161.982 0.098 0 0.527
TVAE + Reglas del Dominio 1.102 9201 0.864 0.698 0.681 3.328 0.147 0.033 0.052 0.941 298.428 0.107 0 0.480
OOF PSO para Aumento 1 10000 0.992 0.806 0.794 3.632 0.652 0.000 0.202 0.680 120.475 0.113 0 0.531
OOF PSO para Aumento + Reglas 1.006 10000 0.974 0.711 0.695 2.204 0.652 0.000 0.210 0.701 266.058 0.132 0 0.517
SMOTE RSB* Refinado 1.265 5352 1.000 0.972 0.972 9.764 0.072 0.991 0.064 0.971 60.036 0.129 0 0.503 🏆
SMOTE RSB* Refinado + Reglas 1.317 5352 0.884 0.711 0.695 4.731 0.072 0.991 0.078 0.952 162.394 0.145 0 0.498
Mejor seleccionado: SMOTE RSB* Refinado (TabDSFidelity: 9.764, AUC: 1.000, F1: 0.972, MIA: 0.503). Nota: Ratio <= 1.5 = Conjunto Balanceado.

✨ Conjuntos Aumentados 10 conjuntos

Algoritmo Ratio N° Ejemplos AUC-ROC F1 Accuracy TabDSFidelity Jensen-Shannon Kolmogorov-Smirnov Kullback-Leibler Correlación Tiempo Total (s) Dist. Promedio Copias Exactas Ataque MIA Mejor
SMOTE RSB* + Ruido Gaussiano 1.353 4211 0.999 0.979 0.979 9.285 0.073 0.998 0.086 0.968 107.363 0.137 208 0.468
SMOTE RSB* + Ruido Gaussiano + Reglas 1.139 4211 0.955 0.838 0.830 6.248 0.073 0.998 0.097 0.952 202.260 0.150 208 0.470
CTGAN 1.778 10251 0.976 0.906 0.908 6.921 0.225 0.000 0.035 0.924 400.217 0.133 93 0.500
CTGAN + Reglas del Dominio 1.136 10251 0.901 0.732 0.716 2.738 0.225 0.000 0.045 0.921 540.636 0.138 93 0.482
TVAE 1.542 9736 0.997 0.957 0.957 8.215 0.139 0.049 0.038 0.947 232.356 0.091 97 0.530
TVAE + Reglas del Dominio 1.078 9736 0.912 0.732 0.716 3.114 0.139 0.049 0.047 0.945 367.448 0.100 97 0.476
OOF PSO para Aumento 1.016 10535 0.999 0.979 0.979 5.892 0.617 0.000 0.168 0.694 194.276 0.109 88 0.490
OOF PSO para Aumento + Reglas 1.010 10535 0.999 0.979 0.979 5.965 0.617 0.000 0.175 0.714 339.941 0.126 88 0.523
SMOTE RSB* Refinado 1.274 5887 0.999 0.986 0.986 9.707 0.069 0.994 0.056 0.973 111.523 0.117 170 0.511 🏆
SMOTE RSB* Refinado + Reglas 1.248 5887 0.941 0.718 0.702 4.460 0.069 0.994 0.068 0.955 214.862 0.132 170 0.485
Mejor seleccionado: SMOTE RSB* Refinado (TabDSFidelity: 9.707, AUC: 0.999, F1: 0.986, MIA: 0.511). Nota: Ratio <= 1.5 = Conjunto Balanceado.

📈 Diagrama del Proceso de Generación

Conjunto Original
CD_30
Balanceo
(8 métodos)
↓ Selección por TabDSFidelity
⭐ Mejor Balanceado
SMOTE RSB* Adaptado
Generación Sintética
(10 métodos)
↓ Evaluación TabDSFidelity
⭐ Mejor Sintético
SMOTE RSB* Refinado
⭐ Mejor Aumentado
SMOTE RSB* Refinado
Conjunto Sintético Final
Seleccionado por calidad

📊 Guía de Métricas de Evaluación

Para interpretar correctamente los resultados de los conjuntos de datos generados, es fundamental comprender qué mide cada métrica y cómo se relacionan entre sí. A continuación, se detalla cada una de las métricas utilizadas en la evaluación:

🎯 Métricas de Rendimiento Predictivo

AUC-ROC (0.5 - 1.0)

¿Qué mide? Capacidad del modelo para distinguir entre clases (Ej: mortalidad vs supervivencia).

Interpretación:

  • 0.5: Sin capacidad predictiva (aleatorio)
  • 0.7-0.8: Aceptable
  • 0.8-0.9: Excelente
  • >0.9: Sobresaliente

Ejemplo: AUC-ROC = 0.82 significa que hay un 82% de probabilidad de que el modelo clasifique correctamente un paciente fallecido frente a uno superviviente.

F1-Score (0 - 1.0)

¿Qué mide? Media armónica entre precisión y sensibilidad (recall).

Interpretación:

  • 0.7-0.8: Buen equilibrio entre precisión y sensibilidad
  • 0.8-0.9: Muy buen equilibrio
  • >0.9: Excelente equilibrio

Ejemplo: F1 = 0.76 indica que el modelo mantiene un buen balance entre identificar correctamente a los pacientes que fallecen (sensibilidad) y no etiquetar erróneamente a los que sobreviven (precisión).

Accuracy (0 - 1.0)

¿Qué mide? Proporción de predicciones correctas sobre el total.

Interpretación:

  • 0.7-0.8: Buen rendimiento general
  • 0.8-0.9: Muy buen rendimiento
  • >0.9: Excelente rendimiento

Ejemplo: Accuracy = 0.75 significa que el 75% de las predicciones del modelo son correctas.

⚠️ Nota: En conjuntos desbalanceados, esta métrica puede ser engañosa. Es mejor usar F1-Score o AUC-ROC.

🔬 Índice de Fidelidad del Conjunto

TabDSFidelity (0 - 10+)

¿Qué mide? Calidad global del conjunto sintético comparado con el original.

Interpretación:

  • < 3.0: Baja fidelidad (poca similitud con el original)
  • 3.0 - 6.0: Fidelidad moderada
  • 6.0 - 8.0: Alta fidelidad
  • > 8.0: Muy alta fidelidad (excelente representación)

Ejemplo: TabDSFidelity = 8.08 indica que el conjunto sintético mantiene una alta similitud con el original, preservando las relaciones y distribuciones de los datos reales, además de maximizar su eficacia predictiva.

💡 Importante: Este es el índice para seleccionar el mejor conjunto de datos sintéticos. Para este caso, el peso empleado para las métricas "AUC-ROC", "F1-Score" y "Accuracy" fue (2) y para el resto de las métricas fue (1).

📊 Métricas de Similitud de Distribuciones

Jensen-Shannon (Promedio) (0 - 1.0)

¿Qué mide? Similitud entre las distribuciones de variables numéricas del conjunto sintético y el original.

Interpretación:

  • Cerca de 0: Distribuciones muy similares (ideal)
  • 0.1 - 0.3: Diferencias moderadas
  • > 0.3: Diferencias significativas

Ejemplo: JS = 0.118 indica que las distribuciones de las variables numéricas (edad, presión arterial, etc.) son bastante similares a las del conjunto original.

📌 Nota: Es el promedio de la divergencia de Jensen-Shannon calculada para todas las variables numéricas.

Kolmogorov-Smirnov (p-valor promedio) (0 - 1.0)

¿Qué mide? Probabilidad estadística de que las muestras numéricas del conjunto sintético provengan de la misma distribución continua que el original.

Interpretación:

  • Cerca de 1.0: Altísima probabilidad de que sean la misma distribución (ideal)
  • > 0.05: Similitud aceptable (no se rechaza que sean iguales)
  • < 0.05: Diferencias estadísticamente significativas

Ejemplo: KS p-valor = 0.753 indica que hay evidencia fuerte a favor de que las distribuciones acumulativas de la variable sintética y la original son equivalentes.

📌 Nota: Se reporta el promedio de los p-valores obtenidos mediante la prueba de Kolmogorov-Smirnov de dos muestras para las variables numéricas.

Kullback-Leibler (Promedio) (0 - ∞)

¿Qué mide? Divergencia entre las distribuciones de variables categóricas del conjunto sintético y el original.

Interpretación:

  • Cerca de 0: Distribuciones muy similares (ideal)
  • 0.01 - 0.1: Diferencias pequeñas
  • > 0.1: Diferencias notables

Ejemplo: KL = 0.014 indica que la distribución de las variables categóricas (género, mortalidad) es muy similar a la del conjunto original.

📌 Nota: Es el promedio de la divergencia de Kullback-Leibler para todas las variables categóricas. A diferencia de JS y KS, esta métrica se aplica solo a variables categóricas.

📊 Métricas de Estructura

Similitud de Correlación (0 - 1.0)

¿Qué mide? Preservación de las relaciones entre variables del conjunto original.

Interpretación:

  • Cerca de 1.0: Las relaciones entre variables se mantienen casi idénticas
  • > 0.9: Excelente preservación de relaciones
  • 0.7 - 0.9: Buena preservación
  • < 0.7: Pérdida significativa de relaciones

Ejemplo: Correlación = 0.976 significa que las relaciones entre variables (ej. edad y mortalidad) se mantienen en un 97.6% respecto al conjunto original.

⏱️ Métricas de Rendimiento Temporal

Tiempo Total (s) (segundos)

¿Qué mide? Tiempo total de ejecución del proceso de generación del conjunto.

Interpretación:

  • < 100s: Generación rápida
  • 100-300s: Tiempo moderado
  • > 300s: Proceso lento (puede ser aceptable para conjuntos grandes)

Ejemplo: Tiempo total = 69.45s significa que el proceso completo de generación del conjunto balanceado tomó aproximadamente 1.16 minutos.

⏱️ Nota: Incluye el tiempo de generación sintética + cálculo de métricas.

🔒 Métricas de Privacidad

Estas métricas evalúan el riesgo de exposición de información sensible y la capacidad de un atacante para inferir datos de los pacientes a partir del conjunto de datos sintéticos.

Distancia al Registro Más Cercano (≥ 0)

¿Qué mide? La distancia promedio entre cada registro sintético y su registro más cercano en el conjunto de datos original.

Interpretación:

  • Cerca de 0: Los datos sintéticos son muy similares a los originales → ⚠️ ALTO RIESGO de privacidad
  • 0.01 - 0.05: Similaridad moderada → Riesgo moderado
  • > 0.05: Buena separación de los datos originales → ✅ BAJO RIESGO de privacidad

Ejemplo: Distancia promedio = 0.015 en SMOTE indica que los registros sintéticos están relativamente cerca de los originales, lo que podría implicar un riesgo de privacidad moderado.

🔬

Metodología: Calculada utilizando la Distancia de Gower, la cual maneja internamente tipos de datos mixtos, normalizando las variables numéricas y penalizando diferencias categóricas para devolver un índice estandarizado entre 0 y 1.

💡

Recomendación: Valores < 0.01 deben ser evaluados con precaución. Idealmente, buscar valores > 0.02 para garantizar la privacidad.

Copias Exactas (≥ 0)

¿Qué mide? Número de registros sintéticos que son copias idénticas de registros en el conjunto de datos original.

Interpretación:

  • 0: Ninguna copia exacta → ✅ SEGURO
  • 1 - 10: Pocas copias → Riesgo bajo
  • 11 - 50: Copias moderadas → ⚠️ RIESGO MODERADO
  • > 50: Muchas copias → 🔴 ALTO RIESGO de reidentificación

Ejemplo: SMOTE RSB* Refinado genera 76 copias exactas de 8817 registros (0.86%), lo que representa un riesgo de privacidad que debe ser evaluado.

⚠️

Importante: La presencia de copias exactas es uno de los indicadores más críticos de fuga de datos. Idealmente, este valor debe ser 0.

Ataque de Inferencia de Membresía (MIA) (0 - 1.0)

¿Qué mide? Tasa de éxito (medida en AUC-ROC) de un atacante para determinar si un registro específico pertenece al conjunto de datos original.

Interpretación:

  • 0.5: Aleatorio (ideal) → ✅ PRIVACIDAD ÓPTIMA
  • 0.5 - 0.55: Riesgo bajo
  • 0.55 - 0.6: Riesgo moderado → ⚠️ PRIVACIDAD CUESTIONABLE
  • > 0.6: Riesgo alto → 🔴 PRIVACIDAD COMPROMETIDA

Ejemplo: MIA = 0.553 significa que el atacante tiene un éxito ligeramente superior al 50% aleatorio, lo que indica un riesgo de privacidad bajo/moderado.

🎯

Objetivo: Buscar valores lo más cercanos a 0.5. Valores > 0.6 indican que el conjunto sintético no protege adecuadamente la privacidad.

📝 Resumen Rápido para Selección

🏆
Para seleccionar el mejor conjunto:
  • Priorizar TabDSFidelity más alto
  • Buscar AUC-ROC y F1 altos
  • Valores de divergencia JS y KL cercanos a 0
  • P-valor de KS lo más cercano a 1.0 posible (>0.05)
  • Correlación > 0.9
⚖️
Balance entre calidad y tiempo:
  • Un TabDSFidelity > 8.0 indica excelente calidad
  • Tiempos de generación < 200s son aceptables
  • La Correlación > 0.95 asegura buena preservación de relaciones
🔒
Para garantizar la privacidad:
  • MIA lo más cercano a 0.5 (ideal)
  • Copias exactas = 0 (ideal) o lo más bajo posible
  • Distancia promedio > 0.02 para buena separación
  • Evaluar balance entre calidad (TabDSFidelity) y privacidad (MIA)

📥 Descargar conjuntos y código Python

Formatos incluidos: CSV.

📚 Cómo citar este conjunto

Díaz Bastida, M., Pérez Vázquez, R. A., & Bello Pérez, R. (2026). High-Fidelity Synthetic Dataset for Autism Spectrum Disorder Screening - Adult (Version 1). figshare. https://doi.org/10.6084/m9.figshare.32938952.v1