Conjunto de datos (704 instancias) para el cribado de autismo (TEA). La predicción se basa en las respuestas binarias al cuestionario AQ-10, datos demográficos y antecedentes familiares/médicos (ictericia). Metodológicamente destaca por la eliminación de la variable de suma total (result) para evitar data leakage y forzar al modelo a aprender la estructura latente de las respuestas.
Comparación detallada de las métricas de clasificación para los modelos entrenados con el conjunto de datos original y el conjunto sintético generado.
| Clase | Precisión | Recall | F1-Score | Soporte |
|---|---|---|---|---|
| Clase 0 | 0.90 | 0.99 | 0.94 | 103 |
| Clase 1 | 0.96 | 0.71 | 0.82 | 38 |
| Accuracy | 0.91 | |||
| Macro Avg | 0.93 | 0.85 | 0.88 | 141 |
| Weighted Avg | 0.92 | 0.91 | 0.91 | 141 |
| Clase | Precisión | Recall | F1-Score | Soporte |
|---|---|---|---|---|
| Clase 0 | 1.00 | 0.99 | 1.00 | 103 |
| Clase 1 | 0.97 ⬆ +0.01 | 1.00 ⬆ +0.29 | 0.99 ⬆ +0.17 | 38 |
| Accuracy | 0.99 ⬆ +0.08 | |||
| Macro Avg | 0.99 ⬆ +0.06 | 1.00 ⬆ +0.15 | 0.99 ⬆ +0.11 | 141 |
| Weighted Avg | 0.99 ⬆ +0.07 | 0.99 ⬆ +0.08 | 0.99 ⬆ +0.08 | 141 |
El conjunto de datos de Screening de Autismo para Adultos (Autism Screening Adult) contiene información de 704 instancias con 20 atributos relacionados con la clasificación y tareas predictivas para el Trastorno del Espectro Autista (TEA). El conjunto incluye las puntuaciones de las 10 preguntas del cuestionario de screening AQ-10 (A1_Score a A10_Score), junto con información demográfica (edad, género, etnia), antecedentes médicos (ictericia, antecedentes familiares de TEA), país de residencia, uso previo de aplicaciones de screening y la relación del encuestado con el paciente. El objetivo es predecir si un adulto presenta o no Trastorno del Espectro Autista (variable class).
El Trastorno del Espectro Autista (TEA) es una condición del neurodesarrollo que afecta la comunicación, la interacción social y el comportamiento. Se estima que 1 de cada 100 niños en todo el mundo tiene TEA, según la Organización Mundial de la Salud. El diagnóstico temprano es fundamental para:
El cuestionario AQ-10 (Autism Spectrum Quotient - 10 items) es una herramienta de screening breve y validada que ayuda a identificar a adultos que pueden estar en el espectro autista y que podrían beneficiarse de una evaluación diagnóstica completa. Este dataset permite desarrollar modelos predictivos que automaticen el screening y faciliten la identificación temprana de casos.
El dataset contiene 704 instancias con 20 atributos (19 variables predictoras y 1 variable objetivo). Las características son de tipo entero y categórico. El conjunto presenta valores faltantes en algunas variables.
| Variable | Tipo | Descripción | Valores Faltantes |
|---|---|---|---|
| A. Preguntas del Cuestionario AQ-10 (Screening) | |||
| A1_Score | Entero | Puntuación de la pregunta 1 del AQ-10 | No |
| A2_Score | Entero | Puntuación de la pregunta 2 del AQ-10 | No |
| A3_Score | Entero | Puntuación de la pregunta 3 del AQ-10 | No |
| A4_Score | Entero | Puntuación de la pregunta 4 del AQ-10 | No |
| A5_Score | Entero | Puntuación de la pregunta 5 del AQ-10 | No |
| A6_Score | Entero | Puntuación de la pregunta 6 del AQ-10 | No |
| A7_Score | Entero | Puntuación de la pregunta 7 del AQ-10 | No |
| A8_Score | Entero | Puntuación de la pregunta 8 del AQ-10 | No |
| A9_Score | Entero | Puntuación de la pregunta 9 del AQ-10 | No |
| A10_Score | Entero | Puntuación de la pregunta 10 del AQ-10 | No |
| B. Datos Demográficos | |||
| age | Entero | Edad del paciente | Sí |
| gender | Categórica | Género del paciente | No |
| ethnicity | Categórica | Etnia del paciente | Sí |
| C. Antecedentes Médicos | |||
| jaundice | Categórica | Ictericia al nacer (sí/no) | No |
| family_pdd | Categórica | Antecedentes familiares de TEA | No |
| D. Contexto de la Evaluación | |||
| country_of_res | Categórica | País de residencia del paciente | No |
| used_app_before | Categórica | ¿Ha usado una aplicación de screening antes? | No |
| result | Entero | Puntuación total del AQ-10 (suma de A1-A10) | No |
| age_desc | Categórica | Descripción de la edad (siempre "18 and above") | No |
| relation | Categórica | Relación del encuestado con el paciente | Sí |
| E. Variable Objetivo | |||
| class | Categórica (Target) | Diagnóstico de Trastorno del Espectro Autista | No |
El Autism Spectrum Quotient (AQ-10) es una herramienta de screening breve diseñada para identificar adultos que pueden estar en el espectro autista. El cuestionario consta de 10 preguntas que evalúan diferentes aspectos del comportamiento y la comunicación social. Las preguntas (A1 a A10) cubren áreas como:
Una puntuación total (variable result) mayor a cierto umbral sugiere la necesidad de una evaluación diagnóstica completa.
El conjunto de datos ha sido anonimizado para proteger la privacidad de los participantes. No contiene información personal identificable como nombres, direcciones o números de identificación. Restricción de confidencialidad: En cumplimiento de los protocolos de privacidad, el uso de los datos está restringido a fines académicos y de investigación. La publicación de resultados debe limitarse a métricas de evaluación, resultados agregados y metodología del modelo, sin divulgación de información que permita la reidentificación de pacientes.
Este conjunto de datos está diseñado para la clasificación de Trastorno del Espectro Autista en adultos. Se recomienda:
A1_Score a A10_Score son la base del screening y deben mantenerse como variables claveresult es la suma total de las 10 preguntas (A1 + A2 + ... + A10) y puede ser redundante si ya se utilizan las puntuaciones individualesage_desc es constante ("18 and above") y no aporta valor predictivo (puede excluirse)age si se utilizaclass está codificada como "YES" (TEA) y "NO" (sin TEA)El Trastorno del Espectro Autista (TEA) es una condición del neurodesarrollo que afecta la comunicación, la interacción social y el comportamiento. Según la Organización Mundial de la Salud:
El desarrollo de modelos de screening basados en el AQ-10 puede facilitar la identificación temprana de adultos que podrían beneficiarse de una evaluación diagnóstica completa, reduciendo los tiempos de espera y mejorando el acceso a servicios de apoyo.
Autism Screening Adult Dataset. UCI Machine Learning Repository. https://archive.ics.uci.edu/ml/datasets/Autism+Screening+Adult
📊 Resultado: Dataset de pacientes adultos (≈700 registros) con 18 variables predictoras (10 puntuaciones AQ-10 + 8 demográficas/clínicas) y 1 variable objetivo binaria (Class/ASD). Desbalance moderado (~65% sin rasgos autistas / ~35% con rasgos) — escenario ideal para validación de técnicas de generación de datos sintéticos y evaluación del índice TabDSFidelity en contextos de detección temprana de trastornos del espectro autista, donde los cuestionarios de screening (AQ-10) y factores demográficos juegan un papel crucial.
🧩 Fuente: Autism Spectrum Disorder Screening Dataset (UCI Machine Learning Repository).
📋 Variables del test AQ-10: 10 preguntas de screening (0 = No, 1 = Sí) que evalúan rasgos de espectro autista en adultos.
👤 Variables demográficas: Edad, género, etnicidad, país de residencia, relación del informante, historial de ictericia, diagnóstico previo de autismo, uso previo de aplicación de screening.
📁 Leyenda disponible: Archivo leyenda_autism.txt con mapeo semántico completo de la variable objetivo, variables binarias (jundice, austim, used_app_before, gender), y variables nominales codificadas (ethnicity, contry_of_res, relation).
🎯 Variable objetivo: Class/ASD (1 = Presenta rasgos de espectro autista, 0 = No presenta rasgos suficientes).
⚠️ Prevención de Data Leakage: Eliminación de la variable result (idéntica al target) para evitar sobreajuste y garantizar la validez del modelo predictivo.
| Variable | Descripción Clínica | Tipo | Rango / Categorías | Unidad | ¿Objetivo? |
|---|---|---|---|---|---|
ethnicity |
Origen étnico del participante | Categórico | 0-9 (ver leyenda) | N/A | No |
contry_of_res |
País de residencia del participante | Categórico | Múltiples códigos (ver leyenda) | N/A | No |
relation |
Relación de quien completó el test con el participante | Categórico | 0: Health care professional, 1: Others, 2: Parent, 3: Relative, 4: Self | N/A | No |
age |
Edad del participante | Numérico | 17 - 383 | años | No |
A1_Score |
Pregunta 1: Capacidad para leer el lenguaje corporal / gestos | Binario | 0: No, 1: Sí | N/A | No |
A2_Score |
Pregunta 2: Preferencia por detalles en lugar del panorama general | Binario | 0: No, 1: Sí | N/A | No |
A3_Score |
Pregunta 3: Dificultad para entender intenciones de otros | Binario | 0: No, 1: Sí | N/A | No |
A4_Score |
Pregunta 4: Facilidad para conversar con extraños | Binario | 0: No, 1: Sí | N/A | No |
A5_Score |
Pregunta 5: Preferencia por seguir rutinas repetitivas | Binario | 0: No, 1: Sí | N/A | No |
A6_Score |
Pregunta 6: Dificultad para mantener conversación | Binario | 0: No, 1: Sí | N/A | No |
A7_Score |
Pregunta 7: Sensibilidad a sonidos y ruidos | Binario | 0: No, 1: Sí | N/A | No |
A8_Score |
Pregunta 8: Dificultad para entender el sarcasmo | Binario | 0: No, 1: Sí | N/A | No |
A9_Score |
Pregunta 9: Dificultad para reconocer emociones en otros | Binario | 0: No, 1: Sí | N/A | No |
A10_Score |
Pregunta 10: Preferencia por patrones y rutinas rígidas | Binario | 0: No, 1: Sí | N/A | No |
gender |
Género del participante | Binario | 0: Femenino, 1: Masculino | N/A | No |
jundice |
Ictericia al nacer (factor de riesgo) | Binario | 0: No, 1: Sí | N/A | No |
austim |
Familiar con diagnóstico de autismo (factor genético) | Binario | 0: No, 1: Sí | N/A | No |
used_app_before |
Ha usado la aplicación anteriormente (control de validez) | Binario | 0: No, 1: Sí | N/A | No |
Class_ASD |
Clasificación de Trastorno del Espectro Autista (objetivo) | Binario | 0: NO (No presenta rasgos), 1: YES (Presenta rasgos) | N/A | Sí |
Esta sección detalla los códigos y significados de las variables categóricas y binarias presentes en el conjunto de datos de Cribado de Trastorno del Espectro Autista (ASD). Comprender estas codificaciones es fundamental para la correcta interpretación de los resultados clínicos y psicológicos.
ethnicity
Categórica
| Código | Significado |
|---|---|
| 0 | Asian (Asiática) |
| 1 | Black (Negra) |
| 2 | Hispanic (Hispana) |
| 3 | Latino (Latina) |
| 4 | Middle Eastern (Medio Oriente) |
| 5 | Others (Otros) |
| 6 | Pasifika (Islas del Pacífico) |
| 7 | South Asian (Sur de Asia) |
| 8 | Turkish (Turca) |
| 9 | White-European (Blanca Europea) |
| 10 | others (Otros - adicional) |
contry_of_res
Categórica
Códigos de país de residencia (selección representativa)
Nota: ~67 países.
relation
Categórica
| Código | Significado |
|---|---|
| 0 | Health care professional (Profesional de la salud) |
| 1 | Others (Otros) |
| 2 | Parent (Padre/Madre) |
| 3 | Relative (Familiar) |
| 4 | Self (El mismo participante) |
Formato común: 0 = No / Ausencia, 1 = Sí / Presencia
A1_Score
Lenguaje corporal / gestos
A2_Score
Preferencia por detalles vs. panorama general
A3_Score
Dificultad para entender intenciones de otros
A4_Score
Facilidad para conversar con extraños
A5_Score
Preferencia por rutinas repetitivas
A6_Score
Dificultad para mantener conversación
A7_Score
Sensibilidad a sonidos y ruidos
A8_Score
Dificultad para entender sarcasmo
A9_Score
Dificultad para reconocer emociones
A10_Score
Preferencia por patrones rígidos
gender
Género (0: Femenino, 1: Masculino)
jundice
Ictericia al nacer (0: No, 1: Sí)
austim
Familiar con autismo (0: No, 1: Sí)
used_app_before
Usó la aplicación antes (0: No, 1: Sí)
Class_ASD
🎯 Variable Objetivo: Trastorno del Espectro Autista (0: No, 1: Sí)
Nota: Todas las variables binarias están codificadas como 0 = No y 1 = Sí.
austim (familiar con autismo) y jundice (ictericia neonatal) aumentan la probabilidadA1_Score == 0 → Class_ASD = 0 (Sin puntuación → sin diagnóstico)austim == 1 → A1_Score = 1 (Familiar con autismo → dificultad social presente)relation == 0 → A2_Score = 1 (Profesional → al menos un ítem positivo)Age < 4 → relation ≠ 0 (Niño pequeño → no evaluación profesional en app)A2_Score == 1 → (Class_ASD = 1) OR (A7_Score = 1)A3_Score == 1 → (Class_ASD = 1) OR (austim = 1)| Valor escala | 0.03 |
|---|---|
| Probabilidad Base | 0.1 |
| epochs | 500 |
|---|---|
| batch_size | 50 |
| generator_lr | 0.0002 |
| discriminator_lr | 0.0002 |
| pac | 10 |
| generator_dim | (256, 256) |
| discriminator_dim | (256, 256) |
| embedding_dim | 128 |
| l2scale | 1e-05 |
| epochs | 500 |
|---|---|
| batch_size | 50 |
| embedding_dim | 128 |
| compress_dims | (128, 128) |
| decompress_dims | (128, 128) |
| l2scale | 1e-5 |
| loss_factor | 2 |
| Random Seed | 42 |
|---|---|
| Python | 3.12.12 |
Para reproducir exactamente este conjunto de datos, ejecute el script de generación con la semilla aleatoria 42.
Los resultados pueden variar ligeramente según la versión de las librerías.
El conjunto original ha sido sometido a un proceso de balanceo de clases y generación sintética para mejorar la representación de clases minoritarias. Nota: se ha empleado un conjunto de validación para evaluar el índice de fidelidad. Se han generado tres familias de conjuntos:
El mejor conjunto de cada etapa fue seleccionado mediante el índiceTabDSFidelity.
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Random Oversampling | 1 | 618 | 1.000 | 0.993 | 0.993 | 9.510 | 0.083 | 0.813 | 0.026 | 0.966 | 47.020 | 0 | 618 | 0.520 | |
| Smote | 1 | 618 | 0.997 | 0.979 | 0.979 | 8.601 | 0.319 | 0.974 | 0.019 | 0.967 | 49.378 | 0.030 | 436 | 0.508 | |
| Borderline SMOTE | 1 | 618 | 0.997 | 0.979 | 0.979 | 7.913 | 0.325 | 0.322 | 0.020 | 0.966 | 49.867 | 0.030 | 436 | 0.499 | |
| ADASYN | 1.023 | 625 | 1.000 | 0.972 | 0.972 | 8.196 | 0.331 | 0.651 | 0.021 | 0.966 | 49.942 | 0.032 | 435 | 0.489 | |
| SMOTE RSB* Adaptado | 1.367 | 535 | 1.000 | 1.000 | 1.000 | 9.985 | 0.050 | 1.000 | 0.012 | 0.975 | 46.642 | 0.017 | 433 | 0.492 | 🏆 |
| SMOTE RSB* Adaptado + Reglas | 1.367 | 535 | 1.000 | 0.986 | 0.986 | 9.799 | 0.051 | 1.000 | 0.012 | 0.976 | 46.943 | 0.017 | 426 | 0.493 | |
| OOF PSO para Balanceo | 1 | 618 | 1.000 | 0.978 | 0.979 | 6.278 | 0.298 | 0.000 | 0.095 | 0.777 | 66.497 | 0.083 | 422 | 0.471 | |
| OOF PSO para Balanceo + Reglas | 1.664 | 618 | 0.911 | 0.705 | 0.688 | 0.000 | 0.345 | 0.000 | 0.126 | 0.749 | 58.254 | 0.115 | 258 | 0.482 |
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SMOTE RSB* + Ruido Gaussiano | 1.350 | 3676 | 0.998 | 0.972 | 0.972 | 9.359 | 0.078 | 0.997 | 0.109 | 0.964 | 58.447 | 0.155 | 0 | 0.458 | |
| SMOTE RSB* + Ruido Gaussiano + Reglas | 1.214 | 3676 | 0.863 | 0.691 | 0.674 | 3.812 | 0.078 | 0.997 | 0.123 | 0.946 | 155.403 | 0.169 | 0 | 0.462 | |
| CTGAN | 1.805 | 9716 | 0.964 | 0.859 | 0.865 | 6.658 | 0.235 | 0.000 | 0.045 | 0.921 | 324.098 | 0.140 | 0 | 0.510 | |
| CTGAN + Reglas del Dominio | 1.124 | 9716 | 0.837 | 0.678 | 0.660 | 2.535 | 0.235 | 0.000 | 0.056 | 0.917 | 468.981 | 0.146 | 0 | 0.507 | |
| TVAE | 1.553 | 9201 | 0.998 | 0.971 | 0.972 | 8.699 | 0.147 | 0.033 | 0.042 | 0.944 | 161.982 | 0.098 | 0 | 0.527 | |
| TVAE + Reglas del Dominio | 1.102 | 9201 | 0.864 | 0.698 | 0.681 | 3.328 | 0.147 | 0.033 | 0.052 | 0.941 | 298.428 | 0.107 | 0 | 0.480 | |
| OOF PSO para Aumento | 1 | 10000 | 0.992 | 0.806 | 0.794 | 3.632 | 0.652 | 0.000 | 0.202 | 0.680 | 120.475 | 0.113 | 0 | 0.531 | |
| OOF PSO para Aumento + Reglas | 1.006 | 10000 | 0.974 | 0.711 | 0.695 | 2.204 | 0.652 | 0.000 | 0.210 | 0.701 | 266.058 | 0.132 | 0 | 0.517 | |
| SMOTE RSB* Refinado | 1.265 | 5352 | 1.000 | 0.972 | 0.972 | 9.764 | 0.072 | 0.991 | 0.064 | 0.971 | 60.036 | 0.129 | 0 | 0.503 | 🏆 |
| SMOTE RSB* Refinado + Reglas | 1.317 | 5352 | 0.884 | 0.711 | 0.695 | 4.731 | 0.072 | 0.991 | 0.078 | 0.952 | 162.394 | 0.145 | 0 | 0.498 |
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SMOTE RSB* + Ruido Gaussiano | 1.353 | 4211 | 0.999 | 0.979 | 0.979 | 9.285 | 0.073 | 0.998 | 0.086 | 0.968 | 107.363 | 0.137 | 208 | 0.468 | |
| SMOTE RSB* + Ruido Gaussiano + Reglas | 1.139 | 4211 | 0.955 | 0.838 | 0.830 | 6.248 | 0.073 | 0.998 | 0.097 | 0.952 | 202.260 | 0.150 | 208 | 0.470 | |
| CTGAN | 1.778 | 10251 | 0.976 | 0.906 | 0.908 | 6.921 | 0.225 | 0.000 | 0.035 | 0.924 | 400.217 | 0.133 | 93 | 0.500 | |
| CTGAN + Reglas del Dominio | 1.136 | 10251 | 0.901 | 0.732 | 0.716 | 2.738 | 0.225 | 0.000 | 0.045 | 0.921 | 540.636 | 0.138 | 93 | 0.482 | |
| TVAE | 1.542 | 9736 | 0.997 | 0.957 | 0.957 | 8.215 | 0.139 | 0.049 | 0.038 | 0.947 | 232.356 | 0.091 | 97 | 0.530 | |
| TVAE + Reglas del Dominio | 1.078 | 9736 | 0.912 | 0.732 | 0.716 | 3.114 | 0.139 | 0.049 | 0.047 | 0.945 | 367.448 | 0.100 | 97 | 0.476 | |
| OOF PSO para Aumento | 1.016 | 10535 | 0.999 | 0.979 | 0.979 | 5.892 | 0.617 | 0.000 | 0.168 | 0.694 | 194.276 | 0.109 | 88 | 0.490 | |
| OOF PSO para Aumento + Reglas | 1.010 | 10535 | 0.999 | 0.979 | 0.979 | 5.965 | 0.617 | 0.000 | 0.175 | 0.714 | 339.941 | 0.126 | 88 | 0.523 | |
| SMOTE RSB* Refinado | 1.274 | 5887 | 0.999 | 0.986 | 0.986 | 9.707 | 0.069 | 0.994 | 0.056 | 0.973 | 111.523 | 0.117 | 170 | 0.511 | 🏆 |
| SMOTE RSB* Refinado + Reglas | 1.248 | 5887 | 0.941 | 0.718 | 0.702 | 4.460 | 0.069 | 0.994 | 0.068 | 0.955 | 214.862 | 0.132 | 170 | 0.485 |
Para interpretar correctamente los resultados de los conjuntos de datos generados, es fundamental comprender qué mide cada métrica y cómo se relacionan entre sí. A continuación, se detalla cada una de las métricas utilizadas en la evaluación:
¿Qué mide? Capacidad del modelo para distinguir entre clases (Ej: mortalidad vs supervivencia).
Interpretación:
Ejemplo: AUC-ROC = 0.82 significa que hay un 82% de probabilidad de que el modelo clasifique correctamente un paciente fallecido frente a uno superviviente.
¿Qué mide? Media armónica entre precisión y sensibilidad (recall).
Interpretación:
Ejemplo: F1 = 0.76 indica que el modelo mantiene un buen balance entre identificar correctamente a los pacientes que fallecen (sensibilidad) y no etiquetar erróneamente a los que sobreviven (precisión).
¿Qué mide? Proporción de predicciones correctas sobre el total.
Interpretación:
Ejemplo: Accuracy = 0.75 significa que el 75% de las predicciones del modelo son correctas.
⚠️ Nota: En conjuntos desbalanceados, esta métrica puede ser engañosa. Es mejor usar F1-Score o AUC-ROC.
¿Qué mide? Calidad global del conjunto sintético comparado con el original.
Interpretación:
Ejemplo: TabDSFidelity = 8.08 indica que el conjunto sintético mantiene una alta similitud con el original, preservando las relaciones y distribuciones de los datos reales, además de maximizar su eficacia predictiva.
💡 Importante: Este es el índice para seleccionar el mejor conjunto de datos sintéticos. Para este caso, el peso empleado para las métricas "AUC-ROC", "F1-Score" y "Accuracy" fue (2) y para el resto de las métricas fue (1).
¿Qué mide? Similitud entre las distribuciones de variables numéricas del conjunto sintético y el original.
Interpretación:
Ejemplo: JS = 0.118 indica que las distribuciones de las variables numéricas (edad, presión arterial, etc.) son bastante similares a las del conjunto original.
📌 Nota: Es el promedio de la divergencia de Jensen-Shannon calculada para todas las variables numéricas.
¿Qué mide? Probabilidad estadística de que las muestras numéricas del conjunto sintético provengan de la misma distribución continua que el original.
Interpretación:
Ejemplo: KS p-valor = 0.753 indica que hay evidencia fuerte a favor de que las distribuciones acumulativas de la variable sintética y la original son equivalentes.
📌 Nota: Se reporta el promedio de los p-valores obtenidos mediante la prueba de Kolmogorov-Smirnov de dos muestras para las variables numéricas.
¿Qué mide? Divergencia entre las distribuciones de variables categóricas del conjunto sintético y el original.
Interpretación:
Ejemplo: KL = 0.014 indica que la distribución de las variables categóricas (género, mortalidad) es muy similar a la del conjunto original.
📌 Nota: Es el promedio de la divergencia de Kullback-Leibler para todas las variables categóricas. A diferencia de JS y KS, esta métrica se aplica solo a variables categóricas.
¿Qué mide? Preservación de las relaciones entre variables del conjunto original.
Interpretación:
Ejemplo: Correlación = 0.976 significa que las relaciones entre variables (ej. edad y mortalidad) se mantienen en un 97.6% respecto al conjunto original.
¿Qué mide? Tiempo total de ejecución del proceso de generación del conjunto.
Interpretación:
Ejemplo: Tiempo total = 69.45s significa que el proceso completo de generación del conjunto balanceado tomó aproximadamente 1.16 minutos.
⏱️ Nota: Incluye el tiempo de generación sintética + cálculo de métricas.
Estas métricas evalúan el riesgo de exposición de información sensible y la capacidad de un atacante para inferir datos de los pacientes a partir del conjunto de datos sintéticos.
¿Qué mide? La distancia promedio entre cada registro sintético y su registro más cercano en el conjunto de datos original.
Interpretación:
Ejemplo: Distancia promedio = 0.015 en SMOTE indica que los registros sintéticos están relativamente cerca de los originales, lo que podría implicar un riesgo de privacidad moderado.
Metodología: Calculada utilizando la Distancia de Gower, la cual maneja internamente tipos de datos mixtos, normalizando las variables numéricas y penalizando diferencias categóricas para devolver un índice estandarizado entre 0 y 1.
Recomendación: Valores < 0.01 deben ser evaluados con precaución. Idealmente, buscar valores > 0.02 para garantizar la privacidad.
¿Qué mide? Número de registros sintéticos que son copias idénticas de registros en el conjunto de datos original.
Interpretación:
Ejemplo: SMOTE RSB* Refinado genera 76 copias exactas de 8817 registros (0.86%), lo que representa un riesgo de privacidad que debe ser evaluado.
Importante: La presencia de copias exactas es uno de los indicadores más críticos de fuga de datos. Idealmente, este valor debe ser 0.
¿Qué mide? Tasa de éxito (medida en AUC-ROC) de un atacante para determinar si un registro específico pertenece al conjunto de datos original.
Interpretación:
Ejemplo: MIA = 0.553 significa que el atacante tiene un éxito ligeramente superior al 50% aleatorio, lo que indica un riesgo de privacidad bajo/moderado.
Objetivo: Buscar valores lo más cercanos a 0.5. Valores > 0.6 indican que el conjunto sintético no protege adecuadamente la privacidad.
Formatos incluidos: CSV.
Díaz Bastida, M., Pérez Vázquez, R. A., & Bello Pérez, R. (2026). High-Fidelity Synthetic Dataset for Autism Spectrum Disorder Screening - Adult (Version 1). figshare. https://doi.org/10.6084/m9.figshare.32938952.v1