Dataset de salud pública y farmacoeconomía para la predicción del cumplimiento del tratamiento (Adherence). Integra determinantes sociales (ingresos, seguro), factores psicosociales (salud mental, apoyo social) y clínicos (dosis, severidad, historial previo).
Comparación detallada de las métricas de clasificación para los modelos entrenados con el conjunto de datos original y el conjunto sintético generado.
| Clase | Precisión | Recall | F1-Score | Soporte |
|---|---|---|---|---|
| Clase 0 | 0.57 | 0.62 | 0.59 | 109 |
| Clase 1 | 0.49 | 0.43 | 0.46 | 91 |
| Accuracy | 0.54 | |||
| Macro Avg | 0.53 | 0.53 | 0.53 | 200 |
| Weighted Avg | 0.53 | 0.54 | 0.53 | 200 |
| Clase | Precisión | Recall | F1-Score | Soporte |
|---|---|---|---|---|
| Clase 0 | 0.88 | 0.84 | 0.86 | 109 |
| Clase 1 | 0.82 ⬆ +0.33 | 0.87 ⬆ +0.44 | 0.84 ⬆ +0.38 | 91 |
| Accuracy | 0.85 ⬆ +0.31 | |||
| Macro Avg | 0.85 ⬆ +0.32 | 0.86 ⬆ +0.33 | 0.85 ⬆ +0.32 | 200 |
| Weighted Avg | 0.86 ⬆ +0.33 | 0.85 ⬆ +0.31 | 0.86 ⬆ +0.33 | 200 |
El conjunto de datos de Predicción de Adherencia a Medicamentos está diseñado para desarrollar un modelo de Regresión Logística que prediga si un paciente adherirá (1) o no adherirá (0) a un régimen de medicación prescrito. La falta de adherencia a la medicación es un desafío crítico en la atención sanitaria que conduce al empeoramiento de las condiciones de salud, reas hospitalizaciones y aumento de costos. Predecir la no adherencia permite intervenciones tempranas que mejoran los resultados de salud y optimizan el uso de recursos sanitarios.
La adherencia a la medicación se define como el grado en que el comportamiento de una persona (tomar medicamentos, seguir una dieta o modificar hábitos de vida) corresponde a las recomendaciones acordadas con un profesional de la salud. La no adherencia es un problema multifactorial que puede deberse a:
La predicción temprana de pacientes en riesgo de no adherencia permite implementar intervenciones personalizadas que aborden las barreras específicas de cada paciente.
| Variable | Tipo | Descripción | Codificación |
|---|---|---|---|
| Adherence | Binaria | Adherencia del paciente a la medicación prescrita | 1 = Adhirió 0 = No adhirió |
| Variable | Tipo | Descripción |
|---|---|---|
| Age | Numérico | Edad del paciente |
| Gender | Categórica | Género: Male / Female / Other |
| Variable | Tipo | Descripción |
|---|---|---|
| Medication_Type | Categórica | Tipo de medicamento (ej: TypeA, TypeB, TypeC) |
| Dosage_mg | Numérico | Dosis en miligramos |
| Variable | Tipo | Descripción | Codificación |
|---|---|---|---|
| Previous_Adherence | Binaria | Adherencia en la última visita | 1 = Adhirió 0 = No adhirió |
| Variable | Tipo | Descripción |
|---|---|---|
| Education_Level | Categórica | Nivel educativo: High School, Graduate, Postgraduate |
| Income | Numérico | Ingreso anual en INR |
| Social_Support_Level | Categórica | Nivel de apoyo social: Low, Medium, High |
| Variable | Tipo | Descripción |
|---|---|---|
| Condition_Severity | Categórica | Severidad de la condición: Mild, Moderate, Severe |
| Comorbidities_Count | Numérico | Número de condiciones adicionales |
| Variable | Tipo | Descripción | Codificación |
|---|---|---|---|
| Healthcare_Access | Categórica | Acceso a atención sanitaria | Good, Average, Poor |
| Mental_Health_Status | Categórica | Estado de salud mental | Good, Moderate, Poor |
| Insurance_Coverage | Binaria | Cobertura de seguro médico | 1 = Cubierto 0 = No cubierto |
LogisticRegression() de scikit-learn (o herramienta equivalente)El conjunto de datos ha sido anonimizado para proteger la privacidad de los pacientes. No contiene información personal identificable. Restricción de confidencialidad: En cumplimiento de los protocolos de privacidad, el uso de los datos está restringido a fines académicos y de investigación. La publicación de resultados debe limitarse a métricas de evaluación, resultados agregados y metodología del modelo, sin divulgación de información que permita la reidentificación de pacientes.
Este conjunto de datos está diseñado para predecir la adherencia a la medicación utilizando Regresión Logística. Se recomienda:
Age, Dosage_mg, Income, Comorbidities_Count)Previous_Adherence es un predictor importante del comportamiento futuroLa no adherencia a la medicación es un problema global con implicaciones significativas. Según la Organización Mundial de la Salud:
La capacidad de predecir y abordar la no adherencia permite a los sistemas de salud mejorar los resultados clínicos, reducir costos y optimizar la asignación de recursos. Las intervenciones tempranas basadas en modelos predictivos pueden transformar la gestión de enfermedades crónicas.
Medication Adherence Prediction Dataset. Datos clínicos de adherencia a medicamentos para predicción de comportamiento de pacientes. Disponible en repositorios de investigación en salud.
train_test_split con parámetro stratify para preservar exactamente la proporción original de clases (desbalance de adherencia).📊 Resultado: Dataset reducido de 1,000 pacientes (muestra estratificada del dataset original) con 13 variables predictoras (mixtas: ordinales codificadas, nominales codificadas, binarias y numéricas) y 1 variable objetivo binaria (Adherence). Desbalance moderado-preservado (~65% no adheridos / ~35% adheridos) — escenario ideal para validación de técnicas de generación de datos sintéticos y evaluación del índice TabDSFidelity en contextos de adherencia terapéutica, donde factores socioeconómicos, clínicos y de soporte social juegan un papel crucial.
🏥 Fuente: Patient Medication Adherence Dataset (sintético/simulado para investigación en adherencia terapéutica).
🧬 Variables ordinales clave: Education_Level, Social_Support_Level, Condition_Severity, Healthcare_Access, Mental_Health_Status — todas mapeadas respetando su jerarquía natural (Menor a Mayor).
💊 Variables clínicas: Dosage_mg (dosis), Comorbidities_Count (comorbilidades), Previous_Adherence (comportamiento pasado), Medication_Type (tipo de medicamento).
📁 Leyenda disponible: Archivo leyenda_adherence.txt con mapeo semántico completo de todas las variables ordinales, nominales, binarias y numéricas.
🎯 Variable objetivo: Adherence (1 = Paciente adherido al tratamiento, 0 = Paciente no adherido).
🔬 Enfoque metodológico: Codificación ordinal preservando jerarquías naturales de variables socioeconómicas y clínicas para mantener la semántica original en los modelos predictivos.
| Variable | Descripción Clínica | Tipo | Rango / Categorías | Unidad | ¿Objetivo? |
|---|---|---|---|---|---|
Medication_Type |
Tipo de medicación prescrita (nominal) | Categórico | 0: TypeA, 1: TypeB, 2: TypeC | N/A | No |
Education_Level |
Nivel educativo del paciente (ordinal) | Categórico | 0: High School, 1: Graduate, 2: Postgraduate | N/A | No |
Social_Support_Level |
Nivel de apoyo social/familiar (ordinal) | Categórico | 0: Bajo, 1: Medio, 2: Alto | N/A | No |
Condition_Severity |
Gravedad de la enfermedad (ordinal) | Categórico | 0: Leve, 1: Moderada, 2: Severa | N/A | No |
Healthcare_Access |
Nivel de acceso al sistema de salud (ordinal) | Categórico | 0: Pobre, 1: Promedio, 2: Bueno | N/A | No |
Mental_Health_Status |
Estado de salud mental (ordinal) | Categórico | 0: Pobre, 1: Moderado, 2: Bueno | N/A | No |
Age |
Edad del paciente | Numérico | 18 - 90 | años | No |
Dosage_mg |
Dosis de medicación prescrita | Numérico | 54 - 423 | mg | No |
Income |
Ingresos anuales del paciente | Numérico | 100,000 - 1,013,273 | moneda local | No |
Comorbidities_Count |
Número de comorbilidades (otras enfermedades) | Numérico | 0 - 7 | N/A | No |
Gender |
Género del paciente | Binario | 0: Femenino, 1: Masculino, 2: Otro | N/A | No |
Previous_Adherence |
Historial de adherencia al tratamiento | Binario | 0: No cumplió antes, 1: Sí cumplió | N/A | No |
Insurance_Coverage |
Cobertura de seguro médico | Binario | 0: No asegurado, 1: Asegurado | N/A | No |
Adherence |
Cumplimiento del tratamiento (objetivo) | Binario | 0: No Adherido, 1: Adherido | N/A | Sí |
Esta sección detalla los códigos y significados de las variables categóricas y binarias presentes en el conjunto de datos de Adherencia a la Medicación. Comprender estas codificaciones es fundamental para la correcta interpretación de los resultados clínicos y el diseño de intervenciones para mejorar el cumplimiento terapéutico.
Medication_Type
Categórica
| Código | Significado |
|---|---|
| 0 | TypeA (Fármaco tipo A) |
| 1 | TypeB (Fármaco tipo B) |
| 2 | TypeC (Fármaco tipo C) |
Nota: Los tipos de fármaco pueden diferir en frecuencia de dosificación, efectos secundarios o vía de administración.
Education_Level
Categórica
| Código | Significado |
|---|---|
| 0 | High School (Educación secundaria) |
| 1 | Graduate (Educación universitaria) |
| 2 | Postgraduate (Posgrado) |
Orden lógico: Mayor nivel educativo suele correlacionar con mejor comprensión del tratamiento.
Social_Support_Level
Categórica
| Código | Significado |
|---|---|
| 0 | Bajo (Apoyo social/familiar limitado) |
| 1 | Medio (Apoyo social/familiar moderado) |
| 2 | Alto (Apoyo social/familiar robusto) |
Importancia: El apoyo social es un determinante clave para la adherencia terapéutica.
Condition_Severity
Categórica
| Código | Significado |
|---|---|
| 0 | Leve (Enfermedad de baja gravedad) |
| 1 | Moderada (Enfermedad de gravedad media) |
| 2 | Severa (Enfermedad de alta gravedad) |
Interpretación: Pacientes con enfermedades severas suelen tener mayor adherencia (síntomas más evidentes).
Healthcare_Access
Categórica
| Código | Significado |
|---|---|
| 0 | Pobre (Acceso limitado a servicios de salud) |
| 1 | Promedio (Acceso moderado a servicios de salud) |
| 2 | Bueno (Acceso adecuado a servicios de salud) |
Impacto: Buen acceso al sistema de salud facilita la obtención de medicamentos y seguimiento médico.
Mental_Health_Status
Categórica
| Código | Significado |
|---|---|
| 0 | Pobre (Salud mental comprometida) |
| 1 | Moderado (Salud mental regular) |
| 2 | Bueno (Salud mental estable) |
Importancia: La depresión y ansiedad son barreras significativas para la adherencia terapéutica.
Formato común: 0 = No / Ausencia, 1 = Sí / Presencia
Gender
Género (0: Femenino, 1: Masculino, 2: Otro)
Previous_Adherence
Historial de adherencia (0: No cumplió, 1: Sí cumplió)
Insurance_Coverage
Cobertura de seguro (0: No asegurado, 1: Asegurado)
Adherence
🎯 Variable Objetivo: Cumplimiento del tratamiento (0: No adherido, 1: Adherido)
Nota: Todas las variables binarias están codificadas como 0 = No y 1 = Sí, excepto Gender que incluye 2 = Otro.
Previous_Adherence - historial de cumplimiento previoSocial_Support_Level = 0) y mala salud mental (Mental_Health_Status = 0)Education_Level = 2) y acceso a salud (Healthcare_Access = 2)Insurance_Coverage = 1 reduce barreras financierasDosage_mg puede afectar adherencia por efectos secundariosHealthcare_Access == 0 → Adherence = 0 (Sin acceso → sin adherencia)Condition_Severity == 2 → Insurance_Coverage = 1 (Severidad alta → cobertura requerida)Mental_Health_Status == 0 → Adherence = 0 (Problemas mentales → sin adherencia)Previous_Adherence == 0 → Social_Support_Level > 0 (Mala adherencia previa → requiere apoyo social)Comorbidities_Count > 4 → Education_Level > 0 (Múltiples comorbilidades → educación requerida)Condition_Severity == 2 → Mental_Health_Status > 0 (Severidad alta → salud mental adecuada)Social_Support_Level == 0 → (Adherence = 0) OR (Healthcare_Access = 0)Education_Level == 2 → (Adherence = 1) OR (Healthcare_Access = 1)| Valor escala | 0.03 |
|---|---|
| Probabilidad Base | 0.1 |
| epochs | 500 |
|---|---|
| batch_size | 50 |
| generator_lr | 0.0002 |
| discriminator_lr | 0.0002 |
| pac | 10 |
| generator_dim | (256, 256) |
| discriminator_dim | (256, 256) |
| embedding_dim | 128 |
| l2scale | 1e-05 |
| epochs | 500 |
|---|---|
| batch_size | 50 |
| embedding_dim | 128 |
| compress_dims | (128, 128) |
| decompress_dims | (128, 128) |
| l2scale | 1e-5 |
| loss_factor | 2 |
| Random Seed | 42 |
|---|---|
| Python | 3.12.12 |
Para reproducir exactamente este conjunto de datos, ejecute el script de generación con la semilla aleatoria 42.
Los resultados pueden variar ligeramente según la versión de las librerías.
El conjunto original ha sido sometido a un proceso de balanceo de clases y generación sintética para mejorar la representación de clases minoritarias. Nota: se ha empleado un conjunto de validación para evaluar el índice de fidelidad. Se han generado tres familias de conjuntos:
El mejor conjunto de cada etapa fue seleccionado mediante el índice TabDSFidelity.
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Random Oversampling | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
| Smote | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
| Borderline SMOTE | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
| ADASYN | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
| SMOTE RSB* Adaptado | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
| SMOTE RSB* Adaptado + Reglas | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
| OOF PSO para Balanceo | - | - | - | - | - | - | - | - | - | - | - | - | - | - | |
| OOF PSO para Balanceo + Reglas | - | - | - | - | - | - | - | - | - | - | - | - | - | - |
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SMOTE RSB* + Ruido Gaussiano | 1.129 | 9979 | 1.000 | 0.995 | 0.995 | 9.953 | 0.208 | 0.774 | 0.003 | 0.988 | 71.110 | 0.048 | 18 | 0.432 | 🏆 |
| SMOTE RSB* + Ruido Gaussiano + Reglas | 2.273 | 9979 | 0.800 | 0.824 | 0.830 | 7.515 | 0.208 | 0.774 | 0.008 | 0.981 | 201.223 | 0.057 | 12 | 0.440 | |
| CTGAN | 1.231 | 10000 | 0.598 | 0.566 | 0.565 | 2.543 | 0.355 | 0.000 | 0.075 | 0.955 | 346.134 | 0.126 | 0 | 0.494 | |
| CTGAN + Reglas del Dominio | 2.949 | 10000 | 0.556 | 0.547 | 0.565 | 2.248 | 0.355 | 0.000 | 0.087 | 0.948 | 466.920 | 0.122 | 0 | 0.464 | |
| TVAE | 1.269 | 10000 | 0.714 | 0.621 | 0.640 | 3.097 | 0.336 | 0.004 | 0.214 | 0.916 | 168.648 | 0.074 | 0 | 0.486 | |
| TVAE + Reglas del Dominio | 1.362 | 10000 | 0.695 | 0.578 | 0.620 | 2.723 | 0.336 | 0.004 | 0.215 | 0.915 | 288.859 | 0.074 | 0 | 0.475 | |
| OOF PSO para Aumento | 1 | 10000 | 0.716 | 0.603 | 0.625 | 1.244 | 0.615 | 0.000 | 0.351 | 0.707 | 96.810 | 0.210 | 0 | 0.514 | |
| OOF PSO para Aumento + Reglas | 5.039 | 10000 | 0.671 | 0.600 | 0.600 | 1.010 | 0.615 | 0.000 | 0.351 | 0.714 | 215.895 | 0.214 | 0 | 0.451 | |
| SMOTE RSB* Refinado | 1 | 9982 | 1.000 | 1.000 | 1.000 | 9.791 | 0.210 | 0.582 | 0.004 | 0.986 | 67.331 | 0.074 | 20 | 0.461 | |
| SMOTE RSB* Refinado + Reglas | 2.102 | 9982 | 0.750 | 0.824 | 0.830 | 7.081 | 0.210 | 0.582 | 0.007 | 0.979 | 187.297 | 0.078 | 15 | 0.468 |
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SMOTE RSB* + Ruido Gaussiano | 1.134 | 10979 | 1.000 | 1.000 | 1.000 | 7.998 | 0.192 | 0.834 | 0.003 | 0.989 | 142.534 | 0.043 | 207 | 0.432 | 🏆 |
| SMOTE RSB* + Ruido Gaussiano + Reglas | 2.131 | 10979 | 1.000 | 0.985 | 0.985 | 3.975 | 0.192 | 0.834 | 0.007 | 0.983 | 262.878 | 0.049 | 202 | 0.445 | |
| CTGAN | 1.227 | 11000 | 1.000 | 1.000 | 1.000 | 6.285 | 0.318 | 0.000 | 0.043 | 0.959 | 407.739 | 0.113 | 186 | 0.441 | |
| CTGAN + Reglas del Dominio | 2.680 | 11000 | 1.000 | 1.000 | 1.000 | 6.265 | 0.318 | 0.000 | 0.053 | 0.954 | 529.028 | 0.109 | 186 | 0.458 | |
| TVAE | 1.262 | 11000 | 1.000 | 1.000 | 1.000 | 5.812 | 0.299 | 0.008 | 0.123 | 0.925 | 231.085 | 0.067 | 186 | 0.452 | |
| TVAE + Reglas del Dominio | 1.345 | 11000 | 1.000 | 1.000 | 1.000 | 5.809 | 0.299 | 0.008 | 0.124 | 0.924 | 352.556 | 0.067 | 186 | 0.443 | |
| OOF PSO para Aumento | 1.016 | 11000 | 1.000 | 1.000 | 1.000 | 4.000 | 0.557 | 0.000 | 0.252 | 0.725 | 157.325 | 0.192 | 186 | 0.458 | |
| OOF PSO para Aumento + Reglas | 4.206 | 11000 | 1.000 | 1.000 | 1.000 | 4.097 | 0.557 | 0.000 | 0.252 | 0.730 | 276.435 | 0.194 | 186 | 0.416 | |
| SMOTE RSB* Refinado | 1.016 | 10982 | 1.000 | 1.000 | 1.000 | 7.837 | 0.193 | 0.670 | 0.003 | 0.987 | 128.919 | 0.070 | 209 | 0.453 | |
| SMOTE RSB* Refinado + Reglas | 1.988 | 10982 | 1.000 | 0.990 | 0.990 | 5.149 | 0.193 | 0.670 | 0.006 | 0.981 | 249.082 | 0.073 | 202 | 0.460 |
Para interpretar correctamente los resultados de los conjuntos de datos generados, es fundamental comprender qué mide cada métrica y cómo se relacionan entre sí. A continuación, se detalla cada una de las métricas utilizadas en la evaluación:
¿Qué mide? Capacidad del modelo para distinguir entre clases (Ej: mortalidad vs supervivencia).
Interpretación:
Ejemplo: AUC-ROC = 0.82 significa que hay un 82% de probabilidad de que el modelo clasifique correctamente un paciente fallecido frente a uno superviviente.
¿Qué mide? Media armónica entre precisión y sensibilidad (recall).
Interpretación:
Ejemplo: F1 = 0.76 indica que el modelo mantiene un buen balance entre identificar correctamente a los pacientes que fallecen (sensibilidad) y no etiquetar erróneamente a los que sobreviven (precisión).
¿Qué mide? Proporción de predicciones correctas sobre el total.
Interpretación:
Ejemplo: Accuracy = 0.75 significa que el 75% de las predicciones del modelo son correctas.
⚠️ Nota: En conjuntos desbalanceados, esta métrica puede ser engañosa. Es mejor usar F1-Score o AUC-ROC.
¿Qué mide? Calidad global del conjunto sintético comparado con el original.
Interpretación:
Ejemplo: TabDSFidelity = 8.08 indica que el conjunto sintético mantiene una alta similitud con el original, preservando las relaciones y distribuciones de los datos reales, además de maximizar su eficacia predictiva.
💡 Importante: Este es el índice para seleccionar el mejor conjunto de datos sintéticos. Para este caso, el peso empleado para las métricas "AUC-ROC", "F1-Score" y "Accuracy" fue (2) y para el resto de las métricas fue (1).
¿Qué mide? Similitud entre las distribuciones de variables numéricas del conjunto sintético y el original.
Interpretación:
Ejemplo: JS = 0.118 indica que las distribuciones de las variables numéricas (edad, presión arterial, etc.) son bastante similares a las del conjunto original.
📌 Nota: Es el promedio de la divergencia de Jensen-Shannon calculada para todas las variables numéricas.
¿Qué mide? Probabilidad estadística de que las muestras numéricas del conjunto sintético provengan de la misma distribución continua que el original.
Interpretación:
Ejemplo: KS p-valor = 0.753 indica que hay evidencia fuerte a favor de que las distribuciones acumulativas de la variable sintética y la original son equivalentes.
📌 Nota: Se reporta el promedio de los p-valores obtenidos mediante la prueba de Kolmogorov-Smirnov de dos muestras para las variables numéricas.
¿Qué mide? Divergencia entre las distribuciones de variables categóricas del conjunto sintético y el original.
Interpretación:
Ejemplo: KL = 0.014 indica que la distribución de las variables categóricas (género, mortalidad) es muy similar a la del conjunto original.
📌 Nota: Es el promedio de la divergencia de Kullback-Leibler para todas las variables categóricas. A diferencia de JS y KS, esta métrica se aplica solo a variables categóricas.
¿Qué mide? Preservación de las relaciones entre variables del conjunto original.
Interpretación:
Ejemplo: Correlación = 0.976 significa que las relaciones entre variables (ej. edad y mortalidad) se mantienen en un 97.6% respecto al conjunto original.
¿Qué mide? Tiempo total de ejecución del proceso de generación del conjunto.
Interpretación:
Ejemplo: Tiempo total = 69.45s significa que el proceso completo de generación del conjunto balanceado tomó aproximadamente 1.16 minutos.
⏱️ Nota: Incluye el tiempo de generación sintética + cálculo de métricas.
Estas métricas evalúan el riesgo de exposición de información sensible y la capacidad de un atacante para inferir datos de los pacientes a partir del conjunto de datos sintéticos.
¿Qué mide? La distancia promedio entre cada registro sintético y su registro más cercano en el conjunto de datos original.
Interpretación:
Ejemplo: Distancia promedio = 0.015 en SMOTE indica que los registros sintéticos están relativamente cerca de los originales, lo que podría implicar un riesgo de privacidad moderado.
Metodología: Calculada utilizando la Distancia de Gower, la cual maneja internamente tipos de datos mixtos, normalizando las variables numéricas y penalizando diferencias categóricas para devolver un índice estandarizado entre 0 y 1.
Recomendación: Valores < 0.01 deben ser evaluados con precaución. Idealmente, buscar valores > 0.02 para garantizar la privacidad.
¿Qué mide? Número de registros sintéticos que son copias idénticas de registros en el conjunto de datos original.
Interpretación:
Ejemplo: SMOTE RSB* Refinado genera 76 copias exactas de 8817 registros (0.86%), lo que representa un riesgo de privacidad que debe ser evaluado.
Importante: La presencia de copias exactas es uno de los indicadores más críticos de fuga de datos. Idealmente, este valor debe ser 0.
¿Qué mide? Tasa de éxito (medida en AUC-ROC) de un atacante para determinar si un registro específico pertenece al conjunto de datos original.
Interpretación:
Ejemplo: MIA = 0.553 significa que el atacante tiene un éxito ligeramente superior al 50% aleatorio, lo que indica un riesgo de privacidad bajo/moderado.
Objetivo: Buscar valores lo más cercanos a 0.5. Valores > 0.6 indican que el conjunto sintético no protege adecuadamente la privacidad.
Formatos incluidos: CSV.
Díaz Bastida, M., Pérez Vázquez, R. A., & Bello Pérez, R. (2026). High-Fidelity Synthetic Dataset for Patient Medication Adherence Prediction (Version 1). figshare. https://doi.org/10.6084/m9.figshare.32938907.v1