Conjunto de datos financiero para la automatización de decisiones hipotecarias (Clasificación Binaria). Integra perfiles sociodemográficos e historial crediticio con datos previamente imputados.
Comparación detallada de las métricas de clasificación para los modelos entrenados con el conjunto de datos original y el conjunto sintético generado.
| Clase | Precisión | Recall | F1-Score | Soporte |
|---|---|---|---|---|
| Clase 0 | 0.35 | 0.34 | 0.35 | 38 |
| Clase 1 | 0.71 | 0.72 | 0.71 | 85 |
| Accuracy | 0.60 | |||
| Macro Avg | 0.53 | 0.53 | 0.53 | 123 |
| Weighted Avg | 0.60 | 0.60 | 0.60 | 123 |
| Clase | Precisión | Recall | F1-Score | Soporte |
|---|---|---|---|---|
| Clase 0 | 0.65 | 0.58 | 0.61 | 38 |
| Clase 1 | 0.82 ⬆ +0.11 | 0.86 ⬆ +0.14 | 0.84 ⬆ +0.13 | 85 |
| Accuracy | 0.77 ⬆ +0.17 | |||
| Macro Avg | 0.73 ⬆ +0.20 | 0.72 ⬆ +0.19 | 0.73 ⬆ +0.20 | 123 |
| Weighted Avg | 0.77 ⬆ +0.17 | 0.77 ⬆ +0.17 | 0.77 ⬆ +0.17 | 123 |
El conjunto de datos de Predicción de Préstamos (Loan Prediction - Home Loan Approval) está diseñado para automatizar el proceso de elegibilidad de préstamos en tiempo real, basado en los detalles del cliente proporcionados al completar un formulario en línea. El objetivo es predecir si el préstamo será aprobado (Loan_Status = 'Y') o no. Este dataset es ampliamente utilizado en la comunidad de ciencia de datos para problemas de clasificación binaria, permitiendo a las instituciones financieras automatizar la toma de decisiones en la evaluación de solicitudes de crédito hipotecario.
Una compañía de seguros quiere automatizar el proceso de elegibilidad de préstamos (en tiempo real) basado en detalles del cliente proporcionados al completar un formulario online. El objetivo es predecir si el préstamo será aprobado o no, permitiendo:
| Variable | Tipo | Descripción | Notas / Problemas |
|---|---|---|---|
| A. Identificador (A excluir del modelo) | |||
| Loan_ID | ID | Identificador único de la solicitud de préstamo | ⚠️ Debe eliminarse. No aporta valor predictivo y generaría overfitting memorístico en modelos generativos. |
| B. Variables Categóricas | |||
| Gender | Categórica | Género del solicitante | Male / Female. ⚠️ Valores perdidos |
| Married | Categórica | Estado civil del solicitante | Yes / No |
| Education | Categórica | Nivel educativo | Graduate / Not Graduate |
| Self_Employed | Categórica | Indica si el solicitante es autónomo | Yes / No |
| Property_Area | Categórica | Área de la propiedad | Urban / Semiurban / Rural |
| C. Variables Numéricas | |||
| ApplicantIncome | Numérica | Ingreso del solicitante principal | Puede tener outliers |
| CoapplicantIncome | Numérica | Ingreso del co-solicitante | Puede ser 0 si no hay co-solicitante |
| LoanAmount | Numérica | Monto del préstamo solicitado | En miles. ⚠️ Valores perdidos |
| Loan_Amount_Term | Numérica | Plazo del préstamo | En meses (ej. 360). ⚠️ Valores perdidos |
| Credit_History | Binaria | Historial crediticio del solicitante | 1.0 = Cumplió, 0.0 = No cumplió. ⚠️ Valores perdidos. Semánticamente categórica binaria. |
| D. Variable Especial | |||
| Dependents | Categórica / Ordinal | Número de dependientes | Valores: 0, 1, 2, 3+. Transformación: 3+ → 3 para tratarlo como numérica ordinal. |
| E. Variable Objetivo | |||
| Loan_Status | Binaria (Target) | Estado de aprobación del préstamo | Y = Aprobado, N = Rechazado Mapeo: N → 0, Y → 1 |
Variables afectadas:
Estrategia: Antes de generar datos sintéticos, debemos tener un dataset completo.
Contiene valores: 0, 1, 2, 3+
El target Loan_Status ya es binario (Y/N).
El conjunto de datos contiene información demográfica (género, estado civil, nivel educativo) y financiera (ingresos, monto del préstamo) que podría considerarse sensible. Los datos han sido anonimizados y no contienen información personal identificable como nombres, direcciones o números de identificación. La variable Loan_ID es un identificador sin relación con información personal. Restricción de confidencialidad: El uso de los datos está restringido a fines académicos y de investigación. La publicación de resultados debe limitarse a métricas de evaluación, resultados agregados y metodología del modelo, sin divulgación de información que permita la reidentificación de individuos.
Este conjunto de datos es ideal para problemas de clasificación binaria en el sector financiero. Se recomienda:
Loan_ID del modelado por ser un identificador sin valor predictivoLa automatización de la elegibilidad de préstamos es una de las aplicaciones más importantes del aprendizaje automático en el sector financiero. Este dataset permite:
Este dataset es ampliamente utilizado en cursos de ciencia de datos y machine learning para enseñar conceptos de preprocesamiento de datos, clasificación binaria y evaluación de modelos en un contexto financiero realista.
Loan Prediction Dataset. Kaggle. https://www.kaggle.com/datasets/altruistdelhite04/loan-prediction
📊 Resultado: Dataset de 614 solicitudes de préstamo con 11 variables predictoras (demográficas, financieras, laborales y de propiedad) y 1 variable objetivo binaria (Loan_Status). Desbalance moderado (~68% aprobados / ~32% rechazados) — escenario ideal para validación de técnicas de generación de datos sintéticos y evaluación del índice TabDSFidelity en contextos de evaluación crediticia y aprobación de préstamos hipotecarios, donde factores como el historial crediticio, ingresos y propiedad son determinantes.
🏦 Fuente: Loan Prediction Dataset (Data Science Community) - Datos de solicitudes de préstamos hipotecarios.
👤 Variables demográficas: Gender (1=Masculino, 0=Femenino), Married (1=Casado, 0=Soltero), Dependents (0-3), Education (1=Graduado, 0=No graduado), Self_Employed (1=Autónomo, 0=No).
💰 Variables financieras: ApplicantIncome (ingresos del solicitante), CoapplicantIncome (ingresos del co-solicitante), LoanAmount (monto en miles), Loan_Amount_Term (plazo en meses), Credit_History (1=Historial cumplido, 0=Incumplimiento previo).
📁 Leyenda disponible: Archivo leyenda_loan_prediction.txt con mapeo completo de variables binarias, nominales (Property_Area) y descripción de variables numéricas.
🎯 Variable objetivo: Loan_Status (1 = Préstamo aprobado, 0 = Préstamo rechazado).
🧹 Limpieza aplicada: Eliminación de ID (Loan_ID), imputación con moda/mediana, transformación de Dependents ('3+'→3), codificación de categóricas, estandarización de tipos a int.
| Variable | Descripción del Préstamo | Tipo | Rango / Categorías | Unidad | ¿Objetivo? |
|---|---|---|---|---|---|
Property_Area |
Zona geográfica de la propiedad | Categórico | 0: Rural, 1: Semiurban, 2: Urban | N/A | No |
Dependents |
Número de personas a cargo (dependientes) | Numérico | 0 - 3 | personas | No |
ApplicantIncome |
Ingresos anuales del solicitante principal | Numérico | 416 - 81,000 | moneda | No |
CoapplicantIncome |
Ingresos anuales del co-solicitante | Numérico | 0 - 41,667 | moneda | No |
LoanAmount |
Monto solicitado del préstamo | Numérico | 9 - 700 | miles | No |
Loan_Amount_Term |
Plazo de devolución del préstamo | Numérico | 36 - 480 | meses | No |
Gender |
Género del solicitante | Binario | 0: Femenino, 1: Masculino | N/A | No |
Married |
Estado civil del solicitante | Binario | 0: No casado, 1: Casado | N/A | No |
Education |
Nivel educativo del solicitante | Binario | 0: No graduado, 1: Graduado | N/A | No |
Self_Employed |
Indicador de trabajador autónomo | Binario | 0: No, 1: Sí | N/A | No |
Credit_History |
Historial crediticio (cumplimiento previo) | Binario | 0: Sin historial/Incumplió, 1: Cumplió pagos | N/A | No |
Loan_Status |
Estado de aprobación del préstamo (objetivo) | Binario | 0: Rechazado, 1: Aprobado | N/A | Sí |
Esta sección detalla los códigos y significados de las variables categóricas y binarias presentes en el conjunto de datos de Predicción de Préstamos (Loan Prediction). Comprender estas codificaciones es fundamental para la correcta interpretación de los resultados de aprobación crediticia.
Property_Area
Categórica
| Código | Significado | Interpretación |
|---|---|---|
| 0 | Rural (Zona rural) | Menor valor de propiedad |
| 1 | Semiurban (Zona semi-urbana) | Valor de propiedad medio |
| 2 | Urban (Zona urbana) | Mayor valor de propiedad |
Importancia: Propiedades en zonas urbanas suelen tener mayor valor, lo que puede influir en la aprobación del préstamo.
Loan_Status
🎯 Objetivo
| Código | Significado |
|---|---|
| 0 | Rechazado - Préstamo no aprobado (~31%) |
| 1 | Aprobado - Préstamo aprobado (~69%) |
Variable Objetivo: El modelo debe predecir la aprobación del préstamo basado en el perfil del solicitante.
Formato común: 0 = No / Ausencia, 1 = Sí / Presencia
Gender
Género (0: Femenino, 1: Masculino)
Married
Estado civil (0: No casado, 1: Casado)
Education
Nivel educativo (0: No graduado, 1: Graduado)
Self_Employed
Trabajador autónomo (0: No, 1: Sí)
Credit_History
Historial crediticio (0: Sin historial/Incumplió, 1: Cumplió)
Loan_Status
🎯 Variable Objetivo: Aprobación (0: Rechazado, 1: Aprobado)
Nota: Todas las variables binarias están codificadas como 0 = No y 1 = Sí.
Credit_History = 1 (historial cumplido) es casi requisito para aprobaciónApplicantIncome y CoapplicantIncome aumentan probabilidad de aprobaciónLoanAmount alto puede reducir probabilidad de aprobaciónLoan_Amount_Term > 360) pueden ser más riesgososEducation = 1) suelen tener mayor aprobaciónProperty_Area = 2) tienen mayor valor de garantíaApplicantIncome < 2500 → LoanAmount ≤ 150 (Ingresos bajos → préstamo limitado)Education == 0 (Graduado) → ApplicantIncome < 10000Loan_Status == 1 → Credit_History = 1 (Préstamo aprobado → historial crediticio positivo)Loan_Amount_Term < 60 → Loan_Amount_Term = 360 (Plazo inválido → corregir a 360 meses)Property_Area == 0 (Rural) → LoanAmount < 300ApplicantIncome == 0 → CoapplicantIncome > 3000 (Sin ingreso → co-solicitante con ingreso alto)Credit_History == 0 → Loan_Status = 0 (Sin historial crediticio → préstamo denegado)| Valor escala | 0.03 |
|---|---|
| Probabilidad Base | 0.1 |
| epochs | 500 |
|---|---|
| batch_size | 50 |
| generator_lr | 0.0002 |
| discriminator_lr | 0.0002 |
| pac | 10 |
| generator_dim | (128, 128) |
| discriminator_dim | (128, 128) |
| embedding_dim | 128 |
| l2scale | 1e-05 |
| epochs | 400 |
|---|---|
| batch_size | 50 |
| embedding_dim | 64 |
| compress_dims | (64, 64) |
| decompress_dims | (64, 64) |
| l2scale | 1e-5 |
| loss_factor | 2 |
| Random Seed | 42 |
|---|---|
| Python | 3.12.12 |
Para reproducir exactamente este conjunto de datos, ejecute el script de generación con la semilla aleatoria 42.
Los resultados pueden variar ligeramente según la versión de las librerías.
El conjunto original ha sido sometido a un proceso de balanceo de clases y generación sintética para mejorar la representación de clases minoritarias. Nota: se ha empleado un conjunto de validación para evaluar el índice de fidelidad. Se han generado tres familias de conjuntos:
El mejor conjunto de cada etapa fue seleccionado mediante el índice TabDSFidelity.
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Random Oversampling | 1 | 506 | 0.707 | 0.748 | 0.756 | 8.581 | 0.093 | 0.932 | 0.013 | 0.978 | 50.886 | 0 | 506 | 0.551 | 🏆 |
| Smote | 1 | 506 | 0.710 | 0.726 | 0.732 | 6.384 | 0.189 | 0.929 | 0.026 | 0.959 | 50.246 | 0.010 | 369 | 0.500 | |
| Borderline SMOTE | 1 | 506 | 0.716 | 0.717 | 0.724 | 6.114 | 0.188 | 0.912 | 0.025 | 0.960 | 50.287 | 0.009 | 369 | 0.504 | |
| ADASYN | 1.045 | 495 | 0.712 | 0.719 | 0.724 | 6.151 | 0.181 | 0.945 | 0.023 | 0.967 | 48.714 | 0.008 | 369 | 0.498 | |
| SMOTE RSB* Adaptado | 1.100 | 483 | 0.731 | 0.693 | 0.691 | 5.434 | 0.172 | 0.990 | 0.010 | 0.982 | 47.634 | 0.007 | 368 | 0.496 | |
| SMOTE RSB* Adaptado + Reglas | 1.100 | 483 | 0.696 | 0.696 | 0.699 | 3.974 | 0.171 | 0.992 | 0.010 | 0.980 | 47.612 | 0.008 | 369 | 0.498 | |
| OOF PSO para Balanceo | 1 | 506 | 0.722 | 0.739 | 0.756 | 5.375 | 0.235 | 0.061 | 0.089 | 0.741 | 56.237 | 0.038 | 368 | 0.479 | |
| OOF PSO para Balanceo + Reglas | 1 | 506 | 0.693 | 0.715 | 0.732 | 2.189 | 0.231 | 0.001 | 0.081 | 0.716 | 56.539 | 0.047 | 362 | 0.485 |
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SMOTE RSB* + Ruido Gaussiano | 1.776 | 7065 | 0.681 | 0.665 | 0.691 | 7.024 | 0.365 | 0.509 | 0.002 | 0.980 | 64.108 | 0.016 | 14 | 0.527 | |
| SMOTE RSB* + Ruido Gaussiano + Reglas | 1.776 | 7065 | 0.704 | 0.735 | 0.756 | 8.341 | 0.365 | 0.509 | 0.002 | 0.979 | 171.982 | 0.014 | 22 | 0.490 | 🏆 |
| CTGAN | 1.336 | 9996 | 0.585 | 0.543 | 0.528 | 2.902 | 0.333 | 0.022 | 0.034 | 0.940 | 204.312 | 0.047 | 0 | 0.496 | |
| CTGAN + Reglas del Dominio | 1.336 | 9996 | 0.642 | 0.600 | 0.585 | 4.350 | 0.333 | 0.022 | 0.027 | 0.944 | 334.176 | 0.043 | 0 | 0.583 | |
| TVAE | 1.100 | 10000 | 0.654 | 0.551 | 0.537 | 3.662 | 0.430 | 0.202 | 0.034 | 0.940 | 269.529 | 0.012 | 0 | 0.524 | |
| TVAE + Reglas del Dominio | 1.100 | 10000 | 0.653 | 0.583 | 0.569 | 4.177 | 0.430 | 0.203 | 0.034 | 0.940 | 135.805 | 0.012 | 0 | 0.531 | |
| OOF PSO para Aumento | 1 | 10000 | 0.776 | 0.766 | 0.797 | 5.667 | 0.621 | 0.000 | 0.267 | 0.682 | 174.272 | 0.141 | 0 | 0.428 | |
| OOF PSO para Aumento + Reglas | 1 | 10000 | 0.814 | 0.766 | 0.797 | 6.139 | 0.589 | 0.000 | 0.267 | 0.691 | 303.584 | 0.137 | 0 | 0.462 | |
| SMOTE RSB* Refinado | 1.266 | 7881 | 0.673 | 0.670 | 0.675 | 6.767 | 0.376 | 0.481 | 0.009 | 0.978 | 64.424 | 0.017 | 8 | 0.521 | |
| SMOTE RSB* Refinado + Reglas | 1.266 | 7881 | 0.691 | 0.703 | 0.707 | 7.464 | 0.376 | 0.481 | 0.008 | 0.979 | 180.404 | 0.016 | 17 | 0.526 |
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SMOTE RSB* + Ruido Gaussiano | 1.706 | 7571 | 0.648 | 0.685 | 0.724 | 7.853 | 0.348 | 0.511 | 0.003 | 0.981 | 117.988 | 0.014 | 176 | 0.537 | |
| SMOTE RSB* + Ruido Gaussiano + Reglas | 1.706 | 7571 | 0.698 | 0.735 | 0.756 | 9.750 | 0.348 | 0.511 | 0.002 | 0.980 | 227.335 | 0.013 | 184 | 0.483 | 🏆 |
| CTGAN | 1.317 | 10502 | 0.599 | 0.576 | 0.561 | 2.914 | 0.317 | 0.030 | 0.032 | 0.942 | 270.189 | 0.045 | 105 | 0.531 | |
| CTGAN + Reglas del Dominio | 1.317 | 10502 | 0.647 | 0.600 | 0.585 | 4.383 | 0.317 | 0.030 | 0.026 | 0.945 | 399.698 | 0.040 | 105 | 0.513 | |
| TVAE | 1.095 | 10506 | 0.661 | 0.584 | 0.569 | 4.322 | 0.407 | 0.225 | 0.031 | 0.944 | 335.728 | 0.012 | 104 | 0.531 | |
| TVAE + Reglas del Dominio | 1.095 | 10506 | 0.640 | 0.584 | 0.569 | 3.926 | 0.407 | 0.226 | 0.031 | 0.945 | 202.870 | 0.012 | 104 | 0.542 | |
| OOF PSO para Aumento | 1 | 10506 | 0.657 | 0.721 | 0.740 | 4.763 | 0.577 | 0.000 | 0.241 | 0.695 | 239.208 | 0.135 | 104 | 0.523 | |
| OOF PSO para Aumento + Reglas | 1 | 10506 | 0.687 | 0.728 | 0.748 | 5.617 | 0.552 | 0.000 | 0.241 | 0.704 | 367.732 | 0.132 | 104 | 0.508 | |
| SMOTE RSB* Refinado | 1.248 | 8387 | 0.646 | 0.636 | 0.650 | 6.329 | 0.360 | 0.487 | 0.009 | 0.978 | 123.269 | 0.016 | 140 | 0.537 | |
| SMOTE RSB* Refinado + Reglas | 1.248 | 8387 | 0.705 | 0.686 | 0.691 | 8.487 | 0.360 | 0.487 | 0.008 | 0.979 | 238.153 | 0.014 | 148 | 0.523 |
Para interpretar correctamente los resultados de los conjuntos de datos generados, es fundamental comprender qué mide cada métrica y cómo se relacionan entre sí. A continuación, se detalla cada una de las métricas utilizadas en la evaluación:
¿Qué mide? Capacidad del modelo para distinguir entre clases (Ej: mortalidad vs supervivencia).
Interpretación:
Ejemplo: AUC-ROC = 0.82 significa que hay un 82% de probabilidad de que el modelo clasifique correctamente un paciente fallecido frente a uno superviviente.
¿Qué mide? Media armónica entre precisión y sensibilidad (recall).
Interpretación:
Ejemplo: F1 = 0.76 indica que el modelo mantiene un buen balance entre identificar correctamente a los pacientes que fallecen (sensibilidad) y no etiquetar erróneamente a los que sobreviven (precisión).
¿Qué mide? Proporción de predicciones correctas sobre el total.
Interpretación:
Ejemplo: Accuracy = 0.75 significa que el 75% de las predicciones del modelo son correctas.
⚠️ Nota: En conjuntos desbalanceados, esta métrica puede ser engañosa. Es mejor usar F1-Score o AUC-ROC.
¿Qué mide? Calidad global del conjunto sintético comparado con el original.
Interpretación:
Ejemplo: TabDSFidelity = 8.08 indica que el conjunto sintético mantiene una alta similitud con el original, preservando las relaciones y distribuciones de los datos reales, además de maximizar su eficacia predictiva.
💡 Importante: Este es el índice para seleccionar el mejor conjunto de datos sintéticos. Para este caso, el peso empleado para las métricas "AUC-ROC", "F1-Score" y "Accuracy" fue (2) y para el resto de las métricas fue (1).
¿Qué mide? Similitud entre las distribuciones de variables numéricas del conjunto sintético y el original.
Interpretación:
Ejemplo: JS = 0.118 indica que las distribuciones de las variables numéricas (edad, presión arterial, etc.) son bastante similares a las del conjunto original.
📌 Nota: Es el promedio de la divergencia de Jensen-Shannon calculada para todas las variables numéricas.
¿Qué mide? Probabilidad estadística de que las muestras numéricas del conjunto sintético provengan de la misma distribución continua que el original.
Interpretación:
Ejemplo: KS p-valor = 0.753 indica que hay evidencia fuerte a favor de que las distribuciones acumulativas de la variable sintética y la original son equivalentes.
📌 Nota: Se reporta el promedio de los p-valores obtenidos mediante la prueba de Kolmogorov-Smirnov de dos muestras para las variables numéricas.
¿Qué mide? Divergencia entre las distribuciones de variables categóricas del conjunto sintético y el original.
Interpretación:
Ejemplo: KL = 0.014 indica que la distribución de las variables categóricas (género, mortalidad) es muy similar a la del conjunto original.
📌 Nota: Es el promedio de la divergencia de Kullback-Leibler para todas las variables categóricas. A diferencia de JS y KS, esta métrica se aplica solo a variables categóricas.
¿Qué mide? Preservación de las relaciones entre variables del conjunto original.
Interpretación:
Ejemplo: Correlación = 0.976 significa que las relaciones entre variables (ej. edad y mortalidad) se mantienen en un 97.6% respecto al conjunto original.
¿Qué mide? Tiempo total de ejecución del proceso de generación del conjunto.
Interpretación:
Ejemplo: Tiempo total = 69.45s significa que el proceso completo de generación del conjunto balanceado tomó aproximadamente 1.16 minutos.
⏱️ Nota: Incluye el tiempo de generación sintética + cálculo de métricas.
Estas métricas evalúan el riesgo de exposición de información sensible y la capacidad de un atacante para inferir datos de los pacientes a partir del conjunto de datos sintéticos.
¿Qué mide? La distancia promedio entre cada registro sintético y su registro más cercano en el conjunto de datos original.
Interpretación:
Ejemplo: Distancia promedio = 0.015 en SMOTE indica que los registros sintéticos están relativamente cerca de los originales, lo que podría implicar un riesgo de privacidad moderado.
Metodología: Calculada utilizando la Distancia de Gower, la cual maneja internamente tipos de datos mixtos, normalizando las variables numéricas y penalizando diferencias categóricas para devolver un índice estandarizado entre 0 y 1.
Recomendación: Valores < 0.01 deben ser evaluados con precaución. Idealmente, buscar valores > 0.02 para garantizar la privacidad.
¿Qué mide? Número de registros sintéticos que son copias idénticas de registros en el conjunto de datos original.
Interpretación:
Ejemplo: SMOTE RSB* Refinado genera 76 copias exactas de 8817 registros (0.86%), lo que representa un riesgo de privacidad que debe ser evaluado.
Importante: La presencia de copias exactas es uno de los indicadores más críticos de fuga de datos. Idealmente, este valor debe ser 0.
¿Qué mide? Tasa de éxito (medida en AUC-ROC) de un atacante para determinar si un registro específico pertenece al conjunto de datos original.
Interpretación:
Ejemplo: MIA = 0.553 significa que el atacante tiene un éxito ligeramente superior al 50% aleatorio, lo que indica un riesgo de privacidad bajo/moderado.
Objetivo: Buscar valores lo más cercanos a 0.5. Valores > 0.6 indican que el conjunto sintético no protege adecuadamente la privacidad.
Formatos incluidos: CSV.
Díaz Bastida, M., Pérez Vázquez, R. A., & Bello Pérez, R. (2026). High-Fidelity Synthetic Dataset for Home Loan Approval Prediction (Version 1). figshare. https://doi.org/10.6084/m9.figshare.32946197.v1