Registro financiero de clientes para la predicción de probabilidad de impago (default). Integra variables demográficas y, crucialmente, una estructura temporal secuencial de 6 meses (abril-septiembre) aplanada: historial de estatus de pago (ordinal), montos de facturación y pagos realizados.
Comparación detallada de las métricas de clasificación para los modelos entrenados con el conjunto de datos original y el conjunto sintético generado.
| Clase | Precisión | Recall | F1-Score | Soporte |
|---|---|---|---|---|
| Clase 0 | 0.79 | 0.94 | 0.86 | 156 |
| Clase 1 | 0.40 | 0.14 | 0.20 | 44 |
| Accuracy | 0.77 | |||
| Macro Avg | 0.60 | 0.54 | 0.53 | 200 |
| Weighted Avg | 0.71 | 0.77 | 0.72 | 200 |
| Clase | Precisión | Recall | F1-Score | Soporte |
|---|---|---|---|---|
| Clase 0 | 0.85 | 0.90 | 0.87 | 156 |
| Clase 1 | 0.54 ⬆ +0.14 | 0.43 ⬆ +0.29 | 0.48 ⬆ +0.28 | 44 |
| Accuracy | 0.80 ⬆ +0.03 | |||
| Macro Avg | 0.70 ⬆ +0.10 | 0.66 ⬆ +0.12 | 0.68 ⬆ +0.15 | 200 |
| Weighted Avg | 0.78 ⬆ +0.07 | 0.80 ⬆ +0.03 | 0.79 ⬆ +0.07 | 200 |
El conjunto de datos de Incumplimiento de Pagos de Clientes de Tarjetas de Crédito se centra en el caso de clientes con incumplimiento de pagos en Taiwán. La investigación compara la precisión predictiva de la probabilidad de incumplimiento entre seis métodos de minería de datos (minería de datos). Desde la perspectiva de la gestión de riesgos, el resultado de la precisión predictiva de la probabilidad estimada de incumplimiento es más valioso que el resultado binario de clasificación (clientes creíbles o no creíbles). El objetivo es predecir si un cliente incumplirá con el pago de su tarjeta de crédito en el próximo mes (variable Y).
La predicción de incumplimiento de pagos es un problema crítico en la gestión de riesgos crediticios para las instituciones financieras. Esta investigación se centra en:
La red neuronal artificial demostró el mayor coeficiente de determinación (R²), con intercepto cercano a cero y coeficiente de regresión cercano a uno.
El dataset contiene 30,000 instancias con 23 atributos (22 variables predictoras y 1 variable objetivo). Todas las características son de tipo entero y no presentan valores faltantes. Los datos corresponden a clientes de tarjetas de crédito en Taiwán.
| Variable | Tipo | Descripción | Categorías / Unidades |
|---|---|---|---|
| A. Identificador (A excluir del modelo) | |||
| ID | Entero | Identificador único del cliente | Sin valor predictivo. Excluir del modelo. |
| B. Datos Demográficos y Crediticios | |||
| X1 (LIMIT_BAL) | Entero | Monto de crédito otorgado | Dólares taiwaneses (NT$) |
| X2 (SEX) | Entero | Género | 1 = Hombre, 2 = Mujer |
| X3 (EDUCATION) | Entero | Nivel educativo | 1 = Posgrado, 2 = Universidad, 3 = Preparatoria, 4 = Otros |
| X4 (MARRIAGE) | Entero | Estado civil | 1 = Casado, 2 = Soltero, 3 = Otros |
| X5 (AGE) | Entero | Edad del cliente | años |
| C. Historial de Pagos (PAY_0 a PAY_6) | |||
| X6 (PAY_0) | Entero | Estado de pago en septiembre 2005 | -1 = Pagado a tiempo, 1 = 1 mes retraso, ..., 9 = ≥9 meses retraso |
| X7 (PAY_2) | Entero | Estado de pago en agosto 2005 | -1 = Pagado a tiempo, 1 = 1 mes retraso, ..., 9 = ≥9 meses retraso |
| X8 (PAY_3) | Entero | Estado de pago en julio 2005 | -1 = Pagado a tiempo, 1 = 1 mes retraso, ..., 9 = ≥9 meses retraso |
| X9 (PAY_4) | Entero | Estado de pago en junio 2005 | -1 = Pagado a tiempo, 1 = 1 mes retraso, ..., 9 = ≥9 meses retraso |
| X10 (PAY_5) | Entero | Estado de pago en mayo 2005 | -1 = Pagado a tiempo, 1 = 1 mes retraso, ..., 9 = ≥9 meses retraso |
| X11 (PAY_6) | Entero | Estado de pago en abril 2005 | -1 = Pagado a tiempo, 1 = 1 mes retraso, ..., 9 = ≥9 meses retraso |
| D. Montos de Facturación (BILL_AMT1 a BILL_AMT6) | |||
| X12-X17 | Entero | Monto del estado de cuenta (NT$) | X12 = Septiembre 2005, X13 = Agosto 2005, ..., X17 = Abril 2005 |
| E. Montos de Pago (PAY_AMT1 a PAY_AMT6) | |||
| X18-X23 | Entero | Monto de pago realizado (NT$) | X18 = Septiembre 2005, X19 = Agosto 2005, ..., X23 = Abril 2005 |
| F. Variable Objetivo | |||
| Y | Binaria (Target) | Incumplimiento de pago el próximo mes | 1 = Sí (incumplió), 0 = No (no incumplió) |
El artículo fundamental que describe la comparación de técnicas de minería de datos para la precisión predictiva de la probabilidad de incumplimiento es:
Yeh, I., & Lien, C. H. (2009). The comparisons of data mining techniques for the predictive accuracy of probability of default of credit card clients. Expert Systems with Applications, 36(2), 2473-2480. https://doi.org/10.1016/j.eswa.2009.02.041
El conjunto de datos ha sido anonimizado para proteger la privacidad de los clientes de tarjetas de crédito. La variable ID es un identificador numérico sin relación con información personal identificable. Restricción de confidencialidad: En cumplimiento de los protocolos de privacidad, el uso de los datos está restringido a fines académicos y de investigación. La publicación de resultados debe limitarse a métricas de evaluación, resultados agregados y metodología del modelo, sin divulgación de información que permita la reidentificación de clientes.
Este conjunto de datos es ampliamente utilizado en gestión de riesgos crediticios y clasificación. Se recomienda:
ID del modelado por ser un identificador único sin valor predictivoLa predicción de incumplimiento de pagos es fundamental para la gestión de riesgos crediticios en instituciones financieras. Las implicaciones incluyen:
El estudio de Yeh y Lien (2009) demostró que la estimación precisa de la probabilidad de incumplimiento es más valiosa que la clasificación binaria, ya que permite una diferenciación más fina del riesgo y una mejor asignación de recursos para la gestión de cobranzas.
Yeh, I., & Lien, C. H. (2009). The comparisons of data mining techniques for the predictive accuracy of probability of default of credit card clients. Expert Systems with Applications, 36(2), 2473-2480. https://doi.org/10.1016/j.eswa.2009.02.041
📊 Resultado: Dataset de 30,000 clientes de tarjetas de crédito en Taiwán con 23 variables predictoras (demográficas, historial de pago de 6 meses, estados de cuenta y montos pagados) y 1 variable objetivo binaria (default). Desbalance moderado (~78% no default / ~22% default) — escenario ideal para validación de técnicas de generación de datos sintéticos y evaluación del índice TabDSFidelity en contextos de riesgo crediticio y predicción de incumplimiento de pago, donde el historial de pagos y las variables financieras mensuales son determinantes.
💳 Fuente: Default of Credit Card Clients Dataset (UCI Machine Learning Repository) - Datos de clientes de tarjetas de crédito en Taiwán (Abril-Septiembre 2005).
📅 Variables temporales: Historial de pago de 6 meses (PAY_0 a PAY_6) donde PAY_0 es el más reciente (Septiembre 2005) y PAY_6 el más antiguo (Abril 2005).
📊 Variables financieras: BILL_AMT1-6 (montos facturados) y PAY_AMT1-6 (montos pagados) en dólares NT (Nuevo Dólar Taiwán).
📁 Leyenda disponible: Archivo leyenda_default_credit.txt con mapeo semántico completo de la variable objetivo, variables demográficas (SEX, EDUCATION, MARRIAGE), escala de historial de pago (-2 a 9), y variables de facturación/pagos.
🎯 Variable objetivo: default (1 = Cliente incumplió el pago el próximo mes, 0 = Cliente pagó).
🧹 Limpieza aplicada: Eliminación de ID, agrupación de valores atípicos en EDUCATION (0,5,6 → 4) y MARRIAGE (0,3 → 3), renombrado de target para claridad semántica.
| Variable | Descripción Financiera | Tipo | Rango / Categorías | Unidad | ¿Objetivo? |
|---|---|---|---|---|---|
SEX |
Género del cliente | Categórico | 1: Masculino, 2: Femenino | N/A | No |
EDUCATION |
Nivel educativo (ordinal) | Categórico | 1: Posgrado, 2: Universidad, 3: Bachillerato, 4: Otros | N/A | No |
MARRIAGE |
Estado civil | Categórico | 1: Casado, 2: Soltero, 3: Otros | N/A | No |
PAY_0 |
Estado de pago - Septiembre 2005 (más reciente) | Categórico | -2: Sin consumo, -1: Pagado, 0: Revolving, 1-9: Retraso | N/A | No |
PAY_2 |
Estado de pago - Agosto 2005 | Categórico | -2: Sin consumo, -1: Pagado, 0: Revolving, 1-9: Retraso | N/A | No |
PAY_3 |
Estado de pago - Julio 2005 | Categórico | -2: Sin consumo, -1: Pagado, 0: Revolving, 1-9: Retraso | N/A | No |
PAY_4 |
Estado de pago - Junio 2005 | Categórico | -2: Sin consumo, -1: Pagado, 0: Revolving, 1-9: Retraso | N/A | No |
PAY_5 |
Estado de pago - Mayo 2005 | Categórico | -2: Sin consumo, -1: Pagado, 0: Revolving, 1-9: Retraso | N/A | No |
PAY_6 |
Estado de pago - Abril 2005 (más antiguo) | Categórico | -2: Sin consumo, -1: Pagado, 0: Revolving, 1-9: Retraso | N/A | No |
LIMIT_BAL |
Límite de crédito otorgado | Numérico | 10,000 - 700,000 | NT$ | No |
AGE |
Edad del cliente | Numérico | 21 - 65 | años | No |
BILL_AMT1 |
Monto de factura - Septiembre 2005 | Numérico | -1,678 - 546,741 | NT$ | No |
BILL_AMT2 |
Monto de factura - Agosto 2005 | Numérico | -3,355 - 535,509 | NT$ | No |
BILL_AMT3 |
Monto de factura - Julio 2005 | Numérico | -61,506 - 548,020 | NT$ | No |
BILL_AMT4 |
Monto de factura - Junio 2005 | Numérico | -4,571 - 530,672 | NT$ | No |
BILL_AMT5 |
Monto de factura - Mayo 2005 | Numérico | -4,954 - 440,000 | NT$ | No |
BILL_AMT6 |
Monto de factura - Abril 2005 | Numérico | -51,443 - 402,289 | NT$ | No |
PAY_AMT1 |
Monto pagado - Septiembre 2005 | Numérico | 0 - 423,903 | NT$ | No |
PAY_AMT2 |
Monto pagado - Agosto 2005 | Numérico | 0 - 415,552 | NT$ | No |
PAY_AMT3 |
Monto pagado - Julio 2005 | Numérico | 0 - 169,267 | NT$ | No |
PAY_AMT4 |
Monto pagado - Junio 2005 | Numérico | 0 - 313,094 | NT$ | No |
PAY_AMT5 |
Monto pagado - Mayo 2005 | Numérico | 0 - 158,064 | NT$ | No |
PAY_AMT6 |
Monto pagado - Abril 2005 | Numérico | 0 - 204,297 | NT$ | No |
default |
Incumplimiento de pago próximo mes (objetivo) | Binario | 0: No (Pagó), 1: Sí (Default) | N/A | Sí |
Esta sección detalla los códigos y significados de las variables categóricas y binarias presentes en el conjunto de datos de Incumplimiento de Tarjetas de Crédito. Comprender estas codificaciones es fundamental para la correcta interpretación de los resultados financieros.
SEX
Categórica
| Código | Significado |
|---|---|
| 1 | Male (Masculino) |
| 2 | Female (Femenino) |
EDUCATION
Categórica
| Código | Significado |
|---|---|
| 1 | Graduate School (Posgrado) |
| 2 | University (Universidad) |
| 3 | High School (Bachillerato) |
| 4 | Others (Otros - incluye desconocido) |
Orden lógico: Mayor nivel educativo suele correlacionar con mejor capacidad de pago.
MARRIAGE
Categórica
| Código | Significado |
|---|---|
| 1 | Married (Casado) |
| 2 | Single (Soltero) |
| 3 | Others (Otros - incluye divorciado/viudo) |
PAY_0, PAY_2, PAY_3, PAY_4, PAY_5, PAY_6
Categórica
Estado de pago mensual (Abril - Septiembre 2005)
| Código | Significado |
|---|---|
| -2 | Sin consumo / Inactivo (No se realizaron compras) |
| -1 | Pago debido (Pay duly - Pago completo y a tiempo) |
| 0 | Pago renovable (Revolving - Pago parcial, se difiere el resto) |
| 1-9 | Retraso en el pago por N meses (1 = 1 mes de atraso, etc.) |
Correlación temporal: PAY_0 es el más reciente (Septiembre). PAY_6 es el más antiguo (Abril). El retraso en meses recientes es el mejor predictor de default.
Interpretación: Valores negativos (-1, -2) indican buen comportamiento. 0 indica pago mínimo. 1-9 indica morosidad creciente.
Formato: 0 = No / Pago, 1 = Sí / Default
default
🎯 Variable Objetivo: Incumplimiento de pago (0: No, 1: Sí)
Nota: Única variable binaria en el dataset.
PAY_0 (estado de pago más reciente)LIMIT_BAL mayor no siempre indica menor riesgo (puede indicar sobregiro)PAY_2 >= 2 → PAY_0 ≠ -1 (Retraso en Agosto → no pago puntual en Septiembre)PAY_3 >= 2 → PAY_2 ≠ -1 (Retraso en Julio → no pago puntual en Agosto)PAY_4 >= 2 → PAY_3 ≠ -1 (Retraso en Junio → no pago puntual en Julio)PAY_5 >= 2 → PAY_4 ≠ -1 (Retraso en Mayo → no pago puntual en Junio)PAY_6 >= 2 → PAY_5 ≠ -1 (Retraso en Abril → no pago puntual en Mayo)PAY_0 == -2 → BILL_AMT1 = 0 (Sin consumo en Septiembre → factura 0)PAY_2 == -2 → BILL_AMT2 = 0 (Sin consumo en Agosto → factura 0)BILL_AMT2 ≤ 0 → PAY_2 ≠ 1 (Factura ≤0 → sin retraso de 1 mes)BILL_AMT3 ≤ 0 → PAY_3 ≠ 1 (Factura ≤0 → sin retraso de 1 mes)PAY_0 >= 2 → default = 1 (Retraso ≥2 meses → default inminente)PAY_0 ≤ 0 → default = 0 (Pago puntual → sin default)EDUCATION == 1 (Posgrado) → AGE ≥ 22AGE ≤ 20 → MARRIAGE = 2 (Soltero) (Menor de 20 → improbable casado)PAY_AMT1 == 0 → PAY_0 ≠ -1 (Pago 0 en Septiembre → sin pago puntual)| Valor escala | 0.03 |
|---|---|
| Probabilidad Base | 0.1 |
| epochs | 500 |
|---|---|
| batch_size | 50 |
| generator_lr | 0.0002 |
| discriminator_lr | 0.0002 |
| pac | 10 |
| generator_dim | (256, 256) |
| discriminator_dim | (256, 256) |
| embedding_dim | 128 |
| l2scale | 1e-05 |
| epochs | 500 |
|---|---|
| batch_size | 50 |
| embedding_dim | 128 |
| compress_dims | (128, 128) |
| decompress_dims | (128, 128) |
| l2scale | 1e-5 |
| loss_factor | 2 |
| Random Seed | 42 |
|---|---|
| Python | 3.12.12 |
Para reproducir exactamente este conjunto de datos, ejecute el script de generación con la semilla aleatoria 42.
Los resultados pueden variar ligeramente según la versión de las librerías.
El conjunto original ha sido sometido a un proceso de balanceo de clases y generación sintética para mejorar la representación de clases minoritarias. Nota: se ha empleado un conjunto de validación para evaluar el índice de fidelidad. Se han generado tres familias de conjuntos:
El mejor conjunto de cada etapa fue seleccionado mediante el índice TabDSFidelity.
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Random Oversampling | 1 | 934 | 0.691 | 0.757 | 0.775 | 8.203 | 0.175 | 0.440 | 0.029 | 0.969 | 47.379 | 0 | 934 | 0.457 | 🏆 |
| Smote | 1 | 934 | 0.658 | 0.707 | 0.700 | 2.726 | 0.328 | 0.469 | 0.049 | 0.977 | 46.286 | 0.026 | 600 | 0.474 | |
| Borderline SMOTE | 1 | 934 | 0.654 | 0.726 | 0.725 | 3.666 | 0.328 | 0.495 | 0.056 | 0.975 | 47.470 | 0.029 | 601 | 0.496 | |
| ADASYN | 1.009 | 930 | 0.668 | 0.724 | 0.715 | 4.213 | 0.329 | 0.616 | 0.051 | 0.979 | 46.553 | 0.027 | 602 | 0.463 | |
| SMOTE RSB* Adaptado | 1.170 | 866 | 0.701 | 0.739 | 0.745 | 7.071 | 0.298 | 0.674 | 0.028 | 0.976 | 45.194 | 0.027 | 600 | 0.456 | |
| SMOTE RSB* Adaptado + Reglas | 1.170 | 866 | 0.677 | 0.738 | 0.740 | 5.953 | 0.299 | 0.704 | 0.026 | 0.979 | 45.149 | 0.027 | 600 | 0.416 | |
| OOF PSO para Balanceo | 1 | 934 | 0.691 | 0.758 | 0.795 | 5.440 | 0.335 | 0.000 | 0.239 | 0.634 | 50.779 | 0.161 | 600 | 0.463 | |
| OOF PSO para Balanceo + Reglas | 3.151 | 934 | 0.661 | 0.773 | 0.795 | 4.278 | 0.351 | 0.000 | 0.266 | 0.588 | 49.147 | 0.182 | 464 | 0.460 |
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SMOTE RSB* + Ruido Gaussiano | 1.702 | 8104 | 0.672 | 0.738 | 0.780 | 8.690 | 0.499 | 0.360 | 0.115 | 0.938 | 77.986 | 0.077 | 1 | 0.508 | |
| SMOTE RSB* + Ruido Gaussiano + Reglas | 2.360 | 8104 | 0.683 | 0.765 | 0.790 | 9.110 | 0.498 | 0.255 | 0.130 | 0.937 | 216.718 | 0.082 | 1 | 0.469 | 🏆 |
| CTGAN | 1.625 | 10000 | 0.690 | 0.593 | 0.555 | 4.685 | 0.528 | 0.004 | 0.144 | 0.892 | 438.708 | 0.113 | 0 | 0.469 | |
| CTGAN + Reglas del Dominio | 1.444 | 10000 | 0.682 | 0.756 | 0.760 | 7.830 | 0.527 | 0.000 | 0.130 | 0.891 | 602.050 | 0.110 | 0 | 0.486 | |
| TVAE | 1.202 | 10000 | 0.634 | 0.699 | 0.680 | 4.173 | 0.729 | 0.000 | 0.031 | 0.942 | 255.234 | 0.050 | 0 | 0.510 | |
| TVAE + Reglas del Dominio | 3.006 | 10000 | 0.666 | 0.768 | 0.775 | 6.869 | 0.724 | 0.000 | 0.022 | 0.940 | 422.564 | 0.049 | 0 | 0.440 | |
| OOF PSO para Aumento | 1 | 10000 | 0.686 | 0.746 | 0.740 | 5.147 | 0.746 | 0.000 | 1.266 | 0.666 | 123.037 | 0.299 | 0 | 0.544 | |
| OOF PSO para Aumento + Reglas | 1.338 | 10000 | 0.684 | 0.777 | 0.800 | 5.951 | 0.738 | 0.000 | 1.300 | 0.669 | 284.586 | 0.300 | 0 | 0.545 | |
| SMOTE RSB* Refinado | 1.355 | 8691 | 0.646 | 0.731 | 0.770 | 7.345 | 0.514 | 0.281 | 0.116 | 0.932 | 80.725 | 0.087 | 1 | 0.452 | |
| SMOTE RSB* Refinado + Reglas | 2.185 | 8691 | 0.641 | 0.773 | 0.795 | 7.441 | 0.513 | 0.168 | 0.127 | 0.932 | 227.641 | 0.091 | 1 | 0.432 |
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SMOTE RSB* + Ruido Gaussiano | 1.608 | 9038 | 0.697 | 0.722 | 0.765 | 7.172 | 0.467 | 0.429 | 0.104 | 0.941 | 150.523 | 0.070 | 216 | 0.460 | |
| SMOTE RSB* + Ruido Gaussiano + Reglas | 2.139 | 9038 | 0.682 | 0.762 | 0.790 | 7.965 | 0.466 | 0.311 | 0.116 | 0.940 | 289.001 | 0.076 | 217 | 0.483 | 🏆 |
| CTGAN | 1.556 | 10934 | 0.703 | 0.702 | 0.690 | 4.270 | 0.484 | 0.008 | 0.130 | 0.898 | 525.791 | 0.104 | 176 | 0.474 | |
| CTGAN + Reglas del Dominio | 1.398 | 10934 | 0.731 | 0.765 | 0.775 | 7.895 | 0.483 | 0.000 | 0.117 | 0.897 | 686.094 | 0.102 | 176 | 0.450 | |
| TVAE | 1.183 | 10934 | 0.664 | 0.742 | 0.735 | 4.582 | 0.656 | 0.000 | 0.027 | 0.948 | 344.696 | 0.048 | 176 | 0.469 | |
| TVAE + Reglas del Dominio | 2.690 | 10934 | 0.688 | 0.772 | 0.780 | 6.626 | 0.652 | 0.000 | 0.018 | 0.947 | 509.275 | 0.047 | 176 | 0.447 | |
| OOF PSO para Aumento | 1 | 10934 | 0.648 | 0.779 | 0.795 | 4.436 | 0.661 | 0.000 | 0.937 | 0.688 | 209.836 | 0.272 | 176 | 0.446 | |
| OOF PSO para Aumento + Reglas | 1.305 | 10934 | 0.695 | 0.765 | 0.785 | 4.869 | 0.654 | 0.000 | 0.966 | 0.689 | 366.669 | 0.273 | 176 | 0.476 | |
| SMOTE RSB* Refinado | 1.315 | 9625 | 0.631 | 0.697 | 0.735 | 4.377 | 0.482 | 0.322 | 0.105 | 0.935 | 158.232 | 0.081 | 200 | 0.429 | |
| SMOTE RSB* Refinado + Reglas | 2.012 | 9625 | 0.663 | 0.777 | 0.800 | 7.827 | 0.481 | 0.207 | 0.114 | 0.935 | 304.405 | 0.085 | 200 | 0.475 |
Para interpretar correctamente los resultados de los conjuntos de datos generados, es fundamental comprender qué mide cada métrica y cómo se relacionan entre sí. A continuación, se detalla cada una de las métricas utilizadas en la evaluación:
¿Qué mide? Capacidad del modelo para distinguir entre clases (Ej: mortalidad vs supervivencia).
Interpretación:
Ejemplo: AUC-ROC = 0.82 significa que hay un 82% de probabilidad de que el modelo clasifique correctamente un paciente fallecido frente a uno superviviente.
¿Qué mide? Media armónica entre precisión y sensibilidad (recall).
Interpretación:
Ejemplo: F1 = 0.76 indica que el modelo mantiene un buen balance entre identificar correctamente a los pacientes que fallecen (sensibilidad) y no etiquetar erróneamente a los que sobreviven (precisión).
¿Qué mide? Proporción de predicciones correctas sobre el total.
Interpretación:
Ejemplo: Accuracy = 0.75 significa que el 75% de las predicciones del modelo son correctas.
⚠️ Nota: En conjuntos desbalanceados, esta métrica puede ser engañosa. Es mejor usar F1-Score o AUC-ROC.
¿Qué mide? Calidad global del conjunto sintético comparado con el original.
Interpretación:
Ejemplo: TabDSFidelity = 8.08 indica que el conjunto sintético mantiene una alta similitud con el original, preservando las relaciones y distribuciones de los datos reales, además de maximizar su eficacia predictiva.
💡 Importante: Este es el índice para seleccionar el mejor conjunto de datos sintéticos. Para este caso, el peso empleado para las métricas "AUC-ROC", "F1-Score" y "Accuracy" fue (2) y para el resto de las métricas fue (1).
¿Qué mide? Similitud entre las distribuciones de variables numéricas del conjunto sintético y el original.
Interpretación:
Ejemplo: JS = 0.118 indica que las distribuciones de las variables numéricas (edad, presión arterial, etc.) son bastante similares a las del conjunto original.
📌 Nota: Es el promedio de la divergencia de Jensen-Shannon calculada para todas las variables numéricas.
¿Qué mide? Probabilidad estadística de que las muestras numéricas del conjunto sintético provengan de la misma distribución continua que el original.
Interpretación:
Ejemplo: KS p-valor = 0.753 indica que hay evidencia fuerte a favor de que las distribuciones acumulativas de la variable sintética y la original son equivalentes.
📌 Nota: Se reporta el promedio de los p-valores obtenidos mediante la prueba de Kolmogorov-Smirnov de dos muestras para las variables numéricas.
¿Qué mide? Divergencia entre las distribuciones de variables categóricas del conjunto sintético y el original.
Interpretación:
Ejemplo: KL = 0.014 indica que la distribución de las variables categóricas (género, mortalidad) es muy similar a la del conjunto original.
📌 Nota: Es el promedio de la divergencia de Kullback-Leibler para todas las variables categóricas. A diferencia de JS y KS, esta métrica se aplica solo a variables categóricas.
¿Qué mide? Preservación de las relaciones entre variables del conjunto original.
Interpretación:
Ejemplo: Correlación = 0.976 significa que las relaciones entre variables (ej. edad y mortalidad) se mantienen en un 97.6% respecto al conjunto original.
¿Qué mide? Tiempo total de ejecución del proceso de generación del conjunto.
Interpretación:
Ejemplo: Tiempo total = 69.45s significa que el proceso completo de generación del conjunto balanceado tomó aproximadamente 1.16 minutos.
⏱️ Nota: Incluye el tiempo de generación sintética + cálculo de métricas.
Estas métricas evalúan el riesgo de exposición de información sensible y la capacidad de un atacante para inferir datos de los pacientes a partir del conjunto de datos sintéticos.
¿Qué mide? La distancia promedio entre cada registro sintético y su registro más cercano en el conjunto de datos original.
Interpretación:
Ejemplo: Distancia promedio = 0.015 en SMOTE indica que los registros sintéticos están relativamente cerca de los originales, lo que podría implicar un riesgo de privacidad moderado.
Metodología: Calculada utilizando la Distancia de Gower, la cual maneja internamente tipos de datos mixtos, normalizando las variables numéricas y penalizando diferencias categóricas para devolver un índice estandarizado entre 0 y 1.
Recomendación: Valores < 0.01 deben ser evaluados con precaución. Idealmente, buscar valores > 0.02 para garantizar la privacidad.
¿Qué mide? Número de registros sintéticos que son copias idénticas de registros en el conjunto de datos original.
Interpretación:
Ejemplo: SMOTE RSB* Refinado genera 76 copias exactas de 8817 registros (0.86%), lo que representa un riesgo de privacidad que debe ser evaluado.
Importante: La presencia de copias exactas es uno de los indicadores más críticos de fuga de datos. Idealmente, este valor debe ser 0.
¿Qué mide? Tasa de éxito (medida en AUC-ROC) de un atacante para determinar si un registro específico pertenece al conjunto de datos original.
Interpretación:
Ejemplo: MIA = 0.553 significa que el atacante tiene un éxito ligeramente superior al 50% aleatorio, lo que indica un riesgo de privacidad bajo/moderado.
Objetivo: Buscar valores lo más cercanos a 0.5. Valores > 0.6 indican que el conjunto sintético no protege adecuadamente la privacidad.
Formatos incluidos: CSV.
Díaz Bastida, M., Pérez Vázquez, R. A., & Bello Pérez, R. (2026). High-Fidelity Synthetic Dataset for Credit Card Default Prediction - Taiwan (Version 0). figshare. https://doi.org/10.6084/m9.figshare.32939219