Conjunto de datos de simulación industrial para la predicción de fallos mecánicos. Caracterizado por un desbalance alto (3.4%) y la incorporación de reglas físicas explícitas.
Comparación detallada de las métricas de clasificación para los modelos entrenados con el conjunto de datos original y el conjunto sintético generado.
| Clase | Precisión | Recall | F1-Score | Soporte |
|---|---|---|---|---|
| Clase 0 | 0.96 | 1.00 | 0.98 | 193 |
| Clase 1 | 0.00 | 0.00 | 0.00 | 7 |
| Accuracy | 0.96 | |||
| Macro Avg | 0.48 | 0.50 | 0.49 | 200 |
| Weighted Avg | 0.93 | 0.96 | 0.95 | 200 |
| Clase | Precisión | Recall | F1-Score | Soporte |
|---|---|---|---|---|
| Clase 0 | 0.97 | 1.00 | 0.99 | 193 |
| Clase 1 | 1.00 ⬆ +1.00 | 0.29 ⬆ +0.29 | 0.44 ⬆ +0.44 | 7 |
| Accuracy | 0.97 ⬆ +0.01 | |||
| Macro Avg | 0.99 ⬆ +0.51 | 0.64 ⬆ +0.14 | 0.72 ⬆ +0.23 | 200 |
| Weighted Avg | 0.98 ⬆ +0.05 | 0.97 ⬆ +0.01 | 0.97 ⬆ +0.02 | 200 |
El conjunto de datos de Mantenimiento Predictivo AI4I 2020 es un dataset sintético que refleja datos reales de mantenimiento predictivo encontrados en la industria. Dado que los conjuntos de datos reales de mantenimiento predictivo son generalmente difíciles de obtener y, en particular, difíciles de publicar, este dataset proporciona una alternativa sintética pero realista para la investigación y el desarrollo de modelos de mantenimiento predictivo. El dataset consta de 10,000 puntos de datos con 14 características que incluyen condiciones operativas de máquinas, desgaste de herramientas y modos de fallo. El objetivo es predecir si una máquina fallará (Machine failure) y el tipo de fallo específico (Failure Type).
El mantenimiento predictivo es una aplicación crítica del aprendizaje automático en la industria 4.0. El objetivo es predecir fallos en equipos antes de que ocurran, permitiendo:
El dataset incluye variantes de calidad de productos (L: 50%, M: 30%, H: 20%) que afectan el desgaste de la herramienta.
El dataset contiene 10,000 instancias con 14 atributos. Las características son de tipo mixto (numéricas y categóricas) y no presentan valores faltantes.
| Variable | Tipo | Descripción | Unidades / Categorías |
|---|---|---|---|
| A. Identificadores (A excluir del modelo) | |||
| UID | Entero | Identificador único (1-10000) | Sin valor predictivo |
| Product ID | Categórica | Identificador del producto (letra + número de serie) | L, M, H + número de serie |
| Type | Categórica | Variante de calidad del producto | L (50%), M (30%), H (20%) |
| B. Variables Operativas | |||
| Air temperature | Continuo | Temperatura del aire | Kelvin (K) |
| Process temperature | Continuo | Temperatura del proceso | Kelvin (K) |
| Rotational speed | Entero | Velocidad de rotación | rpm |
| Torque | Continuo | Torque aplicado | Nm |
| Tool wear | Entero | Desgaste de la herramienta | minutos |
| C. Variables de Fallo | |||
| Machine failure | Binaria (Target) | Indica si la máquina falló | 1 = Fallo, 0 = No fallo |
| TWF | Binaria | Fallo por desgaste de herramienta | 1 = Sí, 0 = No |
| HDF | Binaria | Fallo por disipación de calor | 1 = Sí, 0 = No |
| PWF | Binaria | Fallo por potencia | 1 = Sí, 0 = No |
| OSF | Binaria | Fallo por sobreesfuerzo | 1 = Sí, 0 = No |
| RNF | Binaria | Fallo aleatorio | 1 = Sí, 0 = No |
| Modo de Fallo | Descripción | Condición / Frecuencia |
|---|---|---|
| TWF | Tool Wear Failure | Desgaste entre 200-240 min (120 casos) |
| HDF | Heat Dissipation Failure | ΔT < 8.6 K y velocidad < 1380 rpm (115 casos) |
| PWF | Power Failure | Potencia < 3500 W o > 9000 W (95 casos) |
| OSF | Overstrain Failure | Desgaste × Torque > umbral por variante (98 casos) |
| RNF | Random Failure | Probabilidad aleatoria del 0.1% (5 casos) |
⚠️ Machine failure = 1 si al menos un modo de fallo es verdadero. No es transparente para el modelo qué modo causó el fallo.
⚠️ Dos variables objetivo: Machine failure (binaria) y Failure Type (multi-clase). No usar una como característica para evitar fuga de datos.
El artículo fundamental que describe la aplicación de IA explicable para mantenimiento predictivo es:
Matzka, S. (2020). Explainable Artificial Intelligence for Predictive Maintenance Applications. International Conference on Artificial Intelligence for Industries (AI4I), 69-74. https://doi.org/10.1109/AI4I50062.2020.00021
El conjunto de datos es sintético y no contiene datos reales de empresas, lo que elimina preocupaciones de privacidad y propiedad industrial. Se distribuye bajo la licencia Creative Commons Attribution 4.0 International (CC BY 4.0), permitiendo su uso, modificación y distribución con atribución adecuada. Restricción de confidencialidad: El uso de los datos está restringido a fines académicos y de investigación. La publicación de resultados debe limitarse a métricas de evaluación, resultados agregados y metodología del modelo.
Este conjunto de datos presenta dos objetivos diferentes y requiere consideraciones especiales:
El mantenimiento predictivo es una de las aplicaciones más valiosas del aprendizaje automático en la industria 4.0. Este dataset sintético permite:
El dataset fue creado para el International Conference on Artificial Intelligence for Industries (AI4I) 2020 y ha sido ampliamente utilizado en investigaciones sobre mantenimiento predictivo y explicabilidad en IA.
Matzka, S. (2020). AI4I 2020 Predictive Maintenance Dataset. UCI Machine Learning Repository. https://doi.org/10.24432/C5HS5C
train_test_split con parámetro stratify para preservar exactamente la proporción original de clases (desbalance de fallos de máquina).📊 Resultado: Dataset de 10,000 registros de maquinaria industrial (con versión reducida estratificada de 1,000 ejemplos) con 6 variables predictoras (de proceso, operación y calidad) y 1 variable objetivo binaria (Machine_Failure). Desbalance moderado-preservado (~96.5% sin fallo / ~3.5% con fallo) — escenario ideal para validación de técnicas de generación de datos sintéticos y evaluación del índice TabDSFidelity en contextos de mantenimiento predictivo y detección de fallos en maquinaria industrial, donde la monitorización de variables físicas (temperaturas, velocidad, torque, desgaste) es fundamental para la prevención de averías.
🏭 Fuente: Predictive Maintenance Dataset (AI4I 2020) - Datos de sensores industriales para mantenimiento predictivo.
🌡️ Variables de temperatura: Air_Temp_K (temperatura ambiente) y Process_Temp_K (temperatura del proceso) — ambas en Kelvin.
⚙️ Variables de operación: Rotational_Speed_rpm (velocidad de giro), Torque_Nm (fuerza de torsión), Tool_Wear_min (desgaste de herramienta).
📊 Variable de calidad: Product_Quality_Type (0=Low, 1=Medium, 2=High) — ordinal preservando jerarquía.
📁 Leyenda disponible: Archivo leyenda_predictive_maintenance.txt con descripción completa de la variable objetivo, variable ordinal y variables físicas.
🎯 Variable objetivo: Machine_Failure (1 = Fallo de máquina, 0 = Funcionamiento normal).
🧹 Limpieza aplicada: Eliminación de UDI, Product ID y Failure Type (Data Leakage), renombrado de columnas, codificación ordinal de Product_Quality_Type, estandarización de tipos, reducción estratificada a 1,000 ejemplos.
| Variable | Descripción Industrial | Tipo | Rango / Categorías | Unidad | ¿Objetivo? |
|---|---|---|---|---|---|
Product_Quality_Type |
Tipo de calidad del producto (ordinal) | Categórico | 0: Low (Baja), 1: Medium (Media), 2: High (Alta) | N/A | No |
Air_Temp_K |
Temperatura ambiente del aire | Numérico | 295.6 - 304.4 | K | No |
Process_Temp_K |
Temperatura del proceso de la máquina | Numérico | 306 - 313.7 | K | No |
Rotational_Speed_rpm |
Velocidad de rotación de la máquina | Numérico | 1,168 - 2,595 | RPM | No |
Torque_Nm |
Torque (par motor) de la máquina | Numérico | 12.5 - 71.8 | Nm | No |
Tool_Wear_min |
Desgaste acumulado de la herramienta | Numérico | 0 - 241 | minutos | No |
Machine_Failure |
Fallo de la máquina (objetivo) | Binario | 0: Normal, 1: Fallo | N/A | Sí |
Esta sección detalla los códigos y significados de las variables categóricas y binarias presentes en el conjunto de datos de Mantenimiento Predictivo (AI4I 2020). Comprender estas codificaciones es fundamental para la correcta interpretación de los resultados de predicción de fallos.
Product_Quality_Type
Categórica (Ordinal)
| Código | Significado (Original) | Interpretación |
|---|---|---|
| 0 | Low (L) - Baja calidad | Mayor variabilidad en el proceso |
| 1 | Medium (M) - Calidad media | Proceso estable |
| 2 | High (H) - Alta calidad | Mayor precisión en el proceso |
Orden lógico: La calidad del producto es ordinal. Mayor calidad suele asociarse con menor variabilidad y menor riesgo de fallo.
Machine_Failure
🎯 Objetivo
| Código | Significado |
|---|---|
| 0 | Normal - Máquina en funcionamiento correcto (96.61%) |
| 1 | Fallo - La máquina experimentó un fallo (3.39%) |
Variable Objetivo: Predice fallos mecánicos basándose en lecturas termodinámicas y cinemáticas.
Formato: 0 = Normal, 1 = Fallo
Machine_Failure
🎯 Variable Objetivo: Fallo de máquina (0: Normal, 1: Fallo)
Nota: Única variable binaria en el dataset.
Tool_Wear_min - El desgaste acumulado es un predictor clave de fallosRotational_Speed_rpm × Torque_Nm ≈ constante (potencia)Process_Temp_K > Air_Temp_K es una condición física esperadaTorque_Nm > 60 → Rotational_Speed_rpm < 1450Torque_Nm > 50 → Rotational_Speed_rpm < 1700Rotational_Speed_rpm > 2200 → Torque_Nm < 20Rotational_Speed_rpm > 1800 → Torque_Nm < 30Air_Temp_K > 300 → Process_Temp_K > 308Process_Temp_K < 306 → Air_Temp_K < 298Tool_Wear_min > 250 → Machine_Failure = 1Machine_Failure == 0 → Tool_Wear_min < 260Torque_Nm > 60 → Tool_Wear_min < 180Tool_Wear_min > 220 → (Torque_Nm > 50) OR (Product_Quality_Type = 1)Product_Quality_Type == 0 → Tool_Wear_min < 240Tool_Wear_min == 0 → Machine_Failure = 0Rotational_Speed_rpm < 1200 → Machine_Failure = 1Torque_Nm > 70 → Machine_Failure = 1Torque_Nm ≥ 0 (No negativo)Rotational_Speed_rpm ≥ 0 (No negativo)| Valor escala | 0.03 |
|---|---|
| Probabilidad Base | 0.1 |
| epochs | 500 |
|---|---|
| batch_size | 50 |
| generator_lr | 0.0002 |
| discriminator_lr | 0.0002 |
| pac | 10 |
| generator_dim | (256, 256) |
| discriminator_dim | (256, 256) |
| embedding_dim | 128 |
| l2scale | 1e-05 |
| epochs | 500 |
|---|---|
| batch_size | 50 |
| embedding_dim | 128 |
| compress_dims | (128, 128) |
| decompress_dims | (128, 128) |
| l2scale | 1e-5 |
| loss_factor | 2 |
| Random Seed | 42 |
|---|---|
| Python | 3.12.12 |
Para reproducir exactamente este conjunto de datos, ejecute el script de generación con la semilla aleatoria 42.
Los resultados pueden variar ligeramente según la versión de las librerías.
El conjunto original ha sido sometido a un proceso de balanceo de clases y generación sintética para mejorar la representación de clases minoritarias. Nota: se ha empleado un conjunto de validación para evaluar el índice de fidelidad. Se han generado tres familias de conjuntos:
El mejor conjunto de cada etapa fue seleccionado mediante el índice TabDSFidelity.
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Random Oversampling | 1 | 1160 | 0.990 | 0.980 | 0.980 | 8.085 | 0.324 | 0.001 | 0.279 | 0.907 | 49.966 | 0 | 1160 | 0.445 | |
| Smote | 1 | 1160 | 0.934 | 0.939 | 0.925 | 1.286 | 0.382 | 0.000 | 0.307 | 0.887 | 47.807 | 0.022 | 601 | 0.425 | |
| Borderline SMOTE | 1 | 1160 | 0.975 | 0.966 | 0.965 | 4.787 | 0.407 | 0.001 | 0.306 | 0.827 | 48.867 | 0.018 | 600 | 0.429 | |
| ADASYN | 1.010 | 1154 | 0.933 | 0.949 | 0.940 | 2.278 | 0.380 | 0.000 | 0.305 | 0.889 | 48.760 | 0.021 | 600 | 0.440 | |
| SMOTE RSB* Adaptado | 1 | 1160 | 0.922 | 0.959 | 0.955 | 3.795 | 0.390 | 0.000 | 0.282 | 0.901 | 47.101 | 0.024 | 600 | 0.422 | |
| SMOTE RSB* Adaptado + Reglas | 1 | 1160 | 0.932 | 0.950 | 0.940 | 3.137 | 0.390 | 0.000 | 0.282 | 0.899 | 46.699 | 0.024 | 600 | 0.405 | |
| OOF PSO para Balanceo | 2.248 | 838 | 0.987 | 0.968 | 0.970 | 5.880 | 0.309 | 0.006 | 0.138 | 0.770 | 54.295 | 0.031 | 600 | 0.408 | |
| OOF PSO para Balanceo + Reglas | 11.135 | 631 | 0.984 | 0.974 | 0.975 | 9.378 | 0.111 | 0.721 | 0.010 | 0.914 | 55.680 | 0.005 | 599 | 0.456 | 🏆 |
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SMOTE RSB* + Ruido Gaussiano | 8.383 | 8229 | 0.987 | 0.978 | 0.980 | 9.599 | 0.516 | 0.335 | 0.024 | 0.927 | 63.832 | 0.300 | 0 | 0.463 | 🏆 |
| SMOTE RSB* + Ruido Gaussiano + Reglas | 8.236 | 8229 | 0.952 | 0.978 | 0.980 | 9.386 | 0.516 | 0.335 | 0.024 | 0.925 | 174.541 | 0.300 | 0 | 0.462 | |
| CTGAN | 3.537 | 9950 | 0.654 | 0.948 | 0.965 | 6.443 | 0.331 | 0.164 | 0.082 | 0.868 | 221.524 | 0.063 | 0 | 0.444 | |
| CTGAN + Reglas del Dominio | 2.618 | 9950 | 0.691 | 0.948 | 0.965 | 6.667 | 0.331 | 0.164 | 0.114 | 0.869 | 342.548 | 0.066 | 0 | 0.445 | |
| TVAE | 12.037 | 9999 | 0.813 | 0.964 | 0.970 | 7.105 | 0.627 | 0.130 | 0.031 | 0.898 | 166.536 | 0.034 | 0 | 0.435 | |
| TVAE + Reglas del Dominio | 11.803 | 9999 | 0.820 | 0.956 | 0.965 | 6.882 | 0.627 | 0.130 | 0.032 | 0.898 | 289.507 | 0.034 | 0 | 0.436 | |
| OOF PSO para Aumento | 1 | 10000 | 0.739 | 0.887 | 0.840 | 0.511 | 0.794 | 0.000 | 0.511 | 0.509 | 210.873 | 0.148 | 0 | 0.441 | |
| OOF PSO para Aumento + Reglas | 6.710 | 10000 | 0.750 | 0.947 | 0.935 | 3.427 | 0.794 | 0.000 | 1.154 | 0.584 | 332.967 | 0.202 | 0 | 0.456 | |
| SMOTE RSB* Refinado | 1.171 | 7722 | 0.981 | 0.964 | 0.960 | 7.438 | 0.581 | 0.000 | 0.249 | 0.776 | 63.672 | 0.178 | 0 | 0.471 | |
| SMOTE RSB* Refinado + Reglas | 1.171 | 7722 | 0.981 | 0.964 | 0.960 | 7.438 | 0.581 | 0.000 | 0.249 | 0.776 | 173.171 | 0.178 | 0 | 0.471 |
| Algoritmo | Ratio | N° Ejemplos | AUC-ROC | F1 | Accuracy | TabDSFidelity | Jensen-Shannon | Kolmogorov-Smirnov | Kullback-Leibler | Correlación | Tiempo Total (s) | Dist. Promedio | Copias Exactas | Ataque MIA | Mejor |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| SMOTE RSB* + Ruido Gaussiano | 8.537 | 8860 | 0.979 | 0.972 | 0.975 | 9.418 | 0.487 | 0.357 | 0.022 | 0.927 | 119.928 | 0.299 | 0 | 0.490 | 🏆 |
| SMOTE RSB* + Ruido Gaussiano + Reglas | 8.396 | 8860 | 0.980 | 0.968 | 0.970 | 8.465 | 0.487 | 0.357 | 0.023 | 0.925 | 227.852 | 0.299 | 0 | 0.492 | |
| CTGAN | 3.713 | 10581 | 0.647 | 0.945 | 0.960 | 3.322 | 0.316 | 0.172 | 0.077 | 0.871 | 285.447 | 0.060 | 125 | 0.453 | |
| CTGAN + Reglas del Dominio | 2.776 | 10581 | 0.786 | 0.968 | 0.975 | 7.752 | 0.316 | 0.172 | 0.106 | 0.872 | 402.540 | 0.062 | 125 | 0.464 | |
| TVAE | 11.979 | 10630 | 0.976 | 0.968 | 0.975 | 8.226 | 0.579 | 0.157 | 0.029 | 0.900 | 229.752 | 0.032 | 125 | 0.434 | |
| TVAE + Reglas del Dominio | 11.761 | 10630 | 0.907 | 0.968 | 0.975 | 7.807 | 0.579 | 0.157 | 0.029 | 0.899 | 350.683 | 0.032 | 125 | 0.405 | |
| OOF PSO para Aumento | 1.104 | 10631 | 0.956 | 0.974 | 0.975 | 5.856 | 0.732 | 0.000 | 0.449 | 0.520 | 271.050 | 0.139 | 125 | 0.457 | |
| OOF PSO para Aumento + Reglas | 4.667 | 10631 | 0.974 | 0.974 | 0.975 | 6.161 | 0.732 | 0.000 | 0.966 | 0.600 | 394.379 | 0.187 | 125 | 0.414 | |
| SMOTE RSB* Refinado | 1.314 | 8353 | 0.980 | 0.964 | 0.960 | 5.385 | 0.543 | 0.000 | 0.224 | 0.781 | 119.469 | 0.176 | 0 | 0.461 | |
| SMOTE RSB* Refinado + Reglas | 1.314 | 8353 | 0.980 | 0.964 | 0.960 | 5.385 | 0.543 | 0.000 | 0.224 | 0.781 | 229.659 | 0.176 | 0 | 0.461 |
Para interpretar correctamente los resultados de los conjuntos de datos generados, es fundamental comprender qué mide cada métrica y cómo se relacionan entre sí. A continuación, se detalla cada una de las métricas utilizadas en la evaluación:
¿Qué mide? Capacidad del modelo para distinguir entre clases (Ej: mortalidad vs supervivencia).
Interpretación:
Ejemplo: AUC-ROC = 0.82 significa que hay un 82% de probabilidad de que el modelo clasifique correctamente un paciente fallecido frente a uno superviviente.
¿Qué mide? Media armónica entre precisión y sensibilidad (recall).
Interpretación:
Ejemplo: F1 = 0.76 indica que el modelo mantiene un buen balance entre identificar correctamente a los pacientes que fallecen (sensibilidad) y no etiquetar erróneamente a los que sobreviven (precisión).
¿Qué mide? Proporción de predicciones correctas sobre el total.
Interpretación:
Ejemplo: Accuracy = 0.75 significa que el 75% de las predicciones del modelo son correctas.
⚠️ Nota: En conjuntos desbalanceados, esta métrica puede ser engañosa. Es mejor usar F1-Score o AUC-ROC.
¿Qué mide? Calidad global del conjunto sintético comparado con el original.
Interpretación:
Ejemplo: TabDSFidelity = 8.08 indica que el conjunto sintético mantiene una alta similitud con el original, preservando las relaciones y distribuciones de los datos reales, además de maximizar su eficacia predictiva.
💡 Importante: Este es el índice para seleccionar el mejor conjunto de datos sintéticos. Para este caso, el peso empleado para las métricas "AUC-ROC", "F1-Score" y "Accuracy" fue (2) y para el resto de las métricas fue (1).
¿Qué mide? Similitud entre las distribuciones de variables numéricas del conjunto sintético y el original.
Interpretación:
Ejemplo: JS = 0.118 indica que las distribuciones de las variables numéricas (edad, presión arterial, etc.) son bastante similares a las del conjunto original.
📌 Nota: Es el promedio de la divergencia de Jensen-Shannon calculada para todas las variables numéricas.
¿Qué mide? Probabilidad estadística de que las muestras numéricas del conjunto sintético provengan de la misma distribución continua que el original.
Interpretación:
Ejemplo: KS p-valor = 0.753 indica que hay evidencia fuerte a favor de que las distribuciones acumulativas de la variable sintética y la original son equivalentes.
📌 Nota: Se reporta el promedio de los p-valores obtenidos mediante la prueba de Kolmogorov-Smirnov de dos muestras para las variables numéricas.
¿Qué mide? Divergencia entre las distribuciones de variables categóricas del conjunto sintético y el original.
Interpretación:
Ejemplo: KL = 0.014 indica que la distribución de las variables categóricas (género, mortalidad) es muy similar a la del conjunto original.
📌 Nota: Es el promedio de la divergencia de Kullback-Leibler para todas las variables categóricas. A diferencia de JS y KS, esta métrica se aplica solo a variables categóricas.
¿Qué mide? Preservación de las relaciones entre variables del conjunto original.
Interpretación:
Ejemplo: Correlación = 0.976 significa que las relaciones entre variables (ej. edad y mortalidad) se mantienen en un 97.6% respecto al conjunto original.
¿Qué mide? Tiempo total de ejecución del proceso de generación del conjunto.
Interpretación:
Ejemplo: Tiempo total = 69.45s significa que el proceso completo de generación del conjunto balanceado tomó aproximadamente 1.16 minutos.
⏱️ Nota: Incluye el tiempo de generación sintética + cálculo de métricas.
Estas métricas evalúan el riesgo de exposición de información sensible y la capacidad de un atacante para inferir datos de los pacientes a partir del conjunto de datos sintéticos.
¿Qué mide? La distancia promedio entre cada registro sintético y su registro más cercano en el conjunto de datos original.
Interpretación:
Ejemplo: Distancia promedio = 0.015 en SMOTE indica que los registros sintéticos están relativamente cerca de los originales, lo que podría implicar un riesgo de privacidad moderado.
Metodología: Calculada utilizando la Distancia de Gower, la cual maneja internamente tipos de datos mixtos, normalizando las variables numéricas y penalizando diferencias categóricas para devolver un índice estandarizado entre 0 y 1.
Recomendación: Valores < 0.01 deben ser evaluados con precaución. Idealmente, buscar valores > 0.02 para garantizar la privacidad.
¿Qué mide? Número de registros sintéticos que son copias idénticas de registros en el conjunto de datos original.
Interpretación:
Ejemplo: SMOTE RSB* Refinado genera 76 copias exactas de 8817 registros (0.86%), lo que representa un riesgo de privacidad que debe ser evaluado.
Importante: La presencia de copias exactas es uno de los indicadores más críticos de fuga de datos. Idealmente, este valor debe ser 0.
¿Qué mide? Tasa de éxito (medida en AUC-ROC) de un atacante para determinar si un registro específico pertenece al conjunto de datos original.
Interpretación:
Ejemplo: MIA = 0.553 significa que el atacante tiene un éxito ligeramente superior al 50% aleatorio, lo que indica un riesgo de privacidad bajo/moderado.
Objetivo: Buscar valores lo más cercanos a 0.5. Valores > 0.6 indican que el conjunto sintético no protege adecuadamente la privacidad.
Formatos incluidos: CSV.
Díaz Bastida, M., Pérez Vázquez, R. A., & Bello Pérez, R. (2026). High-Fidelity Synthetic Dataset for Predictive Maintenance (AI4I 2020) (Version 1). figshare. https://doi.org/10.6084/m9.figshare.32946731.v1