Generación de Datos Sintéticos de Alta Fidelidad: Una Línea de Investigación Integrada
El desarrollo de sistemas de apoyo a la toma de decisiones mediante Inteligencia Artificial se enfrenta de manera persistente a la escasez de datos y al desbalance de clases en escenarios críticos. Esta página reúne las contribuciones de nuestra línea de investigación, la cual propone un marco metodológico estructurado y un índice de calidad unificado para la generación, evaluación y selección de datos sintéticos tabulares.
A través de varias publicaciones científicas revisadas por pares, se aborda este problema desde la formulación teórica del índice de calidad, la validación preliminar en congresos internacionales, hasta la consolidación de la metodología en revistas indexadas.
1. Consolidación de la Metodología y Análisis de Seguridad en UCI
Título: Methodology for Generating High Fidelity Synthetic Data to Improve Mortality Prediction for Patients in Intensive Care Units.
Publicación: Revista "SN Computer Science", Volumen 7, Número de artículo 370 (2026), de Springer Nature.
Fecha de Publicación: 18 de abril de 2026.
Estado: Manuscrito Aceptado por el Autor (Author's Accepted Manuscript).
Este trabajo representa la consolidación de nuestra metodología de cuatro etapas, validando de forma rigurosa la utilidad práctica de la generación de datos en diez conjuntos de datos reales de UCI. En esta investigación se incorpora un exhaustivo análisis de privacidad y seguridad utilizando la métrica de Distancia al Registro más Cercano (DCR) y simulaciones de Ataques de Inferencia de Membresía (MIA) para cuantificar la viabilidad de compartir los datos generados de manera segura.
Los modelos entrenados bajo este flujo de trabajo experimentaron mejoras consistentes de rendimiento, alcanzando incrementos promedio del +42.38% en AUC-ROC y del +37.17% en el F1-score.
2. Formulación del Framework Metodológico y Primeras Validaciones
Título: A Methodology for the Generation and Evaluation of Tabular Synthetic Data: A Case Study in Data Analysis in Intensive Care Units.
Publicación: Memorias del congreso "Progress in Artificial Intelligence and Pattern Recognition (IWAIPR 2025)", publicado en la serie Lecture Notes in Computer Science (LNCS), volumen 16328, de Springer.
Fecha de Publicación: 03 de febrero de 2026.
Estado: Manuscrito Aceptado por el Autor.
Esta publicación constituye el punto de partida del flujo de trabajo de cuatro pasos (Preparación, Gestión del Desbalance, Generación y Selección Guiada). El estudio de caso inicial demostró la viabilidad de equilibrar y ampliar entornos médicos pequeños y complejos de forma sistemática.
La aplicación de la metodología preliminar aportó resultados favorables iniciales, logrando una mejora promedio del +22.35% en el AUC-ROC y evidenciando que una técnica basada en SMOTE adaptada al dominio con ruido gaussiano podía superar de manera estable a modelos basados en redes neuronales generativas (GANs) en contextos de datos limitados.
3. Desarrollo Técnico del Índice de Fidelidad Unificado
Título: An Index for Assessing the Fidelity of Synthetic Tabular Data in Classification Tasks: TabDSFidelity.
Publicación: Publicado como capítulo de libro en "Applied Computer Sciences in Engineering. WEA 2025", perteneciente a la serie Communications in Computer and Information Science (CCIS), volumen 2702, de Springer.
Estado: Manuscrito Aceptado por el Autor.
Este artículo se enfoca exclusivamente en el desarrollo teórico y la validación matemática de TabDSFidelity, el índice que sirve de núcleo de decisión en nuestra metodología. El trabajo describe cómo integrar la utilidad predictiva, la similitud de las distribuciones univariadas y la conservación de correlaciones multivariadas en una única métrica adaptable.
La investigación demuestra empíricamente, sobre clasificadores clásicos y complejos, la existencia de una correlación positiva estadísticamente significativa (rho ˜ 0.67, p < 0.001) entre la puntuación otorgada por el índice y el rendimiento final del modelo en entornos del mundo real.
