Acerca de CódigoMDB

Desarrollador independiente con experiencia en la creación de soluciones web a medida.

Suscríbete & Sígueme

De datos escasos a modelos potentes en UCI

Una metodología estructurada para generar datos sintéticos aplicados a la salud

1. El desafío de los datos en entornos de cuidados críticos

La predicción de resultados clínicos, como la mortalidad en las Unidades de Cuidados Intensivos (UCI), es un factor importante para la toma de decisiones médicas. Sin embargo, el desarrollo de modelos de aprendizaje automático robustos suele verse limitado por dos problemas habituales en los datos reales: la escasez de datos y el severo desbalance de clases (donde los eventos de interés, como los fallecimientos, representan una minoría).

La generación de datos sintéticos se presenta como una alternativa para equilibrar y aumentar los conjuntos de datos. No obstante, el reto principal radica en garantizar la fidelidad de estos datos artificiales para que capturen correctamente las correlaciones y propiedades estadísticas de los pacientes reales, evitando sesgos que comprometan la seguridad clínica.

2. Nuestra propuesta: Un flujo de trabajo en 4 etapas

Proponemos una metodología sistemática diseñada para guiar la preparación, balanceo, generación y selección de datos sintéticos tabulares de alta fidelidad. Este proceso consta de cuatro etapas principales:

  1. Aseguramiento preventivo de la calidad en la fuente: Implementación de controles de integridad y reglas de validación clínica para asegurar que el conjunto de datos inicial sea consistente y libre de redundancias anomalas.
  2. Balanceo de clases guiado por fidelidad: Aplicación de múltiples técnicas de sobremuestreo y selección del dataset balanceado óptimo mediante el uso de una métrica unificada.
  3. Generación de datos sintéticos a gran escala: Ampliación del volumen de datos a través de modelos de generación avanzados, comparando aproximaciones basadas en interpolación adaptada con ruido gaussiano y modelos de aprendizaje profundo (CTGAN).
  4. Selección del conjunto óptimo y modelado final: Evaluación final de los datasets generados utilizando nuestro índice de fidelidad para entrenar el modelo predictivo definitivo con el conjunto de mayor utilidad práctica.

El núcleo de toma de decisiones de esta metodología es el índice TabDSFidelity, el cual integra métricas de similitud estadística (como las divergencias de Kullback-Leibler y Jensen-Shannon) y métricas de utilidad predictiva para asegurar una evaluación multidimensional.

3. Validación empírica con datos reales de UCI

Para validar la propuesta, se utilizaron diez conjuntos de datos reales provenientes de la UCI del Hospital Clínico Quirúrgico "Arnaldo Milián Castro" en Santa Clara, Cuba. Cada dataset representa una condición clínica compleja (como neumonía comunitaria grave, cetoacidosis diabética o trauma craneoencefálico) con diferentes niveles de escasez y desbalance.

Tras aplicar el flujo de trabajo y evaluar los modelos resultantes en conjuntos de prueba estrictamente independientes, se registraron mejoras promedio consistentes en el rendimiento del clasificador (Multilayer Perceptron):

  • Un incremento promedio del +42.38% en el área bajo la curva (AUC-ROC) en comparación con los modelos entrenados únicamente con los datos originales.
  • Un aumento del +37.17% en el F1-score ponderado.
  • Una mejora del +28.37% en la exactitud (Accuracy) general del modelo.

Hallazgos clave de la investigación:
Idoneidad de técnicas clásicas adaptadas: En escenarios de alta escasez de datos, la técnica SMOTE adaptada al dominio con inyección de ruido gaussiano (DA-RSB*+GN) obtuvo un desempeño superior frente a modelos de aprendizaje profundo complejos como CTGAN, los cuales tienden a requerir mayores volúmenes de muestra para converger adecuadamente.
Análisis de la utilidad predictiva: El estudio de ablación confirmó que incorporar métricas de desempeño del clasificador dentro del índice de selección es fundamental para evitar la elección de conjuntos de datos estadísticamente similares pero predictivamente limitados.

4. Evaluación de seguridad y viabilidad computacional

Reconociendo la sensibilidad de los datos clínicos, el trabajo incorpora un análisis de privacidad que evalúa el riesgo de reidentificación de pacientes mediante métricas de distancia al registro más cercano (DCR) y ataques de inferencia de membresía (MIA). Los resultados señalan que, si bien existen compromisos entre la fidelidad y la privacidad, el riesgo de inferencia de membresía se mantuvo cercano al azar (promedio de ~0.468), lo que aporta un marco de confianza para su uso controlado.

Adicionalmente, las pruebas de viabilidad demuestran que el flujo de trabajo completo es computacionalmente accesible, completando la generación y evaluación de candidatos en aproximadamente 62 segundos sobre hardware estándar de oficina, sin requerir infraestructura de cómputo de altas prestaciones.

5. Detalles del artículo científico y manuscrito

AVISO IMPORTANTE

Título del Artículo: Methodology for Generating High Fidelity Synthetic Data to Improve Mortality Prediction for Patients in Intensive Care Units.

Estado: Este es el Manuscrito Aceptado por el Autor (Author's Accepted Manuscript). Esta versión ha sido aceptada para su publicación tras la revisión por pares, pero no es la versión final maquetada por la editorial (Version of Record) y no refleja las mejoras o correcciones posteriores a la aceptación.

Publicación: Publicado en la revista "SN Computer Science", Volumen 7, Número de artículo 370 (2026), de Springer Nature.

Fecha de Publicación: 18 de abril de 2026.

Autores: Marcos Díaz Bastida, Ramiro A. Pérez Vázquez y Rafael Bello Pérez.

Tipo de artículo: Investigación Original (Original Research).

La Versión de Registro oficial está disponible en SpringerLink. El uso de esta versión aceptada está sujeto a los términos de uso de manuscritos aceptados del editor.

6. Material complementario

Para examinar los detalles experimentales, el pseudocódigo del índice TabDSFidelity, así como los gráficos de distribución y las tablas de resultados por cada condición clínica, te invitamos a visitar el sitio web complementario del proyecto en: Sitio del Proyecto - Metodología TDS.

Artículo Siguiente

Sistema UCI