El proyecto final consiste en un trabajo grupal en el cual se aplicarán todos los contenidos vistos a lo largo de la diplomatura. A continuación se presentan las propuestas para trabajar en esta instancia final:
Propuesta 1: Desarrollo de modelos predictivos para la detección de baja masa muscular mediante aprendizaje supervisado
Maximiliano Arlettaz
Problemática a abordar:
La baja masa muscular se asocia con limitaciones funcionales, discapacidad y peores resultados en salud. Sin embargo, su evaluación suele requerir métodos relativamente costosos o de difícil acceso, como la absorciometría de rayos X de energía dual (DXA), lo que dificulta su detección temprana en muchos contextos clínicos. En base a esto, ¿cuál es el desempeño predictivo de distintos algoritmos de aprendizaje supervisado para la detección de baja masa muscular utilizando variables clínicas y antropométricas de fácil obtención?
El objetivo del trabajo es desarrollar y evaluar modelos predictivos basados en aprendizaje supervisado para la detección de baja masa muscular utilizando variables clínicas y antropométricas de fácil obtención.
Descripción de la base de datos a utilizar:
Se utilizará la base de datos NHANES (National Health and Nutrition Examination Survey), una encuesta poblacional de salud y nutrición de Estados Unidos. Se trabajará con una base de datos tabular que incluye miles de participantes adultos y variables clínicas, antropométricas y funcionales. Los datos se encuentran en formato compatible csv y permitirán desarrollar modelos predictivos para la detección de baja masa muscular mediante técnicas de aprendizaje supervisado.
Metodologías de ciencia de datos y ML aplicables al proyecto:
- Modelos Predictivos (Regresión, Clasificación)
Propuesta 2: Exploración y Predicción de Deterioro Cognitivo en Adultos Mayores: Aprendizaje Automático Aplicado a Datos Transversales del Estudio SHARE
Stefano Staurini
Problemática a abordar:
El problema central es el diagnóstico deficiente y tardío del deterioro cognitivo y la demencia, el cual suele detectarse cuando el daño neurológico ya es clínicamente evidente, perdiendo la ventana de oportunidad para intervenciones preventivas eficaces. La pregunta de investigación es: ¿Es posible identificar, mediante técnicas de aprendizaje automático aplicadas a los datos transversales de SHARE, perfiles heterogéneos de envejecimiento cognitivo, y en qué medida las variables demográficas, biomédicas, conductuales y psicosociales permiten predecir de forma precisa la presencia de bajo rendimiento cognitivo?
El objetivo del trabajo es desarrollar una aplicación de aprendizaje automático para segmentar perfiles de envejecimiento cognitivo y predecir el riesgo de deterioro cognitivo en adultos mayores a partir de los datos transversales de la encuesta europea SHARE. El resultado esperado es que los estudiantes identifiquen y caractericen perfiles clínicos de envejecimiento mediante clustering no supervisado, y construyan modelos de clasificación supervisada robustos calibrados para screening médico. El hito final será la integración intergrupal, evaluando mediante valores SHAP si la incorporación de los clusters no supervisados como variables predictoras incrementa significativamente la capacidad de discriminación del modelo supervisado.
Descripción de la base de datos a utilizar:
Se utilizará easySHARE, una versión simplificada y armonizada del prestigioso estudio europeo longitudinal SHARE. Para este análisis de corte transversal se filtrará la Ola 9 (2021-2022), proporcionando una muestra masiva y robusta de entre 50.000 y 70.000 observaciones de adultos mayores de 50 años en más de 25 países. El conjunto de datos se presenta en formato tabular y contiene una rica variedad de dimensiones:
- Cognitivas basales: Pruebas crudas de memoria inmediata/diferida, orientación y cálculo.
- Clínicas y funcionales: Multimorbilidad crónica, IMC, fuerza de agarre (proxy de fragilidad) e índices de capacidad funcional (ADL/IADL).
- Psicosociales y conductuales: Escala de depresión EURO-D, calidad de vida, soledad, tabaquismo, alcohol, actividad física y tamaño de la red social.
- Innovación: Puntuaciones completas de rasgos de personalidad (Big Five).
Metodologías de ciencia de datos y ML aplicables al proyecto:
- Modelos Predictivos (Regresión, Clasificación)
- Técnicas de Agrupamiento (Clustering) – No supervisado
- Visualización Avanzada de Datos
Propuesta 3: EEG e Imaginación Motora para la Rehabilitación de pacientes con Stroke: Ingeniería de Características y Robustez ante el BCI Illiteracy.
Bruno Zorzet
Problemática a abordar:
Las Interfaces Cerebro-Computadora basadas en Imaginación Motora (MI-BCI, ver Figura 1) han emergido como una tecnología revolucionaria en el ámbito de la ingeniería biomédica, especialmente orientada a la rehabilitación de pacientes que han sufrido un stroke (accidente cerebrovascular). Al registrar de forma no invasiva la señal de EEG, estos sistemas permiten traducir la intención motora del paciente en comandos de control para dispositivos de asistencia o terapias de neurorretroalimentación, promoviendo activamente la neuroplasticidad en las regiones afectadas. Para profundizar en el impacto real de este enfoque clínico, los estudiantes pueden consultar el siguiente recurso que analiza el antes y después de la rehabilitación en pacientes post-stroke.
El objetivo del trabajo es diseñar e implementar un pipeline completo de procesamiento de señales y aprendizaje automático para clasificar dos clases de imaginación motora, evaluando críticamente el impacto de la ingeniería de características multidominio, estrategias de validación cruzada realistas y la robustez de los modelos frente a señales biológicas sin filtrar.
Descripción de la base de datos a utilizar:
El proyecto utilizará un conjunto de datos ya curado y preprocesado de Imaginación Motora (MI-BCI). Sin embargo, la naturaleza intrínseca de las señales de electroencefalografía (EEG) presenta un desafío de alta dimensionalidad, ya que registra la actividad cerebral de múltiples sensores en simultáneo a lo largo del tiempo. Por esta razón, uno de los primeros pasos críticos para los estudiantes será analizar y comprender la dimensionalidad de los datos a la entrada del pipeline, asegurando un correcto manejo de los tensores antes de aplicar cualquier técnica de Machine Learning. Los datos se entregarán estructurados en matrices tridimensionales (tensores) con la forma [N, C, T], donde cada dimensión representa el número de trials de MI, la cantidad de canales y el tiempo. Se presentarán dos bases de datos de 52 y 60 participantes.
Metodologías de ciencia de datos y ML aplicables al proyecto:
- Modelos Predictivos (Regresión, Clasificación)
- Aprendizaje Profundo (Deep Learning – CNN, RNN, etc.)
- Visualización Avanzada de Datos
Propuesta 4: De los píxeles a los patrones: dos enfoques para la detección de lesiones cutáneas
Carolina Maldonado
Problemática a abordar:
El proyecto busca clasificar imágenes de lunares a través de dos abordajes:
1) Abordaje artesanal: procesamiento de las imágenes, extracción de features “manualmente” y ANN
2) Abordaje con Deep Learning
3) Comparación de resultados.
Los objetivos del proyecto son:
- Aplicar conceptos y técnicas de procesamiento de imágenes (imagen RGB a monocroma, binarizado, filtrado, etc ) que permitan diseñar y extraer “manualmente” features que reflejen A,B,C,D.
- Explorar y aplicar modelos de Deep Learning a un banco de imágenes.
- Comparar y sacar conclusiones, ventajas y desventajas de ambos abordajes.
- Explorar técnicas de aumentación de datos en imágenes.
Descripción de la base de datos a utilizar:
La base de datos cuenta con 2 carpetas de imágenes. Una con 5000 imágenes de lunares benignos (melanocytic nevi) vs 4522 lunares malignos (melanoma) . Las imágenes no tienen todas el mismo tamaño.
Metodologías de ciencia de datos y ML aplicables al proyecto:
- Modelos Predictivos (Regresión, Clasificación)
- Aprendizaje Profundo (Deep Learning – CNN, RNN, etc.)
Propuesta 5: ¿De qué hablamos cuando hablamos de obesidad? Procesamiento de Lenguaje Natural (NLP) aplicado a Twitter en Argentina
Eugenia Haluszka
Problemática a abordar:
La obesidad es reconocida en Argentina como un importante problema de salud pública. Existen campañas y programas, tanto a nivel nacional como provincial, que buscan reducir su prevalencia. Sin embargo, según datos de la Encuesta Nacional de Factores de Riesgo (ENFR), la tendencia sigue en aumento: en 2018, 6 de cada 10 personas presentaban exceso de peso, y 2 de esas 6 tenían obesidad.
Frente a este panorama, este proyecto propone mirar el problema desde otra perspectiva más social y cultural: ¿Qué se dice sobre la obesidad en las redes sociales? ¿Cómo se construye el discurso público sobre el tema? Se parte de la idea de que factores culturales y sociales también pueden influir en este fenómeno y que, al analizarlos, podríamos entender mejor por qué sigue creciendo su prevalencia. Para esto, trabajamos con un conjunto de datos compuesto por tweets que mencionan palabras clave relacionadas con la obesidad. Esta base incluye información como el contenido del tweet, la cantidad de likes, retweets, respuestas, citas, la fecha de publicación, el mes y la provincia desde donde fue publicado. A partir de este material, el proyecto busca explorar cómo se percibe y discute la obesidad en el espacio digital, qué temas predominan, qué emociones circulan y si existen diferencias regionales o temporales en la forma en que se habla del tema.
Descripción de la base de datos a utilizar:
La base de datos cuenta con 11111 registros y 13 columnas recopiladas de Twitter a partir de palabras clave sobre obesidad durante el año 2024. La información fue extraída con el objetivo de analizar conversaciones en torno a la obesidad en Argentina, incluyendo interacciones, fechas, hashtags y datos geográficos. Para identificar la provincia de origen de los usuarios que generaron los tweets, se realizó un proceso de reconocimiento de localidades, ciudades y departamentos más relevantes y frecuentes a partir de la variable “location” asociada a cada usuario. Posteriormente, se asignó una provincia a cada tweet con base en esa información. En los casos en que un tweet presenta dos o más provincias identificadas, esto se debe a que el usuario mencionó múltiples lugares en su descripción de ubicación. Esta variable se denominó “pcia”.
Metodologías de ciencia de datos y ML aplicables al proyecto:
- Procesamiento de Lenguaje Natural (NLP)
- Visualización Avanzada de Datos