El nuevo modelo multimodal puede aprender de texto, imágenes, vídeo y sonido y, gracias a la modularidad, produce cualquier número o combinación de predicciones.

Ya sea que hablemos de OpenAI o ChatGPT, la gran mayoría de los chatbots inteligencia artificial generativa se basan en los llamados Modelo de lenguaje grande (LLM), modelos de deep learning a gran escala capacitados para dar respuestas a las preguntas que se les plantean mediante el aprendizaje de información a través de grandes cantidades de texto.
La última frontera deIA generativa son los modelos multimodales, que combinan comprensión del lenguaje e imágenes, vídeo y audio para ofrecer una experiencia y un servicio aún más avanzado.
Su creación, sin embargo, presenta varios desafíos, especialmente si la intención es construir modelos multimodales a pequeña escala: la frecuente presencia de datos faltantes por falta de disponibilidad de información, casi siempre por disponibilidad parcial de recursos.
En definitiva, el riesgo es que el modelo aprenda a partir de una carencia y que los cálculos y predicciones se distorsionen. Y aquí es donde EPFL empezó con su nuevo proyecto.
De la Universidad Técnica de Lausana y Zúrich una coalición para la energía verde
En 3D el guante tecnológico que hará tangible la Realidad Virtual

MultiModN, el modelo modular multimodal nacido en Lausana
Los investigadores de la Politécnico Federal de Lausana (EPFL), una de las mejores universidades del mundo en ingeniería e informática, de hecho ha desarrollado MultiModN, un modelo multimodal modular único presentado recientemente en NeurIPS2023.
Investigadores de los laboratorios de Aprendizaje Automático para la Educación (ML4ED) y Aprendizaje Automático y Optimización (MLO) de la Facultad de Ciencias de la Computación y Comunicación de la EPFL decidieron desarrollar y probar exactamente lo opuesto a una escala grande, pero pensar en una escala más pequeña.
Dirigido por el maestro Mary-Anne Hartley, director del Laboratorio de Tecnologías Sanitarias Inteligentes Globales alojado conjuntamente en MLO y la Facultad de Medicina de Yale, y profesor Tanja Käser, director de ML4ED, el equipo creó un modelo multimodal que puede aprender de texto, imágenes, vídeos y sonidos pero que, a diferencia de los existentes, se compone de un número variable de módulos más pequeños, autónomo y específico de entrada.
Estos últimos pueden seleccionarse en función de la información disponible y luego agruparse en una secuencia de cualquier número, combinación o tipo de entrada. Por lo tanto, puede producir cualquier número o combinación de predicciones.
"Evaluamos MultiModN en diez actividades reales, incluido el apoyo al diagnóstico médico, la predicción del rendimiento académico y la previsión meteorológica”. él explicó Vinitra Swamy, estudiante de doctorado en ML4ED y MLO y primer coautor del proyecto.
“A través de estos experimentos, creemos que MultiModN es el primer enfoque intrínsecamente interpretable y resistente a la falta de datos para el modelado multimodal.".
La "receta" de EPFL para computadoras cuánticas más poderosas
¿De la Inteligencia Artificial un impulso decisivo a las criptomonedas?

El primer caso de uso: decisiones clínicas para el personal médico.
El primer caso de uso de MultiModN será como sistema de soporte para decisiones clínicas para el personal médico en entornos con recursos limitados.
De hecho, en el sector sanitario, a menudo faltan datos clínicos, quizás debido a la limitación de recursos (un paciente no puede permitirse una prueba específica) o, por el contrario, a la abundancia de recursos e información. MultiModN puede aprender de estos datos del mundo real sin absorber sus llamados sesgos y adaptar las predicciones a cualquier combinación o número de entradas.
"Los datos faltantes son un sello distintivo en contextos con recursos limitados y, a medida que los modelos aprenden estos patrones faltantes, pueden codificar errores en sus predicciones”. destacó Mary-Anne Hartley.
“La necesidad de flexibilidad frente a recursos disponibles impredecibles es lo que inspiró a MultiModN".
En un evento destacado el impacto de la IA y el aprendizaje automático en los servicios
Todas las razones de la creciente influencia de la IA en el arte digital

Del laboratorio a la vida real: en marcha un ensayo sobre neumonía y tuberculosis
Sin embargo, la publicación es sólo el primer paso hacia la implementación y las pruebas de campo. El profesor Hartley trabajó con colegas del Hospital Universitario de Lausana (CHUV) y del Inselspital, el Hospital Universitario de Berna, para realizar estudios clínicos se centró en el diagnóstico de neumonía y tuberculosis en entornos con recursos limitados y está en el proceso de reclutar a miles de pacientes. Sudáfrica, Tanzania, Namibia e Benín.
Los grupos de investigación llevaron a cabo una amplia iniciativa de formación, impartiendo más que los doctores de 100 recopilar sistemáticamente datos multimodales, incluidas imágenes y videos de ultrasonido, de modo que se pueda entrenar a MultiModN para que sea sensible a datos reales de regiones de bajos recursos.
“Estamos recopilando exactamente el tipo de datos multimodales complejos para los que MultiModN está diseñado”, dijo el doctor Noémie Boillat-Blanco, especialista en enfermedades infecciosas del CHUV.
“Estamos entusiasmados de ver un modelo que pueda apreciar el complejidad de los recursos faltantes en nuestros contextos y la falta sistemática de evaluaciones clínicas rutinarias", añadió el médico Cristina Keitel del Inselspital, el hospital universitario de la capital suiza.
¿La seguridad de la IA? La declaración de Bletchley Park es crucial
Eje Axel Springer-OpenAI para la IA al servicio del periodismo

Machine Learning al servicio del bien público
El desarrollo y la formación de MultiModN representa la continuación de los esfuerzos de EPFL para adaptar las herramientas de aprendizaje automático a la realidad y al bien público, y se produce poco después del lanzamiento de Meditrón, un modelo de inteligencia artificial diseñado específicamente para el sector médico.
Meditron también pertenece a la categoría de modelos de lenguaje grandes (LLM), pero a diferencia de los modelos generalistas, que sirven para una amplia gama de tareas, se centra en campo médico, y es más compacto en términos de tamaño, pero igualmente efectivo.
El objetivo de Meditron es democratizar el acceso a la información médica de alta calidad, ayudando así a las decisiones clínicas.
Los investigadores de la EPFL desarrollaron dos versiones con 7 mil millones y 70 mil millones de parámetros respectivamente, y los modelos se entrenaron con fuentes de datos médicos seleccionadas y de alta calidad, incluida literatura científica revisada por pares y varias pautas clínicas, lo que garantiza una base de conocimientos amplia y precisa.
Tanto Meditron, presentado en noviembre de 2023, como MultiModN están, por tanto, en línea con la misión del nuevo Centro de IA de EPFL, que se centra en cómo una inteligencia artificial responsable y eficaz puede promover la innovación tecnológica en beneficio de todos los sectores de la sociedad.


