Una nueva investigación revela cómo la información sensorial mejora la comprensión conceptual de la IA

Un estudio pionero de la Universidad Politécnica de Hong Kong revela que la incorporación de información sensorial en grandes modelos lingüísticos mejora significativamente su capacidad para comprender conceptos humanos complejos, estableciendo paralelismos más estrechos con la cognición humana.

Investigadores dirigidos por la Universidad Politécnica de Hong Kong (PolyU) han descubierto cómo los modelos lingüísticos de gran tamaño (LLM) pueden formar un conocimiento conceptual complejo de manera más similar a los humanos cuando se enriquecen con información sensorial y motora.

El estudio, dirigido por Li Ping, profesor de Humanidades y Tecnología de la Fundación Sin Wai Kin y decano de la Facultad de Humanidades de PolyU, exploró las similitudes entre los LLM y la representación conceptual humana.

Los resultados, publicado En la revista Nature Human Behaviour, sugieren que mientras que los LLM entrenados únicamente en el lenguaje muestran limitaciones, aquellos integrados con entradas sensoriales muestran una comprensión más matizada similar a la cognición humana.

Al comparar datos de LLM de vanguardia como ChatGPT (GPT-3.5, GPT-4) y PaLM y Gemini de Google con clasificaciones de palabras generadas por humanos, la investigación reveló que los LLM se ajustan bien a la comprensión humana en dimensiones no sensoriomotoras, pero presentan dificultades con conceptos sensoriales y motores. Esto indica la necesidad de una base sensorial para refinar los modelos de IA.

“La disponibilidad de LLMs, tanto de aquellos capacitados solo en lenguaje como de aquellos capacitados en lenguaje y estímulos visuales, como imágenes y videos, ofrece un entorno único para la investigación sobre cómo el estímulo sensorial afecta la conceptualización humana”, declaró Li en un comunicado de prensa. “Nuestro estudio ejemplifica los beneficios potenciales del aprendizaje multimodal, la capacidad humana de integrar simultáneamente información de múltiples dimensiones en el aprendizaje y la formación de conceptos y conocimientos en general”.

La importancia de esta investigación reside en sus posibles aplicaciones para el desarrollo futuro de la IA. Con un aprendizaje multimodal mejorado, los sistemas de IA podrían realizar tareas más similares a las humanas, desde la interpretación de datos hasta la ejecución de acciones físicas.

Los investigadores proponen que los futuros LLM equipados con entradas sensoriales integradas a través de robótica humanoide podrían revolucionar campos como la robótica autónoma, el procesamiento del lenguaje natural y la computación cognitiva.

La estructura fluida y continua del espacio de incrustación en los LLM podría fundamentar nuestra observación de que el conocimiento derivado de una modalidad podría transferirse a otras modalidades relacionadas. Esto podría explicar por qué las personas con ceguera congénita y las personas con visión normal pueden tener representaciones similares en algunas áreas. Las limitaciones actuales de los LLM son claras en este sentido —añadió Li Ping—.

El estudio proporciona un camino claro para avanzar en las tecnologías de IA, enfatizando el papel de la entrada multimodal para lograr una inteligencia artificial más sofisticada y similar a la humana.

“Estos avances pueden permitir que los LLM capturen por completo representaciones encarnadas que reflejen la complejidad y riqueza de la cognición humana, y una rosa en la representación de LLM será entonces indistinguible de la de los humanos”, concluyó Li.

Los coautores del estudio incluyen expertos de la Universidad Estatal de Ohio, la Universidad de Princeton y la Universidad de la Ciudad de Nueva York.

Fuente: La universidad politécnica de Hong Kong