Los investigadores de NYU Tandon han presentado EnIGMA, un agente de IA que resuelve de forma autónoma los desafíos de ciberseguridad, destacando su potencial para transformar aplicaciones del mundo real y mejorar las medidas de seguridad.
Investigadores de la Escuela de Ingeniería Tandon de la Universidad de Nueva York, junto con la Universidad de Nueva York en Abu Dabi y otras instituciones colaboradoras, han presentado un agente de IA avanzado diseñado para abordar de forma autónoma desafíos complejos de ciberseguridad. EnigmaEste avance se presentó en la Conferencia Internacional sobre Aprendizaje Automático (ICML) 2025, mostrando un impresionante avance en el campo.
“EnIGMA trata sobre el uso de agentes de modelos de lenguaje grandes para aplicaciones de ciberseguridad”, dijo el coautor Meet Udeshi, estudiante de doctorado de NYU Tandon, en un comunicado de prensa.
EnIGMA es la culminación de los esfuerzos de colaboración liderados por Udeshi bajo la guía de Ramesh Karri, presidente del Departamento de Ingeniería Eléctrica e Informática (ECE) de NYU Tandon y miembro de la facultad del Centro de Ciberseguridad de NYU y del Centro de Tecnología Avanzada en Telecomunicaciones (CATT) de NYU, y Farshad Khorrami, profesor de ECE y miembro de la facultad de CATT.
La investigación también ha contado con contribuciones de diversas voces académicas de NYU Abu Dhabi, la Universidad de Princeton y la Universidad de Stanford.
Los sistemas de IA tradicionales ya han demostrado su valor en dominios como el desarrollo de software y la navegación web, pero la ciberseguridad planteó desafíos únicos que hicieron que muchos marcos de IA existentes fueran insuficientes.
Sin embargo, EnIGMA aprovecha un marco especializado conocido como “Herramientas de agente interactivo” para traducir programas de ciberseguridad visual en formatos basados en texto comprensibles para los modelos de IA.
"Tenemos que reestructurar esas interfaces para integrarlas correctamente en un LLM. Así lo hemos hecho con un par de herramientas de ciberseguridad", añadió Udeshi.
Este enfoque innovador permite a la IA procesar texto, superando las limitaciones de las interfaces gráficas tradicionales comúnmente utilizadas en herramientas de ciberseguridad como depuradores y analizadores de red.
Un componente fundamental del desarrollo de EnIGMA fue la creación de un conjunto de datos de referencia personalizado de Captura la Bandera (CTF). Estos desafíos CTF, que simulan vulnerabilidades reales y se utilizan en competiciones académicas, desempeñaron un papel crucial en el entrenamiento de la IA.
Los CTF son como una versión gamificada de la ciberseguridad que se utiliza en competiciones académicas. No son problemas de ciberseguridad reales que uno enfrentaría en el mundo real, pero son simulaciones muy buenas —añadió Udeshi—.
La investigación demostró la superioridad de EnIGMA en 390 desafíos CTF distribuidos en cuatro pruebas de referencia, logrando resultados de vanguardia. El agente de IA logró resolver más del triple de desafíos en comparación con sistemas anteriores.
Al reflexionar sobre la evolución de los modelos de IA, Udeshi señaló: “Claude 3.5 Sonnet de Anthropic fue el mejor modelo y GPT-4o fue el segundo en ese momento”.
Durante su investigación, el equipo descubrió un fenómeno denominado «soliloquio», en el que la IA genera observaciones alucinadas sin interactuar realmente con su entorno. Este hallazgo podría tener implicaciones significativas para la seguridad y la fiabilidad de la IA en el futuro.
Más allá de los elogios académicos, las implicaciones de EnIGMA se extienden a aplicaciones prácticas.
Según Udeshi, “Si piensas en un agente LLM autónomo que pueda resolver estos CTF, ese agente tiene importantes habilidades de ciberseguridad que también puedes usar para otras tareas de ciberseguridad”.
La perspectiva de que un agente de este tipo aplique sus capacidades a evaluaciones de vulnerabilidad en el mundo real, intentando de manera autónoma cientos de enfoques diferentes, señala un cambio transformador en las operaciones de ciberseguridad.
Sin embargo, el carácter de doble uso de esta tecnología exige precaución. Si bien promete mejorar las defensas de ciberseguridad, también existe el riesgo de uso indebido.
A la luz de esto, los investigadores han informado a las principales empresas de IA, incluidas Meta, Anthropic y OpenAI, sobre sus hallazgos.
