El Instituto Nacional de Estándares y Tecnología de EE.UU. (NIST) ha publicado recientemente «Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations«, un exhaustivo informe que establece un marco conceptual claro para entender y enfrentar los desafíos de seguridad en sistemas de inteligencia artificial (IA).
El documento, elaborado por destacados expertos como Apostol Vassilev, Alina Oprea, Hyrum Anderson, Xander Davies, Alie Fordyce y Maia Hamin, introduce una taxonomía detallada de ataques y mitigaciones en aprendizaje automático adversarial (AML).
Este trabajo proporciona definiciones precisas y una terminología estandarizada para clasificar amenazas como ataques de evasión, envenenamiento de datos, vulneración de privacidad y ataques de inyección indirecta de comandos (prompt injection).
El informe identifica ataques reales y teóricos a sistemas predictivos y generativos, además de proponer métodos avanzados para la mitigación y gestión de riesgos.
Entre las amenazas abordadas se encuentran ataques de caja blanca y caja negra, la transferencia de ataques, y técnicas innovadoras para la extracción de modelos y reconstrucción de datos sensibles.
Este documento es esencial para profesionales involucrados en el desarrollo, implementación y gobernanza de sistemas de IA, así como para aquellos interesados en asegurar la robustez y fiabilidad de estas tecnologías.
El informe completo está disponible.
