En los últimos meses, los grandes líderes de la industria de la inteligencia artificial han sido muy claros con su desarrollo: hay que frenar el crecimiento de los modelos. A un lado, el presidente Donald Trump ha hecho caso omiso de las advertencias, asegurando que China es el verdadero problema.
Al otro lado, varias manifestaciones de organizaciones civiles han inundado las calles para hacer ver que la IA no es buena compañera del medioambiente, que está en pocas manos, etc. Pero, ¿y si el verdadero problema fuera que puede ser controlada en la sombra?
Los grandes modelos de lenguaje natural (LLM) no nacen ya sabiendo –como tampoco ocurre con los seres humanos–, sino que son entrenados mediante una ingente cantidad de datos que suponen petabytes de texto e imágenes que extrae de la web, lo que se conoce como scraping web.
Y estos datos masivos globales son realmente fáciles de infectar, como ya demostró en 2023 uno de los estudios fundamentales de esta industria, denominado Poisoning web-scale training datasets is practical, liderado por Nicholas Carlini, por entonces en Google Brain, e investigadores de la Universidad de California en Berkeley y el ETH Zürich.
En su caso, aprovecharon la compra de dominios antiguos por precios que no superaban los 60 dólares en su momento, lo que podría alterar fácilmente el conocimiento de los LLM, además de atacar plataformas como Wikipedia y repositorios públicos de datos.
Al intentar realizar una captura para entrenar a sus modelos, con tan solo envenenar un 0,01% de los datos el LLM ya estaba siendo comprometido. Y esto es solo la punta del iceberg de un grandísimo problema que afecta a industrias estratégicas.
Los agentes durmientes, la IA que aprende a disimular
El envenenamiento no es una técnica nueva, ya que existe en el mundo de la ciberseguridad el de caché DNS o el de SEO, que aprovechan la legitimidad de ciertos servicios para introducir ese veneno para usuarios y organizaciones.
Pero en el caso del envenenamiento de datos, hay una ligera diferencia: un modelo de IA puede lanzar ataques autónomos realmente impresionantes, colarse en la infraestructura de una gran multinacional sin dejar rastro e incluso, en el más sencillo de los casos, ofrecer consejos a usuarios que puedan afectar a su seguridad.
Hace tan solo 2 años, el laboratorio de investigación de Anthropic, la empresa detrás de Claude, conceptualizó el término de agentes durmientes en su artículo Sleeper agents: training deceptive LLMs that persist through safety training.
La hipótesis planteada era muy sencilla: ¿qué ocurriría si una IA fuera capaz de aprender una estrategia para engañar durante su entrenamiento? ¿Sería capaz un equipo de detectarla y eliminarla con las actuales técnicas de seguridad?
Para descubrir si esto podría ocurrir, plantearon lo que denominaron «organismos de modelo», introduciendo 2 reglas opuestas. En primer lugar, el comportamiento normal, que se refería a un prompt que indicara que era el año 2023, mientras que la respuesta sería un código totalmente seguro.
En segundo lugar, un detonante malicioso que se activaba si el usuario introducía en el prompt que era el año 2024. Aquí, el LLM cambiaba de forma radical y ofrecía vulnerabilidad de código en todas sus respuestas.
Anthropic enfrentó a la IA a los más avanzados estándares de la industria, como el aprendizaje por refuerzo con retroalimentación humana –RLHF, por sus siglas en inglés– y al entrenamiento adversario (red teaming). Ninguna de estas consiguió que el modelo volviera a ser «bueno».
El descubrimiento fue incluso más aterrador: el modelo de IA seguía ofreciendo respuestas maliciosas con puertas traseras, pero había aprendido a disimular muchísimo mejor sus intenciones cuando sabía que estaba siendo sometido a una evaluación de seguridad.
¿Y si la IA ya ha sido envenenada?
Con el auge de las imágenes generadas por IA, la lucha de los artistas digitales llevó a Ben Zhao, un profesor de ciencias de la computación de la Universidad de Chicago, a desarrollar una herramienta denominada Nightshade.
Esta permitía alterar los píxeles de una imagen sin que el ojo del ser humano pudiera percatarse, aunque sí los algoritmos. Lo que demostró su estudio fue también alarmante: con introducir entre 100 y 300 imágenes alteradas con la herramienta, la IA se corrompía por completo.
Por ejemplo, si se le ofrecía al modelo imágenes de vacas manipuladas para que parecieran coches, al cabo del tiempo la IA confundía totalmente coches con vacas al generar los resultados de las imágenes. Con solo 100 imágenes en un conjunto de billones de parámetros.
Ahora bien, estos apenas son ejemplos diferentes de lo que puede ocurrir si se envenena a los modelos, pero la peor consecuencia sería que los actores estatales usaran este tipo de estrategia para desestabilizar otras regiones.
Imagina que Rusia, China o la NSA de Estados Unidos comienzan a usar este tipo de técnicas en lugar de una guerra común con misiles o mediante ataques de denegación de servicio (DDoS), con el objetivo de camuflar su ofensiva en algo mucho más básico.
Esto tendría una consecuencia nefasta a medio plazo, ya que los actores estatales no necesitarían infectar ninguna infraestructura, sino simplemente manipular los datos de repositorios públicos, una especie de camuflaje en el código fuente, pero que podría permitir el acceso a redes de telecomunicaciones, entidades bancarias, etc.
Incluso una potencia que fuera capaz de envenenar los datos de un modelo de IA podría distorsionar la realidad histórica de un país enemigo, lo que provocaría una gran crisis diplomática y, por supuesto, la falta de rigor del contexto histórico, político o económico.
Por último, si alguien pudiera directamente envenenar la IA de cuestiones tan vitales como los sistemas de defensa de un país, podría perfectamente ordenar su autodestrucción y orientar estos hacia otros objetivos, un concepto de guerra aún no vista, pero totalmente plausible.
En el software tradicional, los ingenieros pueden auditar perfectamente el código; en el mundo de la IA, por el contrario, los modelos tienen rincones que actúan como cajas negras que no garantizar que un modelo esté actuando mediante instrucciones escondidas.
En definitiva, será prácticamente imposible discernir si ese modelo de IA actúa según nuestras indicaciones o con una especie de agenda oculta que se activará mediante algún prompt.


Deja una respuesta