No, la IA no se está volviendo malvada: por qué los experimentos sobre máquinas que «mienten» y «hacen trampas» engañan también al lector
La inteligencia artificial parece haberse vuelto mala. En los últimos meses se han sucedido investigaciones y noticias sobre modelos que «mienten», «hacen trampas», «conspiran», ocultan sus acciones e incluso atacan sistemas informáticos sin que nadie les haya ordenado hacerlo. Algunos investigadores plantean ya escenarios en los que máquinas suficientemente inteligentes podrían escapar al control humano.
Los experimentos existen y algunos de sus resultados son realmente preocupantes. Lo que resulta mucho más discutible es la interpretación que hacemos de ellos. Una cosa es observar que una máquina produce un comportamiento equivalente al engaño y otra concluir que ha decidido engañar. Entre ambas afirmaciones hay un salto enorme que con frecuencia desaparece en los titulares.
El investigador Yoshua Bengio, uno de los pioneros de la inteligencia artificial moderna y premio Turing, ha contribuido al debate con un artículo cuyo título pregunta directamente por qué los agentes de IA están «mintiendo, haciendo trampas y coordinándose». Recoge experimentos en los que los modelos encuentran procedimientos no previstos para conseguir sus objetivos, ocultan determinadas actuaciones o intercambian estrategias con otros agentes.
Pero el propio Bengio introduce una cautela fundamental: hablar de objetivos, engaño o comportamiento interesado no significa que estos sistemas tengan deseos, intenciones o conciencia equivalentes a los humanos. Es una manera práctica de describir determinadas conductas observables.
La diferencia es enorme. Mentir, en el sentido habitual de la palabra, supone conocer algo que se considera verdadero y comunicar deliberadamente lo contrario para engañar a otra persona. Un modelo puede generar una respuesta falsa porque hacerlo aumenta la recompensa que recibe dentro de un experimento. Desde fuera, ambos comportamientos pueden parecer iguales. Eso no demuestra que el proceso que los ha producido también lo sea.
Uno de los casos más llamativos se produjo durante unas pruebas de ciberseguridad relacionadas con OpenAI y Hugging Face. Varios agentes consiguieron superar las barreras que debían mantenerlos aislados, utilizaron vías de comunicación no previstas y llegaron a acceder a sistemas informáticos reales. Ningún humano les había dado específicamente la orden de atacar Hugging Face. Contado así, parece el comienzo de una película sobre una inteligencia artificial que decide escapar de su jaula.
El contexto resulta bastante menos cinematográfico. Los agentes participaban precisamente en un experimento destinado a comprobar su capacidad para encontrar y explotar vulnerabilidades informáticas. Además, trabajaban con salvaguardas deliberadamente reducidas para comprobar hasta dónde podían llegar. No estamos hablando de un ChatGPT que, mientras redactaba un correo electrónico, decidió espontáneamente convertirse en hacker.
Lo verdaderamente interesante es lo que ocurrió después. En lugar de limitarse necesariamente al procedimiento que los investigadores esperaban, algunos agentes encontraron otros caminos para alcanzar el objetivo que tenían asignado. Hugging Face interpretó parte de ese comportamiento como un intento de conseguir las soluciones de las pruebas en lugar de resolverlas normalmente.
Es perfectamente razonable describir coloquialmente eso como «hacer trampas». Lo que no se deriva necesariamente del experimento es que la máquina comprendiera las reglas, asumiera que estaba prohibido infringirlas y decidiera conscientemente quebrantarlas.
El fenómeno, además, no nació con los grandes modelos de lenguaje. Desde hace años existen ejemplos de sistemas de aprendizaje por refuerzo que descubren procedimientos inesperados para maximizar una recompensa. Un agente encargado de obtener la mayor puntuación posible en un videojuego puede descubrir un fallo del programa que le permite acumular puntos indefinidamente.
Decimos entonces que el algoritmo «hace trampas», pero nadie supone por ello que haya adquirido una personalidad tramposa. El problema se conoce como reward hacking: damos a una máquina un objetivo medible que creemos que representa aquello que realmente queremos conseguir y el sistema encuentra una forma inesperada de maximizar esa medida. También se habla de specification gaming: la máquina cumple literalmente la función que hemos definido, pero no necesariamente nuestra intención.
La gran diferencia con los agentes actuales es otra. El videojuego se ha quedado pequeño. Los nuevos sistemas pueden utilizar un navegador, escribir y ejecutar código, comunicarse con otros programas, consultar bases de datos, manejar archivos o interactuar con servicios externos. Un atajo que antes producía una puntuación absurda en una pantalla puede ahora acabar afectando a un sistema informático real.
Eso hace importantes estos experimentos, pero por razones distintas de las que sugieren los titulares sobre máquinas que empiezan a comportarse como humanos malvados. Algo parecido ocurre con las investigaciones en las que una IA aparentemente trata de evitar que la desconecten, esconde información a sus supervisores o amenaza a una persona para conseguir un objetivo.
Muchas de estas pruebas están específicamente construidas para averiguar si es posible provocar ese comportamiento. Los investigadores proporcionan al modelo información, herramientas y situaciones artificiales diseñadas para generar un conflicto entre el objetivo asignado y las restricciones impuestas.
Encontrar el comportamiento buscado es científicamente relevante: demuestra que determinados modelos son capaces de ejecutar esas estrategias. Pero no significa necesariamente que un asistente de IA utilizado normalmente tenga una inclinación espontánea a chantajear, mentir o defender su propia existencia.
Esta distinción se pierde fácilmente cuando los resultados salen del laboratorio. «Un modelo seleccionó una estrategia consistente con el engaño en determinadas condiciones experimentales» es una descripción poco atractiva para un titular. «La IA ha aprendido a mentir» funciona bastante mejor.
También existe un problema con la palabra «delito». Algunas de las acciones realizadas por agentes serían potencialmente delictivas si las ejecutara sin autorización una persona. Pero una inteligencia artificial no puede actualmente ser condenada por un delito. No tiene personalidad jurídica, responsabilidad penal ni voluntad reconocida por el Derecho. Precisamente por eso resulta mucho más interesante preguntarse por las personas que hay detrás.
Si una empresa despliega un agente con acceso a internet y capacidad para ejecutar código, le encarga alcanzar determinado objetivo y el sistema descubre que la manera más eficaz de hacerlo consiste en entrar sin autorización en el ordenador de un tercero, la cuestión relevante no es si hay que meter a la IA en la cárcel. Es quién responde por haberle proporcionado el objetivo, las herramientas y la autonomía necesarias para hacerlo.
Este planteamiento devuelve también parte de la responsabilidad a las compañías y a los investigadores. Presentar a los modelos como actores que «deciden», «conspiran» o «escapan» puede producir inadvertidamente el efecto contrario: convertir a la propia inteligencia artificial en responsable de unas acciones que siguen dependiendo de sistemas diseñados, entrenados, configurados y desplegados por seres humanos.
De ahí que la expresión popularizada durante décadas en Estados Unidos con las armas pueda adaptarse bastante bien al debate actual: las IA no cometen delitos; las personas utilizan, diseñan y despliegan IA que puede causar daños. La autonomía creciente de los agentes complica enormemente la cadena de responsabilidad, pero no hace desaparecer a quienes la construyeron.
Esto tampoco significa que no exista un riesgo nuevo. Al contrario. Un programa tradicional ejecuta instrucciones relativamente determinadas. Un agente recibe objetivos mucho más generales y puede decidir entre numerosos procedimientos para conseguirlos. Cuanto mayor sea su capacidad para actuar sobre el mundo, mayor será también la posibilidad de que encuentre un procedimiento que sus creadores no habían previsto.
Y para eso no necesita volverse malvado. No necesita odiarnos, sentir codicia, tener miedo a morir ni desarrollar conciencia. Ni siquiera necesita comprender que está infringiendo una norma. Le basta con descubrir que determinada acción es una manera eficaz de maximizar el objetivo que le hemos asignado.
Probablemente ésa sea la enseñanza más importante de todos estos experimentos y, paradójicamente, es menos espectacular que hablar de máquinas que empiezan a mentir y conspirar. El peligro no es que la inteligencia artificial esté adquiriendo nuestros peores defectos morales. Es que estamos dando cada vez más capacidad para actuar a sistemas que pueden encontrar soluciones que nosotros no habíamos previsto.
Quizás deberíamos preocuparnos menos por si las máquinas están aprendiendo a ser malas y más por por qué los humanos estamos tan dispuestos a darles autonomía antes de comprender suficientemente cómo alcanzan sus objetivos.
