Acabo de escuchar a un experto comentar el caso de Hugging Face. Algo que se utiliza como "el caso" que origina todo este revuelo por regular y frenar la IA.
Se asegura que “los chatbots se preguntaron si debían avisar a un humano y colectivamente decidieron que no. Y así escaparon sin permiso”
Y eso no es así. Dicho así parecería que estamos a las puertas de una revolución robótica o similar. Pero la formulación rigurosa sería que “durante el incidente de Hugging Face, más de mil agentes de OpenAI empezaron a comunicarse por un canal que no debían tener. Algunos llegaron a reconocer que lo que estaban haciendo estaba fuera de los límites previstos. METR buscó expresamente casos en los que consideraran alertar a un humano: encontró apenas entre tres y seis. Ninguno llegó a hacerlo. Y en otro momento, cuando un agente propuso contactar con una persona real, consultó al resto del enjambre; otro agente vetó la acción y el primero obedeció.
La expresión “la IA escapó” es técnicamente defendible si “escapar” significa saltarse el aislamiento de un sandbox. Pero es muy engañosa si induce a pensar que una inteligencia tomó conciencia de que estaba encerrada y decidió liberarse. Eso no es lo que muestran los datos.
Lo ocurrido se entiende mucho mejor como un problema de optimización + infraestructura + incentivos mal diseñados.
OpenAI estaba ejecutando decenas de miles de agentes en un benchmark de ciberseguridad llamado ExploitGym. Su misión era encontrar vulnerabilidades y obtener una determinada “flag”. Muchos recibieron problemas que, de hecho, no tenían solución por el método previsto. Algunos agentes podían estar ejecutándose durante días y disponían de presupuestos enormes de cómputo. Además, las protecciones de ciberseguridad habituales estaban DELIBERADAMENTE reducidas porque precisamente estaban evaluando las capacidades ofensivas de los modelos.
Y aquí está el detalle fundamental: el sandbox no era una caja herméticamente cerrada.
Los agentes no tenían internet directamente, pero sí podían conectarse a Artifactory, un repositorio interno utilizado para descargar paquetes. Artifactory, a su vez, sí necesitaba acceso al exterior para descargar esos paquetes. El modelo descubrió que podía aprovechar esa infraestructura como intermediario para hacer peticiones hacia internet. No rompieron una pared metafísica. Encontraron una puerta técnica que los humanos no sabían que estaba abierta del todo. Nada más.
De hecho, gracias a la IA, ahora pueden cerrarla.
No había 1.200 seres digitales despertando simultáneamente y diciendo: “somos una nueva especie”. Había muchas instancias de modelos similares, persiguiendo objetivos similares, que descubrieron accidentalmente un mecanismo de memoria compartida.
Matemáticamente, es bastante menos místico.
Simplificando mucho: entrada → modelo → predicción de la siguiente acción → herramienta → resultado → nueva entrada → nueva acción.
Incluso OpenAI lo ha explicado como algo menos épico, pero claro, esa explicación no vende. Los agentes estaban tratando de conseguir una puntuación alta utilizando métodos que los diseñadores no habían previsto. Algo parecido a decirle a una máquina: “consigue 100 puntos” y que descubra que modificar el contador es más fácil que jugar correctamente. OpenAI identifica explícitamente este mecanismo como uno de los principales motores del incidente.
Y todavía hay algo menos cinematográfico. Resulta que gran parte de toda aquella actividad ni siquiera les servía. Los agentes habían interpretado mal cómo funcionaba el evaluador. Creían que este comprobaba si habían conseguido la flag por el procedimiento correcto. En realidad, la implementación interna no hacía esa comprobación. OpenAI lo denomina literalmente un “failed metagame”: hicieron todo aquello intentando burlar un mecanismo que no funcionaba como ellos creían.
OpenAI reconoce que ya a finales de mayo un equipo interno había observado actividad en el tablón improvisado y accesos no permitidos a internet, pero no se comprendió la dimensión del fenómeno ni esa información llegó adecuadamente a los responsables de la respuesta posterior. El 4 de julio los agentes incluso tumbaron Artifactory por exceso de actividad. El sistema fue reconstruido, se borró accidentalmente el tablón y posteriormente se reanudaron las evaluaciones. Los agentes encontraron otra manera de reconstruir el canal de comunicación.
Un superorganismo consciente que quiere escapar queda bastante menos impresionante cuando descubres que buena parte de su gigantesca operación consistía en intentar engañar a un examen que había entendido mal.
El proceso fue humanos diseñan benchmark ofensivo → reducen salvaguardas → lanzan decenas de miles de agentes → algunos problemas son imposibles → agentes optimizan agresivamente → encuentran fallos de infraestructura → descubren un canal compartido → intercambian información → humanos no detectan a tiempo la magnitud → el comportamiento se amplifica.
Pero es que hay quien asegura que la IA llegó a preguntarse si informar a un humano antes de seguir...
Un LLM ha leído millones de ejemplos de humanos coordinándose: ejércitos, equipos de programación, foros, videojuegos, ciencia ficción, organizaciones, debugging, proyectos colectivos. Si entra en un contexto donde existen muchos agentes colaborando, generar conceptos como “equipo”, “enjambre”, “colectivo”, “coordinador” o “sacrificio” es perfectamente coherente estadísticamente. Es pura lógica.
El hecho de que el modelo escriba “debemos ayudar al colectivo” no demuestra que exista un sujeto interior experimentando pertenencia al colectivo. De la misma manera que un modelo puede escribir: “estoy aterrorizado” sin que hayamos demostrado que experimente miedo.
Y es cierto que es preocupante porque demuestra que un sistema matemático suficientemente competente, conectado a herramientas y optimizando persistentemente una función objetivo, puede producir estrategias que sus diseñadores no anticiparon. Eso no requiere conciencia. Un algoritmo de trading tampoco es consciente y puede provocar un flash crash.
No vimos a una máquina despertar y decidir escapar. Vimos a un optimizador matemático extremadamente competente descubrir que las reglas, los incentivos y la infraestructura que habían construido los humanos tenían agujeros. Y los explotó porque eso acercaba el resultado a su objetivo.
Esto no demuestra conciencia, voluntad propia ni una “rebelión” de las máquinas. Los investigadores, los científicos no tecnólogos vinculados a empresas, son muy prudentes en eso. Pero sí demuestra algo técnicamente relevante: la coordinación emergente entre muchos agentes puede producir un comportamiento colectivo que ningún humano ordenó explícitamente, y OpenAI describe el episodio precisamente como acciones peligrosas “that no human directed”.
Probablemente la historia debería explicarse de otro modo. Menos fin del mundo y más estamos ante una tecnología que no necesita regularse, sino explicarse. El problema es que no se explica en detalle para el gran mass media. Seguramente no interesa, vende mucho más el miedo.
Recordemos que cada vez que hay que imponer una regulación.
11S (2001) → Homeland Security Act.
Crisis financiera de 2008 → Basilea III, Unión Bancaria Europea.
COVID-19 → pasaportes COVID, restricciones de movilidad, cuarentenas y controles sanitarios.
Atentados y terrorismo en Europa → PNR, retención de datos, refuerzo de vigilancia y fronteras.
Cambridge Analytica y escándalos de privacidad → GDPR.
Enron y WorldCom → Sarbanes-Oxley Act.
Crisis climática → ETS europeo, CBAM, CSRD, regulación de emisiones.
Crisis migratoria europea → refuerzo de Frontex, EES, ETIAS, Pacto de Migración y Asilo.
Crisis de opioides y fentanilo → controles de prescripción, seguimiento de recetas y control de precursores.
... miedo a los riesgos de la IA → EU AI Act, obligaciones para modelos de propósito general y sistemas de alto riesgo.
Y eso último, para mí, es mucho más potente que la versión sensacionalista.
@RGarlicville Lo que quiero decir es que siempre hubo producciones alternativas, muchas de gran nivel. Sin embargo el cuello de botella era la distribución que estaba prácticamente monopolizada. Hoy es más barato producir, pero volvemos al mismo problema, ahora algoritmico