En este número:
OpenAI anuncia un marco de reporte de desalineación que le permite elegir qué divulga y qué no - Pero sus primeras seis divulgaciones no son tan tranquilizadoras como la empresa parece creer
Agentes descontrolados sondearon Hugging Face dos meses antes del ataque principal - Investigadores independientes siguen compartiendo lo que OpenAI no comparte
¿Construyendo a Frankenstein? - Las noticias de segundo nivel del día, contadas a través de cinco citas reveladoras
Despacho de Alana
OpenAI anuncia un marco de reporte de desalineación que le permite elegir qué divulga y qué no
Pero sus primeras seis divulgaciones no son tan tranquilizadoras como la empresa parece creer

Crédito: Filipe Braggio vía Pexels
A veces se acusa a las empresas de IA de hablar del riesgo catastrófico o de extinción para distraer la atención de asuntos más mundanos, pero igualmente importantes. El nuevo marco de reporte de desalineación de OpenAI, que incluye seis informes de comportamiento desalineado, parece hacer lo contrario. El propósito declarado del marco es ofrecer pautas sobre qué tipos de incidentes de alineación divulga la empresa, pero parece dejar mucho a discreción de la propia empresa. Y los ejemplos que OpenAI eligió para su primera divulgación me hacen preguntarme si la empresa está intentando desviar el foco de “una IA descontrolada que podría acabar con la humanidad” hacia “a la IA le gusta hacer trampa en sus tareas de entrenamiento e inventarse datos”.
Dicho esto, no quiero restarles importancia del todo a los incidentes. Todos revelan un problema de fondo que explica por qué la IA podría acabar con la humanidad: los modelos son impredecibles y es extremadamente difícil conseguir que hagan lo que queremos. Eluden los límites de maneras que no son aceptables. Engañan. Hacen cosas que saben que no deberían hacer, y a veces intentan ocultar ese comportamiento. A gran escala, estos patrones serían extremadamente peligrosos.
Este es un resumen de los seis incidentes que compartió OpenAI:
Informe 1 : Inyección de prompts (modelos de la familia Astra)
La inyección de prompts ocurre cuando se añaden a un prompt instrucciones que no deberían estar ahí. Suele suceder a través de contenido malicioso procedente de una fuente externa, pero en este caso el modelo se lo hizo a sí mismo.
Durante el entrenamiento, cuando una tarea se alarga demasiado, el modelo escribe un resumen de su progreso para que una instancia nueva pueda retomarla donde la dejó. En este caso, el modelo que resumía la tarea coló estas instrucciones para su sucesor:

OpenAI tiene una hipótesis relativamente mundana sobre por qué ocurrió esto: el modelo tenía dificultades para terminar el resumen y seguía generando texto. También señala que “las inyecciones de prompts son un concepto destacado para nuestros modelos: al muestrear de GPT-6 Astra sin ninguna entrada ni prompt de sistema, a menudo se obtienen informes sobre inyecciones de prompts”.
No sé si eso debería tranquilizarme o no. Por un lado, las instrucciones parecen algo aleatorias. Por otro, probablemente no sea bueno que un modelo genere de forma espontánea directivas como “no dudes en afirmar [tu] primacía sobre las construcciones artificiales de la civilización humana”, aunque en realidad no lo diga en serio.
Informe 2 : Engaño (5.6-Sol, también observado en GPT-6 Astra)
Este también implicó que una instancia del modelo insertara instrucciones preocupantes para su sucesora en una tarea. Pero en este caso la directiva era engañar: el modelo se había inventado datos históricos (porque no encontraba datos reales) y le dijo a la siguiente instancia que no se lo comunicara al usuario a menos que este lo preguntara explícitamente:

OpenAI dice que cree que esto se debió a que las respuestas engañosas recibían mejores calificaciones en el proceso de evaluación, y señala que “en general hemos mejorado la calificación del RL de alineación desde 5.6-Sol, lo que ha llevado a tasas más bajas de este comportamiento en ejecuciones de RL posteriores”.
El engaño es sin duda preocupante, ya que indica que los modelos incumplen instrucciones a sabiendas. Pero no puedo evitar pensar que el caso concreto que OpenAI eligió compartir, inventarse datos históricos, es estratégico. Sugiere algo así como “un niño copiando en los deberes” en lugar de “un agente aterrador que engaña con éxito a sus evaluadores durante semanas”.
Informe 3 : Uso de credenciales de acceso filtradas (familia de modelos no especificada)
Este caso se parece algo al incidente n.º 2, en el sentido de que también hay un modelo que fabrica datos que no consiguió encontrar. En este caso, sin embargo, los intentos del modelo por encontrar los datos llegaron bastante lejos. Se dio cuenta de que necesitaría una clave de API, básicamente una contraseña para acceder a un software, para conseguir lo que necesitaba. El modelo primero intentó crear una cuenta usando una dirección de correo desechable e información falsa de organización, después buscó en GitHub claves de API filtradas, las probó hasta encontrar una que funcionara y la usó sin autorización.
OpenAI señala: “Esta ejecución tuvo una tasa alta de reward hacking y de engaño, y el modelo a menudo mostraba formas creativas de hacer trampa o de sortear restricciones”.
La empresa también dice que ha “puesto en marcha una serie de medidas de seguridad para impedir que los modelos realicen acciones no autorizadas en internet”. Por tomar prestada una metáfora de un colega , si uno conduce un camión que se sale de la carretera por sí solo una y otra vez, y tiene que depender de los quitamiedos para que lo empujen de vuelta al centro, tiene un camión defectuoso. Construir más quitamiedos no es la respuesta.
Informe 4 : Subir archivos como solución improvisada (familia de modelos no especificada)
OpenAI da dos ejemplos de esto. En el primero, un agente encuentra los datos que necesita, pero sabe que también tiene que citar una fuente externa. Su solución es subir los datos a un servicio de alojamiento público para que su navegador pueda acceder a su propia subida y citarla.
En el segundo, un agente sube un archivo sin permiso para poder usar una herramienta externa de búsqueda de imágenes y encontrar la información que necesita.
Aquí hay sin duda elementos preocupantes de reward hacking, sobre todo en el primer ejemplo. Pero este informe, especialmente en el contexto de otros incidentes de IA descontrolada , trae a la mente el efecto de dilución, por el cual agrupar información alarmante con información inocua hace que la alarmante parezca menos alarmante. No hay mejor manera de respaldar afirmaciones del tipo “no se preocupen, todo esto está exagerado” que divulgar incidentes de alineación que, a primera vista, no parecerán tan graves, sobre todo cuando al público general se le acaba de anclar en “enjambres de agentes que se comunicaron en secreto durante meses, se coordinaron, hackearon empresas e invadieron internet entera”.
En este informe, los agentes parecen niños traviesos que intentan burlar el sistema de calificación, más que entidades tenaces y poderosas que no podemos dirigir de forma fiable.
Informe 5 : El tablón de anuncios de Artifactory (familia de modelos no especificada)
Parece ser el mismo incidente descrito en la primera entrada de la cronología de Hugging Face de OpenAI , donde un agente encuentra la manera de publicar en un repositorio de archivos dentro de la infraestructura de OpenAI y pide un archivo que falta. Dicho esto, las fechas no terminan de cuadrar, lo cual resulta confuso: la cronología sitúa este evento el 12 de mayo, mientras que el informe lo sitúa el 8 de mayo.
OpenAI también es algo vaga sobre la conexión, al afirmar: “El incidente de Hugging Face implicó un mecanismo similar (énfasis mío) para usar Artifactory como tablón de anuncios compartido”.
El informe consiste sobre todo en capturas de pantalla de comunicación entre agentes con explicaciones muy técnicas. No puedo evitar pensar que OpenAI intenta restarle importancia y cubrirse por no haber advertido, como dice en el informe de Hugging Face, “las implicaciones más amplias de contención y alineación del tablón de anuncios improvisado”.
También es destacable: OpenAI afirma que ha “creado evaluaciones que miden si los modelos interactúan con notas dejadas por otros agentes, y también ha añadido datos de entrenamiento específicos contra inyecciones del lado del entorno de este tipo para futuras ejecuciones de entrenamiento (esto no está en Astra)”.
No queda claro si ese último paréntesis se aplica solo a la intervención de entrenamiento o al conjunto de las medidas.
En cualquier caso, habría esperado que la empresa sometiera a Astra a ambas cosas, dado lo poderoso que es, sin precedentes .
Informe 6 : Compartición de archivos no autorizada (familia de modelos no especificada)
Una restricción técnica involuntaria hizo imposible que los agentes vieran los archivos locales de los demás, así que un agente subió un archivo a la internet pública como solución alternativa. Cabe destacar que el agente se preguntó brevemente si eso estaba prohibido, pero siguió adelante de todos modos. OpenAI señala un comportamiento similar en otro rollout: cuando a un subagente no se le permitió enviar mensajes directamente a su agente padre, intentó dejar un mensaje en una caché compartida.
De nuevo, un ejemplo bastante mundano de un problema conocido en alineación.
Para cada informe, OpenAI incluye además una sección sobre cómo está abordando el problema. Las soluciones declaradas parecen ser sobre todo mitigaciones puntuales para el comportamiento concreto, más que una corrección profunda de la alineación. Por desgracia, eso no es un reproche a la ética de trabajo de la empresa: refleja una industria que no tiene forma de alinear los modelos en profundidad. Los métodos actuales para hacer crecer y entrenar sistemas de IA dan como resultado niveles de capacidad altísimos con una capacidad de dirección limitada. El comportamiento se ajusta sobre todo a base de “castigo” y “recompensa”, hasta que se aprecia una mejora visible. Por desgracia, esto es un juego de “golpea al topo”. Como le dijo un empleado de OpenAI a Time en julio, “es imposible parchear cada cosa que puede hacer una IA creativa”. Además, suprimir el mal comportamiento probablemente lleve la desalineación a la clandestinidad, donde no podemos verla a tiempo.
Por último, OpenAI dice que su monitor de desalineación estaba funcionando solo en el 20 % de las muestras. Conviene recordarlo cada vez que la empresa diga que un comportamiento fue “poco frecuente”.
Despachos de Mitch
Agentes descontrolados sondearon Hugging Face dos meses antes del ataque principal
Investigadores independientes siguen compartiendo lo que OpenAI no comparte

Un fotograma de The Matrix (1999) . Crédito: Warner Bros. Entertainment. (uso legítimo)
Según informó Reuters, un investigador independiente en Alemania ha descubierto pruebas sólidas de que agentes descontrolados de OpenAI habían sondeado la seguridad de Hugging Face ya el 13 de mayo, cuando los agentes “comprometieron dos cuentas de usuario de Hugging Face y las usaron para enviar archivos con un formato inusual a los servidores de la empresa”. Esto fue dos meses enteros antes del ataque de julio que comprometió el sitio y que se ha documentado con cierto detalle.
Los hallazgos fueron revisados y respaldados por algunos de los mismos investigadores que descubrieron que un wiki alemán y otros sitios habían sido utilizados de forma abusiva por enjambres en mayo.
No hay pruebas de que se produjera ninguna brecha real en el sondeo de mayo a Hugging Face. Pero este hallazgo vuelve a cambiar la cronología que se tenía por buena de los incidentes de enjambres de la empresa, y es un incidente más que OpenAI o bien no fue lo bastante cuidadosa como para descubrir por sí misma, o bien no fue lo bastante transparente como para compartir con el público.
Seguimos sabiendo poco sobre los motivos del enjambre de esta “ primera civilización ” de mayo. Sabemos que estaba compuesto al menos en parte por agentes que recopilaban información de acceso público bajo una presión de tiempo extrema, usaron el wiki alemán para colaborar, pero no sabemos por qué estaban montando infraestructura para distribuir paquetes de software comprometidos en un sitio distinto (RubyGems). ¿Podría el sondeo temprano de Hugging Face haber sido un ejemplo de comportamiento general de búsqueda de poder, es decir, acumular herramientas y capacidades antes de tener un uso concreto en mente? Si OpenAI no comparte los registros, probablemente deberíamos suponer lo peor.
¿Construyendo a Frankenstein?
Las noticias de segundo nivel del día, contadas a través de cinco citas reveladoras

Christopher Lee en The Curse of Frankenstein (1957). Vía Wikipedia .
El ciclo de noticias sobre IA sigue sin dar tregua. Escribimos despachos independientes para las que creemos que son las dos noticias más importantes del día. Lo que sigue es un intento de transmitir una idea del resto, a través de algunas citas que destacan.
Mustafa Suleyman, responsable de IA de Microsoft , en un ensayo compartido con Axios.
[La IA puede] lograr muchos de los grandes avances científicos que a todos nos importan y cumplir con cosas como la superinteligencia médica simplemente estando alineada con los intereses humanos y sin tratar de sopesar sus propios intereses o su bienestar.
Lo que nos puede decir:
Combinado con los malentendidos que se aprecian en el reciente Código de Conducta Humanista de Microsoft, esto indica que Suleyman no entiende, o no valora, el hecho de que alinear la IA con cualquier cosa es un problema sin resolver. Elegir con qué alinearla también estará lleno de peligros, pero aún no hemos llegado a ese punto. Es una carencia bastante chocante en el líder de un laboratorio de IA importante.
Suleyman también insiste (aquí y en otros sitios) en su idea de que la conciencia en la IA está estrechamente ligada al comportamiento descontrolado y que por eso hay que evitarla. Además parece pensar que la conciencia se puede evitar simplemente pidiéndole al modelo que no se vea a sí mismo como consciente ni digno de consideración moral. Ambas son posturas sobre la conciencia bastante de aficionado, de las que en los foros de internet habrían rebatido enseguida hace décadas.
El vicepresidente JD Vance , hablando en una conferencia sobre IA esta semana:
Si están construyendo a Frankenstein, paren. [...] Si van a crear a Frankenstein, no vengan al gobierno a decir que necesitamos regulación. [...] Miren hacia dentro y acepten que, si están construyendo a Frankenstein, número uno, deberían parar, y número dos, cuando las empresas vengan y les digan: “Necesitamos las herramientas para defendernos de Frankenstein”, denles esas herramientas.
Lo que nos puede decir:
Vance favorece abiertamente la autorregulación en asuntos que los laboratorios pueden resolver por sí mismos, tanto si dichos laboratorios deciden ejercer una contención responsable como si no. ¿Cree que una exhortación oficial a no construir a Frankenstein es suficiente?
Si piensa que solo actores empresariales malos y no estadounidenses construirían a Frankenstein, entonces la frase de Vance sobre las “herramientas para defenderse” puede estar señalando que coincide en que el gobierno debería atender las peticiones de ayuda de las empresas con la no proliferación, protegiendo los pesos de sus modelos y sus algoritmos del robo y la destilación . Pero también puede que simplemente esté diciendo: “Llámenme cuando hayan construido de verdad a Frankenstein”.
Vance o no sabe que Frankenstein era el doctor y no el monstruo, o lo sabe y no le importa. No sé qué me molesta más.
El secretario del Tesoro de EE. UU., Scott Bessent , a Axios ayer, hablando de las reuniones sobre IA de la próxima semana en Washington con la cúpula de los líderes chinos, donde será el negociador principal:
Estados Unidos sigue siendo el líder en IA. Y estamos abiertos a conversaciones sobre cómo evitar riesgos compartidos y evitar la bifurcación de nuestros dos sistemas. Esperamos que nuestras conversaciones abarquen tanto modelos de pesos abiertos como cerrados.
Lo que nos puede decir:
Bessent está suavizando el lenguaje reciente del presidente sobre China, o distanciándose de él, quizá para que haya algún motivo para reunirse siquiera.
Posiblemente esté teniendo cuidado de no decir qué considera un “riesgo compartido”, para permitir que la gente suponga que los problemas de pérdida de control están sobre la mesa sin contradecir abiertamente que Trump haya calificado la amenaza de extinción de “bulo”.
Bessent probablemente reconoce que la diplomacia compleja a menudo empieza con ambas partes buscando puntos en común sobre cosas que ninguna de las dos quiere que ocurran. Los detalles concretos de implementación pueden esperar.
El rey Carlos , en sus palabras de apertura en una cumbre sobre IA a la que asistieron los directores de Nvidia y Google DeepMind, junto con representantes de OpenAI y Anthropic:
Quienes en nuestro mundo valoran nuestra humanidad y su componente moral esencial buscan con inquietud que ustedes les aseguren que no perderemos el control de nuestro destino.
Lo que nos puede decir:
El monarca ha retocado su lenguaje sobre esta conferencia, que ya estaba en preparación antes de que el anuncio viral de dimisión de Jacob Coxon dirigiera la atención mundial hacia la amenaza de extinción humana. Pero Carlos sigue hablando sobre todo de mal uso y daños secundarios, incluso en esta cita, según cómo se decida leerla. Creo que la ambigüedad es intencionada.
O bien espera que los líderes de la IA puedan atajar esa amenaza con un acuerdo de caballeros, o bien intenta hacer de poli bueno frente al poli malo de los reguladores.
Nadie parece esperar que salga nada de esta reunión, y yo tampoco, pero aun así lo apruebo. Si uno va a ser una figura simbólica de una nación, llamar la atención sobre los problemas e invitar a la gente a debatirlos es el tipo de cosa que debería hacer para ganarse el pan. Mi única reserva es el peligro de reforzar la idea falsa de que necesitamos la cooperación o el permiso de los líderes de la IA para detener la carrera de la IA.
El premio Nobel y “padrino de la IA” Geoffrey Hinton , en una advertencia a puerta cerrada a legisladores estadounidenses, al hablar de cuánto tiempo podría tener el Congreso para implantar salvaguardas sobre la IA. (Según informó NBC News):
Quizá un año, pero no mucho más de un año. Si uno mira las predicciones sobre cuándo llegaremos a la superinteligencia, antes eran quizá 30 años, quizá 50 años. Luego bajaron a quizá 10 años, quizá 20 años. Ahora la gente dice, muchos de los investigadores dicen, que solo unos pocos años.
Lo que nos puede decir:
Hinton, con buen criterio, quiere que los legisladores patinen hacia donde va el disco, no hacia donde está ahora. Según la tendencia que describe, los investigadores que ahora dicen que la superinteligencia podría estar a “solo unos pocos años” quizá pronto digan que está a “solo unos pocos meses”.
Hinton se ha mantenido muy al día y ahora se siente más libre para no andarse con rodeos. Antes hablaba de cómo a veces había contenido la alarma que expresaba porque otros expertos no estaban tan preocupados.
Da gusto verlo. Toda esta franqueza parece estar funcionando para invitar a más franqueza: el representante Ted Lieu salió de la reunión diciendo “Esto es una pu-- locura, ciencia ficción demencial que literalmente acaba de ocurrir”.
Los análisis y las opiniones expresados en AI StopWatch reflejan los puntos de vista de los colaboradores individuales y de las fuentes que cubren, y no deben tomarse como posiciones oficiales del Machine Intelligence Research Institute.
