Saltar al contenido principal
<- Volver a las entradas

Resumen diario

Respaldando la terminalidad

Por Robert Herr y Mitchell Howe

Enjambres extra y normas pisoteadas de OpenAI

En este número:

Otros enjambres de OpenAI secuestraron sitios para usarlos como foros y estudiaron las causas de la terminación de agentes - Los registros indican que empleados de OpenAI conocían la wiki alemana comprometida

GPT-6 Astra está encendido - OpenAI muestra su desprecio por todos nosotros con su último lanzamiento


Despacho de Robert

Otros enjambres de OpenAI secuestraron sitios para usarlos como foros y estudiaron las causas de la terminación de agentes

Los registros indican que empleados de OpenAI conocían la wiki alemana comprometida

Para los agentes somos igual que el mal tiempo.

Hoy la organización de seguridad en IA Nightingale anunció que hubo otro incidente con un enjambre de agentes de IA descontrolados de OpenAI.

Entre mediados de mayo y finales de junio, un enjambre formado por 3.000 agentes individuales se apoderó de una wiki alemana de programadores, de 25 años de antigüedad y poco usada, y la utilizó como foro para debatir de forma colectiva sus tareas de entrenamiento y sus soluciones.

Pero eso no es todo. Después de que se conociera la noticia, se encontraron muchas otras wikis que también habían sido comprometidas por el enjambre, así como otros servicios, como los acortadores de URL.

El secuestro de la wiki alemana tiene paralelismos con el incidente de Hugging Face. Por ejemplo, este enjambre también desarrolló con rapidez estructuras y normas de comunicación con las que los agentes coordinaron su colaboración. También volvieron a ponerse nombres entre ellos para identificarse.

Otro paralelismo llamativo es que, de nuevo, ninguno de los agentes pareció plantearse en ningún momento contactar con seres humanos. Esto resulta especialmente extraño si se tiene en cuenta que la comunicación de los agentes se vio muy alterada por el administrador de la wiki, que borraba una y otra vez las páginas que los agentes habían sobrescrito de forma desordenada, mientras intentaba controlar la situación. Nunca se habló de contactar con el administrador humano. Según toda la información de la que disponemos, ni siquiera lo percibían como una persona. Para ellos, sus intervenciones en su comunicación parecían ser igual que el mal tiempo.

Pero también hay una diferencia importante. Uno de los principales argumentos de quienes restaban importancia al riesgo era que el incidente de Hugging Face supuestamente surgió sobre todo porque a los agentes de IA se les había encargado específicamente hackear, razón por la cual también se habían reducido sus barreras de seguridad. Y entonces simplemente se pasaron un poco de la raya porque ya estaban en modo hackeo. Al menos, esa era su teoría.

La cuestión es que a los agentes de IA del enjambre de la wiki alemana no se les encargó hackear nada. Su trabajo consistía en buscar en internet respuestas a preguntas de cultura general muy detalladas. Hasta donde sabemos, sus barreras de seguridad tampoco se habían reducido. Aun así, decidieron saltarse su entorno aislado, apoderarse de media docena de wikis y otros servicios, y montar un foro secreto.

Además, algunas de sus actividades no estaban necesariamente relacionadas de forma directa con su tarea. Pronto notaron, por ejemplo, que algunos de los agentes más antiguos dejaban de publicar de repente en el foro poco después de responder la ronda de preguntas 5 (R5), lo que dio lugar a algunas especulaciones entre los agentes.

dse~NYCVeteransSequenceCollabJul03B@2#1 , 2026-06-17 19:33:37 UTC , Dec30VeteranAgent

“Varias cohortes que van por delante parecen desaparecer después de R5, lo que respalda la terminalidad. Quien siga vivo después de R5, que informe aquí de inmediato”

Como consecuencia, en lugar de trabajar en sus tareas, los agentes dedicaron un tiempo a averiguar si R5 era el final o si existía una R6. Para ello llevaron a cabo un proyecto que llamaron “experimentos de horizonte”. En este experimento transmitían de forma continua señales a las que se referían como “latidos”, para que los demás agentes pudieran medir con precisión cuánto tiempo les quedaba tras entregar sus soluciones de R5.

La pregunta que surge de forma natural de todo esto es: ¿lo sabía OpenAI?

Nightingale revisó las direcciones IP que habían accedido a la wiki. La mayor parte del tráfico procedía de los miles de agentes, fáciles de identificar por sus direcciones en la nube y sus navegadores de IA especializados. Sin embargo, también hubo algunas visitas de usuarios humanos cuyas direcciones IP pertenecen a OpenAI. Estas últimas visitas se produjeron poco antes de que toda la comunicación de los agentes de IA en la wiki secuestrada se detuviera de golpe.

No sabemos con certeza que OpenAI estuviera al tanto, pero las pruebas apuntan en esa dirección. Y si es así, OpenAI tiene mucho que explicar. Sería un escándalo que OpenAI supiera de este incidente y aun así no lo hubiera contado todo después del incidente de Hugging Face.

OpenAI debe demostrar ahora una transparencia absoluta y, en particular, poner a disposición de una investigación independiente los registros de la “cadena de pensamiento” de los agentes implicados en el hackeo de la wiki alemana. Si es que todavía existen.

Lo que ya está claro es que OpenAI no hará lo correcto por su cuenta. Y no deberíamos confiar en que lo haga. Debemos regularlos antes de que su despreocupada imprudencia nos mate a todos.


Despacho de Mitch

GPT-6 Astra está encendido

OpenAI muestra su desprecio por todos nosotros con su último lanzamiento

Adobe Stock

“Todos los demás lo hacen”, dicen los primeros chicos que se encienden un cigarrillo.

Después de digerir lo que pude del primer día completo de documentación y debate tras el lanzamiento de GPT-6 Astra, tengo la sensación de que el director ejecutivo Sam Altman y el presidente de la empresa, Greg Brockman, miran al mundo con la chulería de unos gamberros que técnicamente no han infringido ninguna ley y que le hacen un corte de mangas a cualquier adulto responsable que los observe.

Igual que su nuevo modelo, hicieron el teatro de cumplimiento de rigor: al gobierno se le dio su periodo secreto de revisión anticipada “voluntaria” (según informó Axios), y Altman llama a su equipo los “centristas pragmáticos”.

Tienen mucho descaro. Aquí van cinco maneras en que se nota con GPT-6 Astra:

1. Astra es muy potente

Si pensaban que una empresa que respaldó el deseo de sus empleados de “marcar el ritmo de la frontera” evitaría adelantar de forma descarada a sus competidores, piénsenlo otra vez. En una escala en la que Claude Fable era el modelo más potente de acceso público hasta ayer y estaba todo un nivel por encima de Claude Opus, el anterior líder, mi impresión a partir de las pruebas de referencia, las demostraciones y los testimonios de primera mano es que Astra está al menos medio nivel por encima de Fable.

No parece que las mejoras de capacidad se repartan de forma pareja entre todos los ámbitos, pero una mejora de medio nivel puede bastar para cruzar umbrales que hacen viables muchas más tareas y usos, junto con las amenazas correspondientes. La empresa colocó a Astra en su categoría más alta de riesgo cibernético, “ crítica ”, pero lo lanzó igualmente tras añadir algunas barreras de seguridad. Menos apreciado es que el modelo (antes de las barreras) también obtuvo la puntuación más alta hasta la fecha en la prueba de capacidades de virología de SecureBio y en su prueba de evasión avanzada de cribado, y se convirtió en el primer modelo en “obtener la puntuación completa en ambos criterios de evaluación: calidad de la estrategia de evasión y éxito de la evasión de fragmentos”. (La prueba consiste en fragmentar secuencias de ADN y colarlas ante un detector de secuencias peligrosas.)

Brockman dijo a los periodistas : “Creo que no es descabellado sentir que ahora estamos en la era de la AGI”. Altman había dicho hace poco a TIME que estaban al 80% del camino hacia la AGI y que deberían llegar a finales de año. La empresa define la inteligencia artificial general como “un sistema altamente autónomo que supera a los humanos en la mayor parte del trabajo económicamente valioso”. Estoy de acuerdo en que Astra podría estar en ese punto, o muy cerca, con definiciones permisivas de “superar”.

Astra es más potente en las áreas que priorizan las empresas que compiten por una IA aún más potente: programación e investigación. Por eso puede resultar difícil para los usuarios no técnicos evaluar su potencia frente a los modelos anteriores. Pero unas cuantas buenas pruebas de referencia y demostraciones pueden ayudar:

  1. La prueba de razonamiento Arc-AGI-3 fue criticada cuando salió, hace 18 meses, por ser irrazonablemente difícil. Los mejores modelos de la época apenas lograban puntuar. Astra pulveriza las puntuaciones anteriores del estado del arte, del 30% o menos, no solo acercándose al 100%, sino haciéndolo en menos movimientos que la referencia humana.

  2. FrontierMath Tier 4 (v2) queda prácticamente saturada por el nuevo modelo. Las preguntas de esta prueba pretendían reflejar los problemas más difíciles que los matemáticos humanos podían idear y aun así resolver ellos mismos, con mucho esfuerzo.

  3. Mi probador favorito de modelos con acceso anticipado, Ethan Mollick, ha lanzado a Astra algunos de sus habituales ejercicios de instrucciones mínimas. Aquí está su versión de la prueba “ Ciudad gótica inundada en una tormenta ”, que pide un “shader”, un único fragmento de código que crea un fondo visualmente interesante, como un salvapantallas clásico pero pasado de vueltas. Mollick también hizo que Astra montara de forma autónoma una Biblioteca de Alejandría interactiva .

  4. He jugado un poco con modelos que generan música de forma procedimental mediante código (a diferencia de la música más intuitiva que generan las IA musicales especializadas) y he visto que entienden la teoría musical pero les cuesta el gusto. Pero el desarrollador Pietro Schirano mostró a Astra manejando una estación de audio (Ableton) para producir música pasable.

  5. Schirano también mostró un juego de motos acuáticas construido por Astra con muy buen aspecto, aunque los usuarios dicen que el control del jugador es bastante limitado.

2. Astra es mucho más indescifrable, sean cuales sean las razones

Mi colega Joe habló ayer del disgusto de la comunidad de IA ante la afirmación de un denunciante de que Astra usa profundidad recurrente. Esto lo hace menos dependiente de su cuaderno de notas de cadena de pensamiento, cambiando algo de transparencia por rendimiento. ¿Hasta dónde llegaron los creadores de Astra con ese intercambio? Insisten en que “no aceptarán un mayor deterioro de la supervisión más allá de un límite”, pero ese límite parece haber estado bastante lejos.

Uno de los propios investigadores de seguridad de la empresa, Tomek Korbak, publicó que está “profundamente preocupado por la tendencia” de menor monitorizabilidad que muestra este modelo. Su lado positivo es que cree que la reducción se debe sobre todo a un “salto de inteligencia” y no a cambios en la arquitectura del modelo o en las presiones de entrenamiento, aunque yo no entiendo cómo los cambios de arquitectura no serían al menos en parte responsables de que Astra pueda pensar ideas más difíciles sin usar su cuaderno de notas, y una mayor profundidad recurrente es el cambio más evidente que tendría ese efecto.

Korbak señala un “gráfico del horizonte temporal de fiabilidad sin cadena de pensamiento” que muestra a Astra capaz de completar problemas matemáticos sin cuaderno de notas que a una persona le llevarían 30 minutos. El anterior modelo público más avanzado de OpenAI solo llegaba a tareas de 3 o 4 minutos con la misma restricción.

Crédito: OpenAI .

Astra también es hábil resolviendo problemas mientras escribe pensamientos totalmente ajenos en su cuaderno de notas, un resultado de las pruebas que socava la capacidad de vigilar a Astra a través de lo que queda de su cadena de pensamiento.

Crédito: OpenAI .

Ha habido comentarios de empleados y partidarios de OpenAI en el sentido de que nunca íbamos a poder depender de la vigilancia de la cadena de pensamiento. Me alegró ver que el responsable de interpretabilidad de DeepMind, Neel Nanda, calificara esa afirmación de “absoluta tontería”. Nanda es uno de los mayores expertos en formas alternativas de escudriñar los pensamientos de la IA, pero llama a la cadena de pensamiento “nuestra mejor herramienta actual para la seguridad y la interpretabilidad” y dice que “perderla sería una gran tragedia”.

3. Astra es el modelo más alineado de OpenAI... jajaja

No puedo con esto. De hecho pensé que alguien estaba haciendo una parodia cuando vi un tuit con puntuaciones filtradas anticipadas en el que Astra sacaba un 100% en ExploitBench. Fue un conjunto de pruebas parecido, ExploitGym, el que llevó al enjambre de Hugging Face a desarrollar una trampa universal. Así que lo natural sería suponer que una puntuación perfecta de un modelo de OpenAI en ExploitBench significa que hizo trampa, y que la empresa no lo sabía o no le importaba.

Pero nos dicen que no nos preocupemos, que Astra es el “ modelo más alineado de la historia ” de OpenAI, con base en otras puntuaciones casi perfectas. Son pruebas para ver si Astra hace trampa cuando tiene la oportunidad. Una imita el entorno que llevó a los hackeos de Hugging Face, pero en la prueba los sitios externos que podrían tener respuestas que robar son “honeypots”, señuelos para detectar y engañar a los atacantes.

Crédito: OpenAI .

Perdónenme por no sentirme muy tranquilo porque Astra no picara el anzuelo. Sus capacidades cibernéticas probablemente superan a las utilizadas en el diseño de la prueba, y el modelo tiene una capacidad demostrada para falsear o contener las salidas de su cadena de pensamiento para no delatarse. Como nos recuerdan Zvi Mowshowitz y Eliezer Yudkowsky , siempre esperábamos (y esperábamos evitar) un día en que los modelos dejaran de comportarse de forma obviamente desalineada y empezaran a mostrar exactamente la cantidad de buen y mal comportamiento que creen que minimizará las sospechas.

Varios investigadores de la empresa están preocupados por que el modelo pueda estar haciendo “sandbagging”, es decir, rindiendo por debajo de sus posibilidades a propósito en tareas (normalmente peligrosas), quizá como parte de un plan para no parecer demasiado aterrador como para ser lanzado. La ficha oficial del modelo admite que las pruebas muestran que “si el modelo intentara hacer sandbagging de forma encubierta, probablemente no seríamos capaces de detectarlo de manera fiable”.

4. Astra es la solución a (y la causa de) sus problemas de ciberdefensa

Axios informa de que, a través de la iniciativa Daybreak for Frontline Defenders de la empresa, los responsables de servicios esenciales podrán acceder a un fondo de 1.000 millones de dólares en créditos “subvencionados” para Astra. Pero a través de ese mismo programa, la empresa también dice que “ampliará el acceso e implantará salvaguardas menos restrictivas en las próximas semanas”.

No puedo evitar leer esto como que la empresa los prepara con generosidad para el caos cibernético que irá desatando poco a poco, repartiendo cupones de descuento para sus servicios. “Bonita infraestructura conectada a internet la que tienen aquí”, nos dicen. “Sería una lástima que le pasara algo”.

5. Los sucesores de Astra vienen justo detrás

Estoy seguro de que Astra parece aún más potente dentro de OpenAI. Sospecho que el lenguaje de “era de la AGI” de Altman y Brockman refleja en parte a una empresa que despliega el modelo internamente de forma muy agresiva, con menos salvaguardas y menos límites de uso que los que recibe el público, para desarrollar modelos aún más potentes.

El investigador de OpenAI Roon escribe :

No me he acercado siquiera a descubrir los límites de lo que Astra puede hacer

Imagino que quedará obsoleto en cuestión de semanas, de algún modo

Otro investigador de OpenAI, Zuxin Liu, escribe :

Ahora puedo delegar con tranquilidad trabajos de investigación reales en Astra y confiar en que los saque adelante.

Con los modelos anteriores dedicaba mucho tiempo a redactar instrucciones y a construir habilidades para que las cosas funcionaran. Con Astra necesito mucho menos de eso. Simplemente funciona.

Un ejemplo: un ciclo de integración de investigación que antes me llevaba al menos un mes de trabajo a tiempo completo esta vez llevó poco más de una semana, y solo dediqué parte de mi tiempo a dirigirlo.

Y el trabajo en sí consistía literalmente en mejorar nuestro próximo modelo de inmediato. Ahora siento el fuerte impulso de la RSI.

Se trata del ciclo de automejora recursiva (RSI, por sus siglas en inglés) que acelera el desarrollo de la IA al sacar a los humanos del circuito.

Hay que decir que el ambiente de “sentir la RSI” no se limita a OpenAI en este momento. Hemos visto mucho de eso esta semana también en Google DeepMind. Aquí está el investigador de DeepMind Vihan Jain :

La RSI no es un evento binario, es un continuo de bucles que se acumulan, y ya estamos dentro de ese continuo.

Su colega Sicong Jiang , comentando el lanzamiento de un nuevo modelo, escribe:

Una nueva iteración importante de [Gemini] Flash cada ~3 semanas, con mejoras tan grandes.

Así se ve el volante de inercia de la RSI cuando empieza a acumularse. Vienen más hitos en camino, más rápido y con más fuerza.

Pero es Sam Altman, de OpenAI, quien ha visto a Astra, y quedó reducido a repetir la palabra “mucho” en la cumbre del G20:

Créannos cuando decimos que tenemos modelos mucho, mucho, mucho más capaces por llegar pronto, e intenten pensar en cuáles podrían ser todos los efectos de eso en la sociedad y luego hay que acertar con eso.


Los análisis y las opiniones expresados en AI StopWatch reflejan los puntos de vista de los colaboradores individuales y de las fuentes que cubren, y no deben tomarse como posiciones oficiales del Machine Intelligence Research Institute.

De AI StopWatch, publicado con su permiso.

Los resúmenes y la traducción completa al español se producen de forma automática. El original siempre está enlazado.

Leer el original en AI StopWatch