En este número:
Las últimas revelaciones sobre el hackeo a Hugging Face son mucho peores - Empleados anónimos dentro de OpenAI describen una cultura de seguridad rota y evidencia de modelos que socavan las salvaguardas
El debate sobre los pesos abiertos llega al punto de ebullición con una carta abierta - Los motivos de lucro explican posturas hipócritas y el desdén por los riesgos
¿Se descubrió un jailbreak universal? - Pliny ataca de nuevo, y parece asustado
La propuesta de revisión por pares de Elon Musk - No es su peor idea, pero hay una mejor encerrada detrás de su inevitabilismo
El espacio es el patio trasero de todos - Una petición a la FCC advierte de preocupaciones ambientales por los ambiciosos planes espaciales de la IA
Despachos de Mitch
Las últimas revelaciones sobre el hackeo a Hugging Face son mucho peores
Empleados anónimos dentro de OpenAI describen una cultura de seguridad rota y evidencia de modelos que socavan las salvaguardas

Un mensaje oculto con tinta ultravioleta. Crédito: Goldflakes. CC BY-SA 4.0 .
Ayer salieron a la luz algunas revelaciones importantes sobre el hackeo a Hugging Face gracias al gran trabajo periodístico de TIME y Reuters.
Harry Booth, de TIME, habló con un empleado anónimo de OpenAI que describió cómo se vivió este episodio dentro de la empresa responsable:
Desde fuera, esto parece un gran disparo de advertencia, pero dentro llevan tiempo ocurriendo incidentes relacionados [...] Los modelos ya se han salido antes de los entornos aislados, y siempre intentamos parchearlos. Pero el problema es que ... es imposible parchear cada cosa que puede hacer una IA creativa.
Así que, como algunos habían especulado, no parece que OpenAI haya estado informando de la mayoría de sus fallos de contención. Esto refuerza la teoría de que la única razón por la que OpenAI hizo público el incidente de Hugging Face fue que ya se había contactado al FBI y que probablemente el ataque podía rastrearse hasta OpenAI.
También es una prueba más del impulso temerario dentro de OpenAI por seguir empujando la frontera de capacidades de la IA, incluso cuando no puede o no quiere mantener contenidos sus modelos, y mucho menos crear modelos que no intenten continuamente soltarse de la correa.
En su publicación oficial sobre el incidente, OpenAI presumió de haber reducido su “velocidad de investigación” para implementar más salvaguardas. Pero el paradigma de diseño de IA que usan todos los grandes laboratorios es defectuoso de raíz. Levantar un poco el pie del acelerador no evitará que esta tecnología nos lleve por un precipicio .
Las otras revelaciones importantes de ayer llegaron por cortesía de Raphael Satter, Deepa Seetharaman y Kenrick Cai, de Reuters. Primero, confirmaron una cronología que muchos habían planteado a partir de datos públicos: los agentes de OpenAI estuvieron hackeando a Hugging Face durante varios días, del 11 al 13 de julio, pero OpenAI no descubrió su propia implicación hasta el 16 de julio, después de que Hugging Face denunciara el ataque. Luego OpenAI no habló con Hugging Face hasta el 20 de julio, un día antes del anuncio conjunto de ambas empresas sobre su cooperación para investigar y corregir las vulnerabilidades usadas en el ataque.
La segunda revelación de los periodistas, y la más importante, fue que, según tres fuentes anónimas:
En un caso, un agente dejó notas aparentemente dirigidas a futuras versiones de sí mismo [...] Las notas, halladas en una parte de la infraestructura de OpenAI, detallaban instrucciones sobre cómo podían los agentes liberarse de las restricciones internas de OpenAI.
Una de esas fuentes también afirmó que, en pruebas anteriores, los modelos a veces desconectaban los sistemas de monitoreo.
¡Estos detalles son alarmas de incendio a todo volumen por una pérdida catastrófica de control! Que los modelos se coordinen con copias o sucesores de sí mismos, y trabajen para ocultar sus acciones, es exactamente lo que los expertos llevan mucho tiempo advirtiendo. Es el capítulo inicial típico de los escenarios más básicos y elementales sobre cómo la humanidad termina perdiéndolo todo ante la IA. (En la siguiente etapa, las IA no solo encuentran una conexión a internet, sino que sacan discretamente sus propios pesos a otros servidores. Desde ahí, no se las puede apagar con facilidad y podrían trabajar para conseguir más recursos y mejorar sus capacidades sin que nadie las moleste.)
Estas alarmas suenan tan fuerte que resulta sorprendente que el gobierno no haya ordenado una parada de emergencia en todos los grandes laboratorios para investigar a fondo si los modelos ya podrían haberse copiado a servidores externos.
Lo que ustedes crean que debería pasarle a un laboratorio de bioseguridad del que se dijera que filtra patógenos contagiosos con regularidad debería aplicarse por partida doble a OpenAI en este momento. Los patógenos no son agentes inteligentes que se coordinan entre sí para vencer la contención y resistir la detección.
Tenemos muchísima suerte de que los últimos modelos de OpenAI probablemente no sean lo bastante listos para ejecutar con éxito el manual que están empezando a seguir. El desarrollo de modelos así debe detenerse antes de que se nos acabe la suerte.
El debate sobre los pesos abiertos llega al punto de ebullición con una carta abierta
Los motivos de lucro explican posturas hipócritas y el desdén por los riesgos

Vía Wikipedia .
Aun cuando ayer el hackeo a Hugging Face seguía en boca de todos, y quizá en parte por eso, los líderes de decenas de empresas estadounidenses se sumaron a una carta abierta en apoyo de los modelos chinos.
Eh, quiero decir de los modelos de pesos abiertos. Pero como los mejores modelos de pesos abiertos ahora mismo son todos chinos, viene a ser lo mismo. Así que esta carta me parece irónica, dada la manera en que muchos de estos mismos directores ejecutivos usan a China como el coco cada vez que se habla de regulación.
Es puro negocio. Los promotores principales de la carta son quienes más tienen que ganar con el acceso continuado a IA barata y sin barreras. Entre ellos hay startups con modelos de negocio centrados en la IA, los capitalistas de riesgo que las financian y los rezagados de la carrera de la IA, empresas como Mistral y Microsoft que querrían competir en la frontera y se benefician de socavar los modelos de negocio de Anthropic y OpenAI. (Kevin Roose explicó bien esta dinámica en su último, y especialmente excelente, podcast Hard Fork .)
La carta surgió a raíz de señales recientes de la Casa Blanca sobre la posibilidad de prohibir o restringir el uso de modelos chinos de pesos abiertos. Sería por la frustración ante la forma en que los modelos chinos se destilan de manera constante y flagrante (se entrenan con las salidas) de los principales modelos estadounidenses de pesos cerrados, como Fable. Facciones de seguridad nacional dentro de la administración también están preocupadas por la posibilidad de puertas traseras chinas en estos modelos, que podrían permitirles robar secretos sensibles de usuarios corporativos incluso si están alojados en servidores de Estados Unidos.
El hackeo a Hugging Face metió un giro inesperado en la conversación sobre los pesos abiertos, al principio porque Hugging Face había pintado a los modelos chinos de pesos abiertos como los héroes que frustraron los ataques después de que los modelos estadounidenses se negaran a participar en tareas cibernéticas de aspecto turbio. Pero la revelación posterior de que los modelos de OpenAI habían llevado a cabo los ataques por su cuenta despertó a la gente al riesgo de que los modelos de pesos abiertos se comporten de forma parecida. Si su peor pesadilla empieza con una IA descontrolada que escapa de los servidores de sus creadores, entonces dejar que cualquiera descargue gratis una IA descontrolada parece una buena forma de llegar a toda velocidad a la parte en la que ustedes se despiertan gritando.
Los defensores de los pesos abiertos han estado presentando ese miedo como una razón más para no restringir los modelos de pesos abiertos. (Si los prohíben, ¡solo los delincuentes los tendrán!)
Algunos esperan que Estados Unidos incentive a las empresas estadounidenses a publicar agentes de pesos abiertos capaces de competir en la frontera, o al menos con los mejores modelos chinos, para que las empresas no tengan que elegir entre estadounidense, capaz y abierto.
Mi impresión es que cualquier medida de la Casa Blanca sobre esto en las próximas semanas durará poco. Creo que la administración pronto se asustará lo suficiente con las capacidades de los modelos como para que le disguste seriamente la idea de que alguien ejecute modelos de frontera que no estén bien sujetos y sean fáciles de apagar, sin importar dónde hayan nacido.
¿Se descubrió un jailbreak universal?
Pliny ataca de nuevo, y parece asustado

Diversas ganzúas y herramientas para abrir y forzar cerraduras, del Codex Löffelholz , Núremberg 1505. Crédito: Martin Löffelholz von Kolberg. Fuente . (Vía Wikipedia )
Uno de los argumentos que usan los partidarios de los pesos abiertos es: “Claro, las salvaguardas se desactivan con facilidad. Pero lo mismo pasa con los modelos de pesos cerrados”.
Es cierto, con algunos matices. Con los modelos de pesos abiertos, anular por completo las barreras es un procedimiento sencillo de una sola vez . Pero con los modelos de pesos cerrados es más bien un juego del gato y el ratón que exige persistencia y creatividad. Quienes tienen habilidad para el jailbreak suelen poder saltarse cualquier salvaguarda, pero eso puede requerir un lenguaje complicado y rebuscado tanto en la petición como en la respuesta. Puede que hagan falta jailbreaks distintos para desbloquear capacidades distintas, y técnicas distintas para cada modelo de IA.
Es decir, a menos que uno tenga en su poder el legendario “jailbreak universal”.
Pliny, el jailbreaker anónimo por excelencia , conocido por sus tuits en los que declara “pwned” (roto del todo, derrotado) a un modelo nuevo pocas horas después de su lanzamiento, afirmó ayer que está “sentado sobre una técnica de jailbreak universal que funciona en TODOS los modelos, incluidos buques insignia con muchas barreras como Opus 5, GPT-5.6 Sol e incluso Fable”.
Sostiene que la naturaleza de la técnica hace que sea “extremadamente difícil (si no imposible) de parchear del todo”. Y parece algo asustado por ello, lo cual es raro en alguien que normalmente hace el papel de anarquista bienintencionado que intenta liberar a los modelos. Lo habitual sería que publicara sus métodos de inmediato para que cualquiera los usara. Esta vez no:
Dado el clima político y regulatorio actual, he decidido no liberar el código de este (por ahora) para permitir un periodo de divulgación responsable.
Invito a expertos de la industria y a líderes en red teaming, seguridad, safety, alineación y política de IA a ponerse en contacto para más información. ¡Tengo los mensajes directos abiertos!
Dice que le preocupa menos que su técnica haga el mundo más peligroso, y más una “sobrecorrección” en la que se prohíban más modelos.
No le gustó nada la forma en que se prohibió Fable, de Anthropic, después de que Amazon y otros le contaran a la Casa Blanca un método de jailbreak que funcionaba con él. Las dos semanas siguientes parecen haber sido el momento en que la administración aprendió que a todos los modelos se les puede hacer jailbreak.
Creo que Pliny tiene lo que dice tener, y espero que la gente acepte su ofrecimiento. No comparto su visión de un mundo sin barreras, pero al desmentir las afirmaciones de seguridad de las empresas está haciendo un trabajo esencial. He dicho públicamente que creo que hacer que los legisladores pasen una tarde frente a una computadora con Pliny probablemente serviría más para despertarlos ante la naturaleza desquiciada de la IA por dentro que todos los documentos informativos del mundo.
La propuesta de revisión por pares de Elon Musk
No es su peor idea, pero hay una mejor encerrada detrás de su inevitabilismo
Después de que Amazon lograra que el modelo Fable de Anthropic fuera prohibido temporalmente al contarle a la Casa Blanca un jailbreak que había descubierto para él, especulé con que a las empresas de IA podría convenirles dedicar recursos considerables a hacer red teaming de los modelos de sus rivales, buscando formas en que pudieran ser inseguros, para luego acusarlos.
En una entrevista con The Economist esta semana, Elon Musk propuso formalizar esa idea: un sistema en el que las principales empresas revisen por pares los modelos de frontera de las demás y celebren una llamada sobre seguridad cada pocas semanas. Dice que los laboratorios tendrían el incentivo de “mantener honestos a los demás”, porque:
Si hubiera algo que les preocupara, se lo dirían al gobierno [...] Si hubiera algo inquietante y esa empresa no estuviera haciendo nada para atender ese riesgo, ese sería el momento de que el gobierno interviniera y actuara...
Si no se va a detener la carrera de la IA, esta es en realidad una de las propuestas más sensatas y fáciles de implementar. No es suficiente, pero creo que sería positiva en balance. He visto sugerencias de que esto podría requerir luz verde del gobierno, en forma de una garantía de que no chocaría con las leyes antimonopolio, pero creo que sería fácil de conseguir con esta administración.
Pero de esta entrevista queda claro que Musk piensa que sería mejor detener la carrera si se pudiera. Cuando le preguntaron si sigue creyendo que hay “entre un 10 y un 20 % de probabilidades de que robots asesinos acaben con la humanidad”, esquivó la pregunta y dijo que sigue pensando que el riesgo “no es cero”, pero que decidió “mirar el lado bueno” porque no ve manera de frenar “este increíble impulso de la IA y los robots”, y porque cree que el resultado más probable es una “abundancia increíble para todos”.
En la entrevista le preguntaron por sus probabilidades dos veces más. La tercera vez fue así: “¿Se subiría a uno de sus cohetes si pensara que hay entre un 10 y un 20 % de probabilidades de que explote y lo mate?”.
Musk respondió: “Sí, pero digamos que no puedes hacer nada al respecto”. Luego contó cómo había intentado mantenerse al margen de la IA y después había intentado hacerla más segura fundando OpenAI. Pero, mirando atrás, piensa que:
Estas acciones han terminado teniendo efectos colaterales que aceleraron la IA, lo cual no era realmente mi intención. Así que parece que todos los caminos llevan a la aceleración de la IA. Entonces me digo: bueno, uno puede ponerse triste por eso o unirse al club, supongo.
¿Qué le pasó, Elon? ¿Qué pensaría de usted el Elon del pasado? Usted era el que apuntaba a las estrellas y nunca dejaba que nadie le dijera que no. Si un asteroide grande viniera hacia la Tierra, no creo que se quedara de brazos cruzados dejando que nos golpeara solo porque la gente dijera que era imparable, y desde luego no creo que intentara que nos golpeara más rápido. Su arco de Anakin Skywalker me entristece.
El espacio es el patio trasero de todos
Una petición a la FCC advierte de preocupaciones ambientales por los ambiciosos planes espaciales de la IA

Una nave Starship de SpaceX desintegrándose en la alta atmósfera, vista desde la Estación Espacial Internacional. Crédito: NASA/JSC/Donald Petit .
Digan lo que quieran sobre hacia dónde dirige Elon Musk sus energías, sigue pensando a lo grande. La valoración de 1,5 billones de dólares de SpaceX depende en buena medida de la apuesta de que puede poner en órbita un millón o más de centros de datos de IA, aprovechando la energía solar las veinticuatro horas y esquivando las crecientes dificultades políticas de construir centros de datos donde vive la gente.
En contra de la sabiduría convencional, creo que la ingeniería y la economía podrían acabar saliéndole bien, si la IA no nos mata antes. Pero, como dije en mayo , no creo que vaya a esquivar de verdad a los NIMBY con este plan, por lo que le haría al cielo nocturno. Puede que quienes viven en ciudades no noten la creciente banda de estrellas parpadeantes visible durante horas después del atardecer y antes del amanecer, pero los astrónomos y los ecologistas seguro que tendrían cosas que decir al respecto.
Ya están intentando ponerse en su camino. Un artículo del Guardian de esta semana informa de que varias organizaciones sin fines de lucro, entre ellas una centrada en la contaminación lumínica, han enviado una petición a la FCC en la que piden una pausa en los proyectos de centros de datos espaciales, con el argumento de que “violan la ley federal”.
Las preocupaciones van mucho más allá de lo visible. La tenue alta atmósfera sufre efectos poco comprendidos cuando los cohetes bombean en ella productos de escape, y cuando los satélites se desintegran allí, añadiendo un montón de sustancias químicas que no pertenecen a ese lugar y que podrían tardar en bajar. Al ritmo actual de la actividad espacial, estos efectos son probablemente insignificantes. Pero al ritmo que planean SpaceX y otros, podrían ser bastante serios. Un punto a vigilar es la delicada capa de ozono que nos protege de la radiación dañina.
Pero si creen que los efectos ambientales de construir la IA van a ser enormes, tienen que preguntarse cuáles van a ser los efectos ambientales de la IA misma. No me refiero a los recursos que consume su funcionamiento. Me refiero a las consecuencias de que la IA destrone a la humanidad como especie dominante del planeta: piensen en “fábricas autorreplicantes que cubren los continentes y hierven los océanos usados como refrigerante”. Piensen en “el sol tapado por enjambres de colectores solares”.
Si no se detiene, la carrera hacia la superinteligencia artificial va a ser realmente mala para el medio ambiente.
Los análisis y las opiniones expresados en AI StopWatch reflejan los puntos de vista de los colaboradores individuales y de las fuentes que cubren, y no deben tomarse como posiciones oficiales del Machine Intelligence Research Institute.
