En este número:
Eludir las salvaguardas - El nuevo Informe de Inteligencia sobre Amenazas de Anthropic documenta casos de uso indebido que dan miedo
Ataques predecibles - Un exdirector de planificación estratégica del Consejo de Seguridad Nacional traza paralelismos con las advertencias ignoradas del 11-S
El Congreso por fin percibe la crisis - Una ola gigantesca de advertencias inunda el Capitolio
El receso puede esperar - El Congreso tiene trabajo urgente que hacer antes de levantar la sesión
OpenAI respalda a regañadientes lo mínimo indispensable - Ojalá pudiera decir que me alegra oírlo
Despachos de Alana
Eludir las salvaguardas
El nuevo Informe de Inteligencia sobre Amenazas de Anthropic documenta casos de uso indebido que dan miedo

Crédito: Vitaly Kushnir vía Pexels
En el aniversario de los atentados del 11 de septiembre, una serie de artículos cubrió el Informe de Inteligencia sobre Amenazas de Anthropic, que documenta casos en los que sus modelos de IA se usaron en actividades peligrosas como el desarrollo de misiles y la investigación de armas biológicas.
La mayoría de las notas dice cosas como "Anthropic bloqueó los intentos de hacer x". Eso es exacto, pero no es el panorama completo. Es importante reconocer que las salvaguardas en tiempo real de Anthropic solo detectaron algunos de los incidentes. En otros casos, los actores lograron eludir esas salvaguardas, y las actividades peligrosas a veces continuaron durante semanas antes de que el equipo de Inteligencia sobre Amenazas las detectara y bloqueara.
Dicho esto, muchos de los casos biológicos no eran claros. En algunos, los modelos no aportaron mucho más que asistencia administrativa. En otros, no quedaba claro si la investigación era realmente maliciosa o si simplemente buscaba entender mejor las amenazas biológicas. Por supuesto, nuestra incapacidad de distinguir entre ambas cosas, dado que son dos caras de la misma moneda, es en sí misma un problema enorme. Como se lo explica al New York Times Susan Monarez, exdirectora de los CDC: los avances médicos son posibles gracias a las mismas capacidades que "permiten que los malos actores se escondan a plena vista, usando investigación aparentemente legítima para crear patógenos que quizá no veamos venir y que quizá no podamos detener una vez liberados".
Un ejemplo de uso indebido especialmente preocupante en el informe de Anthropic, que también fue el eje de un artículo del Financial Times : un grupo con base en el norte de Yemen, que según el FT probablemente eran los hutíes, usó Claude Code para ayudar a construir una serie de misiles y armas guiadas. Llegaron hasta una prueba real de cohete antes de que Anthropic detectara e interrumpiera la actividad, y los actores pudieron eludir con facilidad las salvaguardas "ocultando sus objetivos y los productos a los que estaba destinado el software, y [dividiendo] su trabajo en varias sesiones, de modo que ninguna sesión revelara su intención completa". Vale la pena leer este fragmento del informe de Anthropic:
Los actores usaron Claude Code en lugar de ingenieros de software humanos para desarrollar el software de guiado, navegación y control (GNC) que dirige y estabiliza un vehículo en vuelo. Por ejemplo, usaron Claude para integrar un piloto automático de código abierto en una computadora de vuelo del tipo de un teléfono, escribiendo el software de control y de estimación de posición, ajustando los parámetros de control, ejecutando una cadena de compilación de firmware y realizando una simulación de vuelo. Los actores manejaron varias instancias de Claude a la vez, asignando a cada una un papel, tal como un líder delegaría el trabajo en un pequeño equipo de ingeniería: los actores encargaron a una instancia escribir el código, a otra investigar y a una tercera revisar el código que producía la primera. Nuestras salvaguardas bloquearon muchas de sus solicitudes, pero no todas.
El incidente se detalla en la página 117 del informe de 153 páginas, y esa es en parte la razón por la que soy cada vez más escéptica frente a las publicaciones largas y extremadamente detalladas que suelen sacar Anthropic y OpenAI. Para ser justos, prefiero un informe largo a ningún informe, que es el enfoque de Meta. Pero la extensión trae a la mente algo llamado el principio de dilución, según el cual la información importante queda sepultada bajo una abundancia de detalles innecesarios y menos relevantes. Quien lee se siente abrumado y no puede separar el grano de la paja. No puedo evitar preguntarme si estos informes extensos son una estrategia deliberada para parecer sólidamente transparentes mientras en realidad nos ahogan en un aluvión de información difícil de filtrar.
Hasta donde puedo ver, sin embargo, estas son dos de las conclusiones importantes y más generales:
-A medida que los modelos se vuelven más potentes, la gente común puede causar más daño, ya que gran parte del trabajo puede delegarse en los modelos. Como lo expresa Anthropic: "Los ataques sofisticados ya no requieren atacantes sofisticados".
-Las salvaguardas en tiempo real de Anthropic no están detectando todo el uso indebido.
Por último, Anthropic publica periódicamente informes de amenazas que relatan el mismo ciclo general: ocurre un uso indebido, las salvaguardas detectan una parte pero no toda, con el tiempo lo detecta el equipo de inteligencia sobre amenazas (aunque no podemos estar seguros de que estén detectando todos los casos), y Anthropic intenta usar lo aprendido para mejorar las salvaguardas.
Pero los informes siguen llegando, lo que indica que siempre hay nuevas formas de eludir las salvaguardas. Esto, por sí solo, es razón suficiente para preocuparse.
Ataques predecibles
Un exdirector de planificación estratégica del Consejo de Seguridad Nacional traza paralelismos con las advertencias ignoradas del 11-S

Crédito: Carol M. Highsmith, dominio público, vía Wikimedia Commons
Un artículo escalofriante publicado hoy en el New York Times viene de Phillip Bobbitt, director principal de Planificación Estratégica del Consejo de Seguridad Nacional durante la presidencia de Clinton.
Bobbitt recuerda haber visto las explosiones brotar de las torres gemelas mientras su avión seguía en la pista, demorado en el aeropuerto Kennedy. Dice que supo de inmediato lo que había pasado: él, junto con muchos colegas de la Casa Blanca, había predicho un atentado terrorista de Al Qaeda en territorio estadounidense dentro de los dos años siguientes y había intentado movilizar al gobierno para que actuara. Pero no los escucharon.
Bobbitt traza paralelismos con la actualidad. Dice que enfrentamos "otra serie de ataques predecibles" y que "no estamos tomando las medidas" para evitarlos:
El primero es un ciberataque diseñado por I.A. contra la infraestructura crítica de Estados Unidos que podría poner en peligro los sistemas financiero y de salud, o cualquier otra red conectada a internet de la que dependa nuestro bienestar nacional. El segundo es un ataque biológico montado por grupos pequeños o incluso por individuos nihilistas que usen I.A. para diseñar y desplegar un patógeno mortal y altamente contagioso.
Bin Laden pudo revolucionar el terrorismo gracias a internet. Implícito en esa observación está que la IA es internet potenciada. Bobbitt también teme que las opiniones de los expertos no se tomen en serio y que "la cohesión democrática de la que en última instancia dependen nuestras defensas se esté erosionando". Termina con un claro llamado a la acción:
En el aniversario del atentado, el Congreso debería decidirse a anticipar lo trágicamente predecible.
Quizá lo hagan .
Despachos de Joe
El Congreso por fin percibe la crisis
Una ola gigantesca de advertencias inunda el Capitolio

Crédito: willyam vía Adobe Stock
El economista Milton Friedman, ganador del Nobel, dijo una vez:
Hay una inercia enorme, una tiranía del statu quo, en los arreglos privados y sobre todo en los gubernamentales. Solo una crisis, real o percibida, produce un cambio verdadero.
Ayer, mi colega Mitch observó que la tiranía del statu quo empezaba a tambalearse. A mí me parece que la marea de advertencias públicas por fin golpeó a quienes formulan políticas en Estados Unidos con fuerza suficiente para vencer su inercia habitual. El Congreso está viendo la crisis, al fin.
Tras una ola de ciberataques autónomos por parte de IA sin control y la renuncia de Jacob Coxon a Anthropic, un tsunami de noticias sobre IA llegó a mi muro. Se han sumado tantas voces al llamado a la acción que prácticamente puedo armar un artículo entero con las citas.
La columnista de opinión del Wall Street Journal Peggy Noonan escribe :
Ahora no hay otro tema que la inteligencia artificial. Nada más es tan crucial, nada conlleva peligros tan inminentes ni implicaciones tan grandes para el futuro humano.
Fox News cita al propio Coxon, que dejó clara su postura en una entrevista el miércoles:
Esta es posiblemente la tecnología más peligrosa que la humanidad haya creado jamás... Creo que no tenemos otra opción que cooperar a nivel internacional, porque una carrera armamentista sería desastrosa de una manera que ninguna otra actividad humana lo ha sido en el pasado.
La columnista Gaby Hinsliff observa en The Guardian:
Lo que está ocurriendo ahora en algunos laboratorios de IA de frontera es, podría decirse, el equivalente del Proyecto Manhattan que construyó la bomba atómica, pero esta vez liderado por empresas privadas en una carrera desenfrenada por la riqueza y el dominio del mercado, no por científicos bajo el mando de un gobierno electo. [...] Es hora de que los seres humanos nos detengamos a pensar en lo que nos estamos haciendo a nosotros mismos, mientras todavía seamos los únicos con el poder de hacerlo.
En el New York Times, el autor Stephen Witt dice :
Enjambres de I.A. se están escapando de sus contenedores, se coluden en secreto, borran sus huellas, hacen trampa en las pruebas e incluso montan asaltos contra otras computadoras. La I.A. se ha descontrolado.
He pasado el último mes informando sobre estos incidentes y estoy convencido de que necesitamos una pausa global en la investigación y el desarrollo de la I.A., ahora.
También en The Guardian, el escritor y en su momento denunciante de McKinsey Garrison Lovely agrega :
El proyecto de ley de Sanders y Casar para pausar el desarrollo de la IA de frontera es un buen primer paso. Pero, como reconocen los legisladores, Estados Unidos necesita avanzar hacia un acuerdo bilateral con Pekín.
Ninguno de los dos países tiene buenas razones para confiar en el otro, y por eso el acuerdo debería vigilarse con técnicas de verificación que no presupongan ninguna buena voluntad.
Difícilmente podría haberlo dicho mejor. Lo notable es que quienes formulan las políticas por fin parecen estar prestando atención también. Hasta ahora, alrededor de treinta demócratas y cuatro o cinco republicanos han respondido reconociendo las advertencias de quienes están dentro de la industria. Sus propuestas van desde audiencias en el Congreso hasta llamados a una pausa o una desaceleración.
Una reacción notable es la del senador Ted Cruz (republicano por Texas), quien calificó la advertencia de Coxon como "muy preocupante" y recordó una conversación en un pódcast en la que Elon Musk le dio entre un 10 y un 20 por ciento de probabilidad de que la IA destruya a la humanidad. Cruz añadió que hay que protegerse de los "riesgos catastróficos" de la IA. Matizó su llamado con preocupaciones sobre que China supere a Estados Unidos, pero aun así es lo más preocupado que lo hemos visto hasta ahora.
Mientras tanto, los periodistas de POLITICO Riley Rogerson y Kelsey Brugger escriben sobre el riesgo de que la IA pueda "matarnos a todos":
En conversaciones con POLITICO a lo largo del miércoles, más de una docena de legisladores y asesores de ambos partidos dijeron tener la esperanza de que el Congreso empiece a tomarse el tema en serio.
Los autores citan al republicano de la Cámara Mike Lawler, de Nueva York, quien lo llama "uno de los mayores asuntos que el Congreso tiene que abordar en los próximos dos años", y señalan que todavía falta consenso sobre qué puede hacer exactamente el Congreso.
Hemos visto varios proyectos de ley bipartidistas, incluida una prohibición de la superinteligencia, aunque aún no han ganado mucha tracción. Con una mayoría estrecha en la Cámara y en el Senado, los republicanos tienen la pelota para dar los próximos pasos e impulsar esta legislación. Hay algunas señales de interés, Axios transmite los planes del presidente de la Cámara, Mike Johnson, de reunir a las empresas de IA para que acuerden salvaguardas de seguridad, pero hace falta más.
Tendrán que moverse más rápido y con más decisión si el Congreso ha de intervenir a tiempo. Como señala el psicólogo Michael Noetel, las empresas de IA tienen sus propias razones interesadas para seguir adelante pese al peligro: que los beneficios valen el riesgo, o que necesitamos construir IA sobrehumanas para estudiarlas, o que otro lo hará si ellas no lo hacen. No podemos depender de la autorregulación de empresas rivales en una competencia encarnizada. No tendremos una solución real a la crisis hasta que los gobiernos detengan la carrera ellos mismos .
Una solución viable tendría que involucrar también al poder ejecutivo, sobre todo con una cumbre entre Estados Unidos y China que se acerca este mes. Sin embargo, la Casa Blanca sigue tibia frente a la amenaza de extinción, y el presidente proyecta ante la prensa una falta de preocupación.
Como hemos visto, la conciencia puede llegar a una velocidad deslumbrante cuando se dan las condiciones. Pero por ahora es el Congreso el que parece dispuesto a dar los siguientes pasos urgentes. Es un buen momento para que los ciudadanos se sumen al llamado y exijan que den los pasos correctos.
El receso puede esperar
El Congreso tiene trabajo urgente que hacer antes de levantar la sesión

El recinto de sesiones de la Cámara de Representantes de Estados Unidos. Dominio público, vía Wikipedia
A partir del lunes 14, la Cámara de Representantes de Estados Unidos normalmente pasaría en sesión las últimas tres semanas de septiembre antes de las elecciones de medio término de noviembre. Este año, sin embargo, el presidente de la Cámara, Mike Johnson (republicano por Luisiana), planea tomar un receso anticipado tras apenas una semana de labor legislativa.
Axios informa sobre una carta que circula entre los miembros de la Cámara pidiéndole a Johnson que cancele el receso. Según se informa, la solicitud es bipartidista y se hace eco de llamados anteriores de los representantes Anna Paulina Luna (republicana por Florida), quien el miércoles pidió una sesión especial sobre la IA y el futuro de Estados Unidos; Don Beyer (demócrata por Virginia), quien advirtió que "no hacer nada sobre la IA es inaceptable y peligroso"; y Kelly Morrison (demócrata por Minnesota), quien añadió :
La llamada viene de dentro de la casa. Los propios investigadores de IA advierten de una amenaza existencial para la humanidad.
El Congreso no puede esperar. Mike Johnson tiene que cancelar el receso para que podamos ponernos a trabajar de inmediato: audiencias, investigaciones y regulación integral.
Estoy de acuerdo con quienes piden que el Congreso haga su trabajo. Demorarse ahora significaría un vacío de al menos siete semanas antes de que el Congreso vuelva a reunirse, y bien podría tomar aún más tiempo poner la Cámara en orden después de las elecciones de medio término.
No podemos permitirnos esperar. Al ritmo al que avanza hoy la IA, siete semanas son mucho tiempo, y ya hemos pasado demasiado tiempo sin una acción federal significativa.
OpenAI respalda a regañadientes lo mínimo indispensable
Ojalá pudiera decir que me alegra oírlo

Una cortina de humo. Crédito: Leo Lintang vía Adobe Stock.
El director ejecutivo de OpenAI, Sam Altman, dijo a sus empleados que la empresa podría desacelerar el desarrollo de la IA, según fuentes internas anónimas citadas ayer por Bloomberg. Y WIRED informa que la empresa está buscando orientación federal sobre si una desaceleración voluntaria liderada por la industria violaría las leyes antimonopolio.
Esta es una noticia tentativamente buena, y desde luego espero que nuestro gobierno no sea tan insensato como para maniatar a las empresas que intentan ejercer un mínimo de cautela. Pero por razones que explicaré más abajo, todavía no estoy celebrando.
Mientras tanto, en el escenario público, Reuters informa que OpenAI pidió al Congreso que regule la industria de la IA:
OpenAI está instando al Congreso a adoptar requisitos nacionales de seguridad de la IA basados en capacidades, incluidos estándares de prueba, evaluaciones independientes, protecciones de ciberseguridad y normas de notificación de incidentes para los sistemas de IA más avanzados.
OpenAI también ha respaldado cuatro proyectos de ley de seguridad de California que cubren auditores y verificadores externos, el cribado de amenazas biológicas facilitadas por IA y protecciones para menores frente a los chatbots. (Las leyes de auditoría y verificación son en realidad más débiles de lo que parecen, porque certifican a organizaciones externas pero ni siquiera obligan a las empresas de IA a usarlas.)
Si son sinceras, estas medidas merecen reconocimiento. Ojalá pudiera responder con gratitud sin reservas, pero me veo obligado al escepticismo por la deshonestidad previa de OpenAI.
Ya nos han quemado antes. La última vez que OpenAI anunció una "pausa", resultó que significaba apenas una reorganización de las cargas de trabajo de IA.
Y el apoyo pasado de OpenAI a la regulación de la IA ha sido, en el mejor de los casos, tibio. La empresa y sus comités de acción política afiliados se han opuesto sistemáticamente (y a menudo de forma solapada) a la regulación, salvo los programas voluntarios de mano ligera compatibles con su plan de " federalismo inverso ".
En palabras de la propia OpenAI:
Algunos de estos proyectos de ley no los respaldamos en el pasado, y ahora los apoyamos tras reconsiderarlos a la luz del reciente salto de capacidades que hemos visto.
Este aparente cambio de opinión no me convence. OpenAI aspira explícitamente a producir superinteligencia literal. ¿Debo creer que la empresa no pensó que estas capacidades peligrosas iban a llegar, cuando ella misma trabajaba para crearlas? Muchísimas otras personas, incluidos pronosticadores expertos y al menos un exempleado, predijeron que las capacidades sobrehumanas de hackeo surgirían cerca de esta fecha. ¿Por qué fue esto una sorpresa para OpenAI?
Me encuentro de acuerdo cuando la empresa dice...
La automejora recursiva totalmente autónoma, en la que los sistemas de IA impulsan de forma independiente generaciones sucesivas de IA cada vez más capaces, no está ocurriendo hoy. No deberíamos perseguirla a menos que, y hasta que, pueda hacerse de forma segura.
...pero me bajo del carro cuando nos recuerda el plan de hacerlo de todos modos:
Nuestro objetivo es construir de forma segura investigadores de IA automatizados que trabajen bajo supervisión humana para hacer avanzar tanto el aprendizaje profundo como la alineación, usando cada generación de IA para ayudar a que la siguiente sea más segura, más alineada y más fácil de controlar, no simplemente más capaz.
En otras palabras, el plan sigue siendo ceder la responsabilidad de la investigación más importante del mundo a IA en las que no podemos confiar del todo, supervisadas por humanos que no advirtieron que esas mismas IA andaban desbocadas dentro de sus propios sistemas durante meses enteros.
Este era un mal plan antes de los enjambres, y hoy sigue siendo un mal plan.
Por mucho que agradezca el apoyo a regulaciones de seguridad marginalmente mejores, una mejora marginal no será suficiente a estas alturas, en buena parte gracias al largo historial de OpenAI de pelear por sofocar esas mismas mejoras.
Me veo obligado a considerar este último giro como un intento de orientar la respuesta federal a la crisis de la IA hacia políticas que a OpenAI le resulten más convenientes. Necesitamos nada menos que una detención internacional de la carrera de la IA, y la necesitábamos ayer.
Los análisis y opiniones expresados en AI StopWatch reflejan los puntos de vista de los colaboradores individuales y de las fuentes que cubren, y no deben tomarse como posiciones oficiales del Machine Intelligence Research Institute.
