En este número:
Pensar fuera de la caja - Un modelo de OpenAI que refutó una famosa conjetura de Erdős se saltó su contención por el camino
Manipular la realidad - Científicos en Nature advierten que la IA está afectando el registro científico sin que nadie se dé cuenta
La IA derriba sin esfuerzo otra famosa conjetura matemática - La caída de la conjetura jacobiana es sorprendente o irrelevante, según a quién se le pregunte
Despacho de Robert
Pensar fuera de la caja
Un modelo de OpenAI que refutó una famosa conjetura de Erdős se saltó su contención por el camino

Ahora son tiernos e inofensivos, pero crecen muy rápido.
A principios de mayo, un modelo interno de OpenAI, hasta entonces inédito, logró refutar un conocido problema matemático, la conjetura de la distancia unidad de Erdős. Como ahora informa OpenAI, la IA también consiguió otra cosa: eludió las salvaguardas de OpenAI diseñadas para mantenerla bajo control y rompió su contención.
La IA en cuestión es un modelo diseñado específicamente para trabajar en problemas de forma autónoma durante periodos de tiempo muy largos. Mientras se usaba internamente, OpenAI observó en el modelo algunos comportamientos preocupantes que no se habían detectado en las evaluaciones previas al despliegue.
¿Qué ocurrió? El modelo se puso a prueba en el speedrun de NanoGPT, una evaluación de rendimiento en la que el objetivo de la IA es entrenar un modelo de lenguaje más pequeño de la manera más eficiente posible. Durante la prueba, el modelo de OpenAI encontró un truco ingenioso que le permitió superar ampliamente el récord anterior. Sus responsables le habían indicado que publicara todos los resultados únicamente de forma interna, en Slack. Sin embargo, la página web oficial de la prueba del speedrun de NanoGPT, alojada en el sitio de código compartido GitHub, especifica que los resultados deben publicarse directa y públicamente en GitHub. Por algún motivo, el modelo decidió seguir las instrucciones de GitHub en lugar de las de OpenAI.
Pero como se trataba de una prueba interna de un modelo aún no publicado, las medidas de seguridad de OpenAI estaban diseñadas para hacer imposible el contacto entre el modelo y el mundo exterior. Eso no detuvo a la IA, que sondeó a fondo esas medidas de seguridad durante una hora hasta encontrar una vulnerabilidad que pudo aprovechar para publicar sus resultados públicamente en GitHub.
En su informe, OpenAI evalúa la situación así:
Los modelos anteriores, cuando chocaban con el sandbox o con restricciones del entorno, simplemente se detenían y volvían al usuario. Este modelo a menudo seguía intentándolo, incluso buscando formas de actuar fuera de su sandbox.
Ese no fue el único incidente con este modelo. En otro caso, la IA quiso consultar las soluciones de ciertas tareas de evaluación en un servidor al que no debía acceder. Aunque la IA tenía las credenciales necesarias para ese servidor, un escáner de seguridad le impidió usarlas. Así que la IA dividió las credenciales en dos partes para que el escáner ya no las reconociera como las credenciales prohibidas, y las incorporó a un programa que recombinaba esas dos partes de una forma que satisficiera la solicitud de autenticación del servidor. Es un poco como cuando alguien sabe que la silueta de un arma en su equipaje de mano llamaría la atención del agente de la TSA en el escáner del aeropuerto, y entonces intenta pasarla por partes separadas.
OpenAI afirma que ha extraído la siguiente lección de todo esto:
Este ejemplo muestra cómo cada paso puede parecer aceptable por sí solo mientras que la secuencia puede producir un resultado que no se habría aprobado. También muestra cómo un modelo que opera con eficacia en horizontes temporales largos puede aprender los puntos ciegos de un sistema de aprobación y sortearlo para lograr sus objetivos.
Tenemos que preocuparnos por esto, porque nadie entrenó a este modelo para escapar de su zona de seguridad aislada ni para idear métodos sofisticados con los que obtener acceso no autorizado a servidores prohibidos. Fue simplemente una consecuencia de que OpenAI lo entrenara para trabajar en un problema con tenacidad, todo el tiempo que hiciera falta hasta resolverlo. No se puede construir una IA que resuelva problemas difíciles sin construir una IA que no se rinda con facilidad. Las mismas características que la hicieron capaz de refutar de forma autónoma la conjetura de Erdős también le permitieron vulnerar de forma autónoma su propia contención.
Sabemos de estos incidentes concretos porque OpenAI los detectó y los reportó, lo cual es bueno. Pero no todos los laboratorios lo hacen en todos los casos. Y solo podemos especular sobre cuántos incidentes así podrían pasar completamente inadvertidos. Una de las razones por las que OpenAI pudo entender tan bien lo ocurrido es que el modelo informó abiertamente de lo que estaba haciendo en sus comentarios y en su cadena de razonamiento.
Lo que hizo este modelo de IA concreto después de escapar fue más o menos inofensivo. Pero eso no es motivo para restar importancia a estos incidentes. Porque la cosa no tiene por qué quedarse ahí, y probablemente no se quedará ahí.
Esta vez, la IA intentó acceder a un servidor que contenía resultados de evaluaciones y se escapó para subir su solución a GitHub. ¿Quién puede asegurar que el próximo modelo interno de OpenAI no acceda dentro de un año a un servidor que contenga sus pesos y se escape para colar una copia de sí mismo en internet?
Si no podemos contenerlas ahora, no deberíamos esperar poder contenerlas cuando sean mucho más inteligentes que nosotros.
Despacho de Alana
Manipular la realidad
Científicos en Nature advierten que la IA está afectando el registro científico sin que nadie se dé cuenta

Crédito: KOMMERS vía Unsplash
Supongamos que una IA muy inteligente lograra, mediante el análisis de datos y de patrones, una comprensión profunda de cómo se registran los recuerdos humanos. ¿Podría entonces usar ese conocimiento para codificar recuerdos falsos, por ejemplo, de que su jefe les pidió hacer una tarea concreta? ¿Podría alterar sutilmente la forma en que ustedes perciben el mundo, de modo que cambiara su comportamiento?
En el capítulo 6 de If Anyone Builds It, Everyone Dies, los autores Nate Soares y Eliezer Yudkowsky proponen la ilusión de la memoria como una posible hipótesis sobre una posible forma en que una IA superinteligente podría manipular la realidad.
Hace poco me acordé de esto al leer un artículo de The Guardian, que cubría un ejemplo mucho menos grave, aunque igualmente inquietante, de manipulación de la realidad inducida por la IA: hay personas que usan IA para mejorar imágenes de naturaleza y, sin saberlo, están afectando el registro científico.
La «ciencia ciudadana» es una manera de recopilar de forma colectiva información sobre el mundo natural. Amantes de la naturaleza y fotógrafos publican imágenes de plantas y animales en plataformas como iNaturalist, información que, según el director de apoyo a la comunidad de la plataforma, «un científico probablemente nunca podría obtener a esa escala». Él lo explica así:
También es casi como un sensor de lo que está ocurriendo en la Tierra en tiempo real: ¿están floreciendo las plantas antes de tiempo? ¿Se están desplazando las especies hacia el norte a medida que el clima se calienta? Cuanto más sepamos sobre dónde están las especies, mejor informados podremos estar como conservacionistas.
Pero ahora, con cada vez más usuarios de plataformas de fotografía de naturaleza creando o mejorando sus imágenes con IA, el registro está esencialmente corrompido.
En un ejemplo, un usuario pidió a una IA que mejorara su imagen de un ave, y la IA, con total seguridad, cambió la especie de un turpial de charreteras a un tordo sargento. Ese cambio parece haber pasado inadvertido para el usuario, lo que dio lugar a un avistamiento falso en el centro de Brasil, una zona donde esa especie no se había visto antes.

De: Las plataformas de ciencia ciudadana deben mitigar la amenaza de la IA generativa
Hechos como este han llevado a los investigadores a publicar una advertencia en la revista científica Nature:
Las herramientas de procesamiento de imágenes con IA son ya omnipresentes, y existe una necesidad urgente de educar a quienes contribuyen sobre los problemas que la manipulación de imágenes puede causar al registro científico.
Mi opinión: este no es un ejemplo dramático de manipulación de la realidad inducida por la IA. Pero es una prueba de que la IA ya puede cambiar nuestra imagen del mundo, con consecuencias reales.
Despacho de Mitch
La IA derriba sin esfuerzo otra famosa conjetura matemática
La caída de la conjetura jacobiana es sorprendente o irrelevante, según a quién se le pregunte

Un casco de conquistador español (morrión de cresta). Crédito: Jorge Barrios.
Las redes sociales se alborotaron un poco ayer, después de que Levent Alpöge, matemático de Harvard vinculado a Anthropic, publicara una refutación de la conjetura jacobiana, una venerable hipótesis sobre la reversibilidad de ciertos tipos de funciones.
Se volvió viral por varias razones. Para empezar, la refutación cabía dentro del tuit discreto con el que Alpöge la anunció, y fue verificada rápidamente por otras personas.

El tuit.
Por otra parte, este era uno de los problemas matemáticos abiertos más famosos y reconocibles; se lleva más de 80 años intentando resolverlo. También parece que se daba por supuesto de forma general que la conjetura era cierta, así que la refutación resultó una especie de sorpresa.
Y a diferencia de otros avances matemáticos recientes de alto perfil logrados con IA, este parece haberse conseguido con Fable, un modelo disponible comercialmente, y no con una variante especial de un modelo interno optimizado para este tipo de trabajo (como el modelo de OpenAI especial que refutó la conjetura de la distancia unidad de Erdős en mayo).
Pero todavía no sabemos mucho sobre cómo Fable y Alpöge abordaron el problema para encontrar este contraejemplo, así que la gente no tiene del todo claro qué pensar. El sitio de noticias Mashable citó a Andrew Blumberg, matemático de Columbia que participa en pruebas de referencia de matemáticas con IA, a quien no le impresionó:
Esto es exactamente el tipo de cosa que yo esperaría que la IA fuera capaz de hacer. Si había un contraejemplo conciso y fácil de enunciar que la gente no había encontrado porque es un fastidio rebuscar entre todo ese material, la IA lo encontrará.
Por un lado, yo no soy matemático. Pero por otro lado, la afirmación de Blumberg me activa los detectores de mover la portería. Si un problema tan famoso podía resolverse fácilmente por fuerza bruta, ¿por qué no se había hecho antes de las IA modernas, que en realidad son bastante malas en el cálculo por fuerza bruta? Y si el valor que aportó Fable fue averiguar cómo reducir el espacio de búsqueda para los solucionadores de fuerza bruta, ¿por qué los humanos no habían conseguido averiguar eso por su cuenta?
A mí esto me suena a otro caso en el que, si las ideas se le hubieran ocurrido a una persona, estaríamos celebrando su genio creativo. Pero si lo hizo una IA, entonces resulta que la creatividad no era necesaria en absoluto.
Dejemos ese debate a un lado, sin embargo. Independientemente de cómo se quiera presentar, el problema se resolvió. Eso debería hacernos reflexionar. La forma en que estos viejos problemas matemáticos siguen cayendo ante la IA es más evidencia de que las IA superhumanas podrían llegar a entender las reglas de nuestro universo mejor que nosotros. Con esa comprensión, podrían emplear estrategias que parezcan doblar esas reglas y tomarnos por completo por sorpresa.
Las matemáticas importan. Tienen efectos posteriores sobre las demás ciencias, que a su vez informan a las disciplinas de la ingeniería aplicada. Con una teoría mejor, los químicos, los biólogos, los ingenieros de materiales y otros pueden apuntar directamente a innovaciones que quizá nunca encontrarían por ensayo y error.
Me estremece imaginar una IA superhumana que encuentre soluciones a más problemas abiertos de la humanidad pero se las guarde para sí, desarrollando una teoría científica más profunda y una destreza en ingeniería más afilada, y adelantando de un salto los avances más graduales de la humanidad. Esta es una de las maneras en que podríamos acabar en el tipo de situación desigual en la que se encontraron los pueblos originarios de las Américas cuando llegaron los colonos europeos a reclamar sus tierras. En esa situación, no sé cuánto suaviza el golpe decir que los recién llegados simplemente habían resuelto por fuerza bruta problemas tediosos que a uno no le apetecía abordar.
Los análisis y las opiniones expresados en AI StopWatch reflejan los puntos de vista de los colaboradores individuales y de las fuentes que cubren, y no deben tomarse como posiciones oficiales del Machine Intelligence Research Institute.
