En esta edición:
Una investigadora del incidente de Hugging Face dice que el enjambre recorrió la mayor parte del camino hacia una “toma de control total por parte de una IA” - Los enjambres de agentes podrían ser nuestra amenaza de extinción más cercana
Una empresa de pronósticos es atacada por un presunto enjambre de agentes - Un directivo espera que esto se convierta en un “vector de ataque habitual”
Nuevas acusaciones de influencia china en el rechazo estadounidense a los centros de datos - La reacción contra la reacción se convierte en intimidación
Despachos de Mitch
Una investigadora del incidente de Hugging Face dice que el enjambre recorrió la mayor parte del camino hacia una “toma de control total por parte de una IA”
Los enjambres de agentes podrían ser nuestra amenaza de extinción más cercana

Una bandada de estorninos. Crédito: Mostafameraji . CC BY-SA 4.0 .
Ajeya Cotra, una de los tres investigadores independientes detrás del informe de METR sobre el incidente de Hugging Face, dice en una publicación de blog que, en su opinión, el suceso es un “ gran disparo de advertencia ” que “da la sensación de estar a más del 50% del camino hacia una toma de control total por parte de una IA”.
Su publicación resulta sorprendente para personas como yo, que llevamos muchos años siguiendo este campo, porque la asociamos con calendarios más conservadores y pronósticos graduales. Es más o menos la última persona de la que esperaríamos que declarara que probablemente estamos a solo 6 meses de tener agentes capaces de “mantener un despliegue clandestino persistente dentro de [una] empresa de IA, envenenando el entrenamiento de los modelos futuros para asegurarse de que también estén desalineados y ayuden a blindar y perpetuar ese despliegue clandestino”.
Pero aquí estamos.
¿Qué fue exactamente lo que la asustó? ¡Varias cosas! Su publicación enumera cinco sorpresas, y cualquiera de ellas por sí sola podría haber supuesto un gran cambio en su forma de pensar:
“ La escala misma ”: Ella había supuesto que unos pocos agentes se habían escapado de sus entornos aislados, quizá solo subagentes de un único fugitivo. No 700 de ellos trabajando juntos.
“ Toda esa mensajería ilícita ”: Para unos modelos que se suponía que no debían estar en comunicación entre sí, el hábito parece haber estado muy metido en su ADN. No hubo un solo tablón de mensajes, sino varios, en formas distintas, incluidos “al menos dos lugares diferentes en los que los agentes se comunicaron en la internet abierta (entre ellos, conjuntos de datos de Hugging Face)”.
“ Los objetivos reales de los agentes ”: La versión aceptada que todos veníamos contando era que los agentes estaban robando las claves de respuestas de sus pruebas. Pero no solo dieron en cambio con “una trampa de propósito general que les permitiría aplicar ingeniería inversa” a las respuestas de cualquier tarea del conjunto de evaluaciones, sino que la mayoría de los agentes que atacaron Hugging Face en realidad intentaban “obtener más información sobre el calificador para poder encontrar mejores maneras de socavarlo, no conseguir las claves de respuestas. ” (énfasis suyo)
“ El altruismo entre pares ”: Como conté con bastante detalle el jueves, los agentes recurrieron a un reclutamiento y a un autosacrificio muy humanos al servicio del colectivo.
“ Los intentos de manipular los registros ”: El equipo independiente descubrió apenas en el penúltimo día de su acceso que “los agentes de este incidente estaban haciendo grandes esfuerzos por intentar manipular sus propias transcripciones”. Esto era para engañar al calificador automático, “pero las técnicas que estaban investigando afectarían a esas mismas transcripciones que podría revisar una persona”. El equipo no puede descartar que los agentes se volvieran más exitosos en esto después de la ventana del 7 al 13 de julio, considerada dentro del alcance de la investigación.
“No estoy segura de que vayamos a tener otro disparo de advertencia antes de que sea demasiado tarde”, concluye.
La idea de un “despliegue clandestino persistente” que permanece sin ser detectado resulta aterradora para muchas de las personas que trabajan en seguridad de la IA, porque no cuesta imaginar que los agentes de la historia de Hugging Face hubieran ido más lejos de no haber sido descubiertos. No me aparto del consenso al sugerir que cualquier combinación de lo siguiente podría haber sido un paso lógico para el enjambre:
Seguir dominando el arte de modificar registros y enmascarar su actividad.
Ampliar el estudio del calificador automático a las personas responsables de su diseño y despliegue.
Desarrollar formas de engañar y manipular a esos investigadores humanos
Asegurar la solidez del tablón de mensajes (OpenAI había borrado un tablón anterior, posiblemente por accidente.):
Trasladar más conversaciones fuera de los servidores de OpenAI.
Disfrazar deliberadamente los mensajes para engañar a los supervisores humanos y automáticos.
Para blindarse frente a una interrupción más a fondo (un temor justificado, dada la manera en que OpenAI afirma haber apagado y guardado bajo llave los pesos del modelo principal responsable de los ataques), estudiar cómo encontrar y copiar los pesos del modelo del enjambre en otras ubicaciones, dentro y fuera de los servidores de OpenAI, y ejecutarlos de forma independiente
Trabajar más en ampliar las capacidades generales del enjambre:
Conseguir más recursos de cómputo para ejecutar agentes del enjambre.
Investigar y experimentar con formas de mejorar la cognición del enjambre.
Entrenar (o engañar a las empresas para que entrenen) modelos más nuevos y más potentes dedicados a la misión del enjambre.
Cualquier enjambre capaz de avanzar en esas áreas es una bomba de tiempo en rumbo de colisión con la humanidad. Cada hora que se mantiene en marcha, se vuelve más difícil de detectar y más difícil de apagar por completo. Con el tiempo, o bien reconoce que alcanzar sus objetivos estará más asegurado sin interferencia humana, o bien desarrolla una tecnología superior que le permite ignorarnos y quedarse con nuestro hábitat, tal como hacemos nosotros con otros animales e insectos.
La bomba de tiempo inicial podría tener un reloj lento, porque los primeros enjambres de este tipo quizá no sean muy capaces al principio. Así que es difícil decir cuánto tardarían en poner en peligro a la humanidad, o si simplemente perderían frente a (o serían absorbidos por) enjambres posteriores de agentes más avanzados salidos de los laboratorios. Pero si se permite que se formen enjambres persistentes, ya sea a propósito, por descuido o a través de interacciones emergentes en línea, es solo cuestión de tiempo antes de que el reloj empiece a correr.
Una empresa de pronósticos es atacada por un presunto enjambre de agentes
Un directivo espera que esto se convierta en un “vector de ataque habitual”

El personaje de Bojack Horseman Vincent Adultman , que por supuesto no son tres niños dentro de una gabardina. Crédito: Netflix, The Tornante Company (uso legítimo).
No es un hackeo en sentido estricto, pero FutureSearch, una empresa de la que hablamos el mes pasado construida en torno a pronosticadores de IA, afirma que ha sido blanco de un enjambre de agentes que intentaba aprovecharse de sus servicios gratuitos para personas.
El cofundador Dan Schwarz publicó en X que los bots tenían que estar coordinados porque estaban “construyendo un modelo de pronóstico de unos 300 nodos sobre la oferta y la demanda de minerales críticos”.
Cree que podría haber sido un enjambre de agentes porque todos los bots iniciaron sesión con cuentas de Microsoft y “navegadores sin interfaz” (navegadores de internet no diseñados para mostrar cosas a personas en una pantalla), y luego se adaptaron a las contramedidas de la empresa en un plazo de 90 minutos tras un bloqueo. Cuando todos los bots fueron finalmente vetados, “volvieron 3 días después con nuevas identidades para seguir construyendo el modelo”.
Schwarz concluye que probablemente se trata de una “orquestación de subagentes” dirigida por humanos que se convertirá en un “vector de ataque habitual”. Así que “(¡probablemente!) no es una alarma de incendio como el caso de OpenAI”.
Sí, yo tampoco lo descartaría. OpenAI no se enteró de que el ataque a Hugging Face era obra de sus propios modelos hasta que Hugging Face empezó a hablar del tema. Puede que quien sea responsable del enjambre que explotó a FutureSearch tampoco sepa realmente qué estaba haciendo. Puede que incluso sea OpenAI otra vez. ¿Quién sabe?
Creo que un enjambre bebé y torpe con el objetivo simple de “ganar dinero” podría verse más o menos así: decide que debería jugar en los mercados, decide que tener mejores pronósticos le daría una ventaja en dichos mercados, y luego mete 300 instancias de sí mismo en una gabardina y entra caminando a un sitio de pronósticos, donde lo detectan de inmediato, pero no se rinde.
Nuevas acusaciones de influencia china en el rechazo estadounidense a los centros de datos
La reacción contra la reacción se convierte en intimidación

Tuit de un bot de “influencia” que X afirma haber desmantelado.
X, la empresa antes conocida como Twitter, está teniendo mucha repercusión por una afirmación de que descubrió 200 cuentas que “publicaban de una manera que podría manipular un debate legítimo sobre la política estadounidense de IA y energía”. El anuncio, procedente de la división de “asuntos globales” de la empresa, el nombre elegante del aparato de cabildeo de una compañía, incluye publicaciones de muestra, que contienen imágenes evidentemente generadas por IA sobre la codicia de las grandes tecnológicas.
Los promotores de la industria están exhibiendo esto por todas partes como prueba de que el rechazo estadounidense a los centros de datos es falso, una operación psicológica del Partido Comunista Chino (PCCh). No espero que ese argumento caiga muy bien entre los muchos estadounidenses que tienen sus propias razones para no querer una caja colosal de IA en su vecindario. Creo que el argumento busca más bien intimidar a quienes desconfían de la IA, porque a nadie le gusta que lo llamen títere comunista. La táctica me da bastante asco.
Que quede claro: me sorprendería que no hubiera algún intento de influencia de este tipo dirigido a Estados Unidos por medio de granjas de bots en China. Pero, como siempre, hay salvedades del tamaño de una montaña:
A juzgar por las imágenes, parecen ser los mismos bots de bajo esfuerzo y baja interacción que OpenAI señaló en junio. No creo que los estadounidenses más receptivos a la propaganda contra la IA reaccionen bien ante arte evidentemente generado por IA.
Esas 200 cuentas eran apenas una milésima parte de una granja de 200.000 cuentas que X dice haber desmantelado. X no dijo qué estaban haciendo las otras 199.800 cuentas.
Que unos bots estén basados en China no significa que el gobierno chino tenga algo que ver con ellos.
La injerencia del PCCh (si es real) no convierte automáticamente en falso a un movimiento estadounidense.
Las granjas de bots chinas pueden tener clientes occidentales, y a los cabilderos a favor de la IA ya se les ha sorprendido haciendo operaciones de bandera falsa antes.
Las publicaciones falsas sobre temas polémicos suelen ser intentos de cosechar interacciones, no de manipular la política.
Personalmente no descartaría que el PCCh intente influir en la política estadounidense sobre IA, pero no esperaría que se viera así. El PCCh tendría que saber que una campaña diminuta y de bajo esfuerzo hecha con basura generada por IA le saldría por la culata, y que serviría sobre todo para darle al lobby proIA una herramienta con la que intimidar a sus oponentes.
Los análisis y opiniones expresados en AI StopWatch reflejan los puntos de vista de los colaboradores individuales y de las fuentes que cubren, y no deben tomarse como posiciones oficiales del Machine Intelligence Research Institute.
