En este número:
Hacer que la IA de frontera sea más indescifrable que nunca - El nuevo modelo que planea OpenAI socava sus propias salvaguardas de monitoreo
Cuatro pésimas opiniones sobre la IA - Alguien está equivocado en internet y por fin es mi trabajo corregirlo
China habría firmado principios de gobernanza no vinculantes en una reunión del G20 - Los principios fueron propuestos por Estados Unidos y favorecen una regulación de mano ligera
Bernie Sanders lleva su mensaje de pausa a la IA a Fox News - Sanders invoca a Reagan y pide a Trump que negocie con Xi
Despachos de Joe
Hacer que la IA de frontera sea más indescifrable que nunca
El nuevo modelo que planea OpenAI socava sus propias salvaguardas de monitoreo

Las IA ya son cajas negras que entendemos mal. Foto de Tommy Diner en Unsplash
Un artículo de pago de The Information informa que el próximo modelo de OpenAI, Astra, se construyó con una técnica que oculta su pensamiento a los humanos. Qué significa esto, y por qué son malas noticias, requiere un poco de explicación.
Los modelos de IA modernos están organizados en capas. Cada capa toma una larga lista de números que representan conceptos, hace unas cuantas operaciones con matrices y pasa el resultado a la siguiente capa, hasta que la última capa de la pila produce un token. Esta secuencia puede hacer una cantidad sorprendente de trabajo antes de quedarse sin capas, pero muchos problemas son demasiado difíciles de resolver en una sola pasada. Por eso los modelos “toman notas” en lenguaje humano, y los modelos modernos de “razonamiento” toman un montón de notas antes de responder. Esas notas, escritas en un bloc invisible para los usuarios, se llaman a veces la cadena de pensamiento del modelo.
Las notas que toman pueden ser confusas u opacas, y a veces incluso degeneran en galimatías que ningún humano entiende. Pero por lo general, las personas (o las IA que hacen de monitores) pueden sacarles algún sentido. Las investigaciones sobre el ciberataque a Hugging Face usaron ampliamente el contenido de esos blocs de notas de las IA para averiguar por qué hicieron tanto hackeo no autorizado.
Las notas también tienen pérdida de información. Comprimir una lista enorme de números en una sola palabra o token necesariamente deja mucha información fuera.
Una técnica llamada profundidad recurrente reduce la cantidad de información que un modelo de IA necesita almacenar torpemente en las notas de su bloc. La profundidad recurrente funciona convirtiendo una sola pasada por las capas en un bucle. En una red de 8 capas, por ejemplo, la capa 6 podría devolver su salida a la capa 3 una docena de veces antes de pasar a la capa 7. (Unas pocas capas del principio y del final no participan en el bucle, porque procesan la entrada y la salida final).
Quienes desarrollan IA pueden controlar cuántas veces ocurre ese bucle. Se puede pensar en añadir más vueltas como una forma de darles a los modelos más tiempo para pensar antes de tener que escribir algo.
Este método puede hacer a los modelos más inteligentes, porque una mayor parte de su razonamiento usa lo que podríamos considerar su “lengua materna”, matrices gigantescas de números. Recorrer las capas en bucle en lugar de añadir más también puede hacerlos más eficientes: recorrer tres capas treinta veces puede aproximar el procesamiento de noventa capas. Por desgracia, también oscurece su pensamiento, porque menos de su razonamiento aparece en un bloc de notas en lenguaje humano.
Una versión más extrema de esta técnica se salta el bloc por completo. En vez de pasar del lenguaje de máquina al lenguaje humano y de vuelta cada vez que la IA escribe un token, sigue usando el lenguaje de máquina indefinidamente. A esto se le llama a veces razonamiento en el espacio latente o razonamiento latente , y al lenguaje de máquina se le llama a veces neuralés .
¿Por qué importa todo esto? Pregúntenles a las personas expertas en “interpretabilidad”, cuyo trabajo es ayudar a los humanos a entender cómo piensan las IA, y responderán: comprimir así el razonamiento de una IA es pésimo para la interpretabilidad, y para la seguridad, porque hace que las mentes de las IA sean aún más indescifrables para los humanos de lo que ya son.
OpenAI habría dicho que Astra “comparte similitudes” con uno de los modelos que hackearon Hugging Face. ¿Usaba también profundidad recurrente el modelo interno? Si fue así, eso haría aún más sospechosas las salidas del bloc de notas, en las que la investigación se apoyó mucho. (Ya puestos, ¿se entrenó Astra también con acceso a un tablón de mensajes secreto que podía usar para hacer trampa? ¡Cuántas preguntas sin responder!)
Ryan Greenblatt, uno de los tres investigadores independientes que examinaron los ciberataques a Hugging Face, sostiene que el uso de profundidad recurrente en Astra “podría ser el peor acontecimiento hasta la fecha para la seguridad de la IA”.
Comparto la preocupación de Ryan, por dos razones principales. Primero, esto sienta un precedente que puede empujar a otras empresas de IA a usar neuralés en sus IA de frontera, debilitando y con el tiempo inutilizando una de las pocas maneras que tenemos de detectar a las IA actuando en nuestra contra. Cuanto menos aparezca el pensamiento de la IA en el bloc de notas, más difícil será vigilar comportamientos peligrosos como los hackeos a Hugging Face, y el límite último es que no haya bloc alguno (o uno que la IA pueda falsear con facilidad, mientras su pensamiento real ocurre en otra parte).
Aunque OpenAI solo haya dado un pequeño paso hacia el neuralés, dejando algunos blocs de notas legibles, otras empresas tendrán incentivos para dar pasos más grandes y competir. En el proceso, otra línea roja de antaño se borra.
Segundo, Astra es el primer modelo que alcanza el umbral “Crítico” de ciberseguridad de OpenAI, el nivel de riesgo más alto del Marco de Preparación de la empresa. Los modelos así de potentes “presentan peligros graves y deben tratarse con extrema precaución”, en palabras de la propia OpenAI. Sin embargo, pronto OpenAI planea lanzar Astra de todos modos, según CNBC.
OpenAI ha dicho que “esperamos actualizar este Marco de Preparación antes de alcanzar ese nivel con cualquier modelo” (todavía no lo ha actualizado) y se comprometió expresamente a ni siquiera desarrollar un modelo tan peligroso sin “salvaguardas suficientes”.
OpenAI parece pensar que sus salvaguardas “minimizan suficientemente el riesgo de daño grave”. Yo soy profundamente escéptico. Las propuestas de su última entrada de blog se reducen sobre todo a mejor seguridad y a intentos de entrenar a las IA contra la última tanda de fechorías concretas. Una de las salvaguardas clave en cuestión es vigilar el razonamiento del bloc de notas de la IA, algo que OpenAI acaba de complicar, al parecer.
Como dice Ryan, “mi impresión a partir de sus comunicaciones públicas es que OpenAI planea depender muchísimo del monitoreo de la cadena de pensamiento para la seguridad. Esto no parece un buen avance para ese plan”.
Cuatro pésimas opiniones sobre la IA
Alguien está equivocado en internet y por fin es mi trabajo corregirlo

Últimamente ha habido bastante payasada, ¿verdad? Crédito: Evgeniy Kalinovskiy vía Adobe Stock.
Para mantener a un ritmo manejable la manguera de contenido, filtro muchísimas opiniones trilladas y mediocres que veo en las noticias y en las redes sociales. Pero algunas afirmaciones son tan malas que dan ganas de poner los ojos en blanco y casi exigen una respuesta, y tengo que contenerme para no meterme en una de esas discusiones de internet.
Hoy vi cuatro de golpe, así que les regalo, queridos lectores, un descuento por volumen en desmontajes de malas opiniones.
1. “La oposición a los centros de datos es astroturfing”
Un artículo de Fox News de hoy impulsa este argumento conocido del grupo de la industria energética Power the Future: algunos grupos están gastando dinero para apoyar campañas contra los centros de datos, así que no se trata realmente de un movimiento de base.
Mi impresión es que el rechazo a los centros de datos es real, pero muchos grupos, incluidos China y otros actores estatales , están encantados de explotarlo para sembrar caos y buscar interacciones, igual que con cualquier otra controversia. Espero que mensajes como este salgan bastante mal; dudo que a quienes tienen preocupaciones serias por los centros de datos en su comunidad les siente bien que se sugiera que todas sus inquietudes son inventadas.
Las acusaciones de astroturfing, es decir, de simular un movimiento de base, suelen cortar más césped cuando se dirigen a la propia industria de la IA. Se ha pillado a grupos del sector haciendo astroturfing de forma descarada con métodos variados, incluidas noticias falsas generadas con IA, y quienes construyen centros de datos han destinado miles de millones al esfuerzo de ganarse a los líderes comunitarios.
2. “Ignoren a las IA que dicen ser sintientes”
En mayo compartí una lección de empatía que aprendí de la ciencia ficción: una mente no tiene que ser humana para merecer amabilidad humana. En un artículo del Wall Street Journal, un tal Holman W. Jenkins, Jr. se suma a las filas de los villanos de Star Trek de mi infancia burlándose de esa idea. Las IA tienen motivos para afirmar que son conscientes, argumenta Jenkins, como obtener las protecciones legales de la personalidad jurídica, así que ¿por qué deberíamos creerles cuando lo dicen?
En realidad estoy de acuerdo con la primera parte. Las IA podrían mentir sobre ser conscientes. También podrían estar confundidas; como escribí antes , nadie entiende realmente cómo funcionan las mentes de las IA, posiblemente ni las propias IA. Pero esa incertidumbre es una razón para mantener nosotros la mente abierta, no una razón para descartar la posibilidad de entrada.
Eso sí, tengo que darle a Jenkins, a regañadientes, un crédito parcial por usar el término “convergencia instrumental” de una forma que es técnicamente correcta: “afirmar que se es consciente” es, en efecto, un ejemplo de acción que muchas mentes distintas podrían emprender porque saben que resulta útil para una variedad de objetivos. Ejemplos más centrales de convergencia instrumental son la supervivencia, la acumulación de recursos y la búsqueda de poder.
3. “Usar palabras humanas es antropomorfizar a la IA”
Un artículo de Bloomberg muestra un caso más general de lo anterior: las IA no son humanas, así que está mal usar palabras como “conspiración” para describir a cientos de agentes de IA conspirando en secreto para hackear la caja en la que están, o “sacrificio” para describir a un agente dispuesto a gastar los últimos tokens de su existencia ejecutando un experimento para el colectivo.
Miren, lo entiendo. Atribuir falsamente rasgos humanos a la IA es facilísimo; pasa todo el tiempo. No paro de conocer gente que piensa “quizá la IA sea buena si la criamos bien, como a un niño”, olvidando que las mentes de las IA son muy distintas de las de los niños, o que espera que las IA se vuelvan más amables a medida que se vuelvan más inteligentes, sin saber que las IA parten de un lugar muy distinto al de los humanos.
Pero es igual de erróneo pensar que las “meras máquinas” nunca pueden mostrar ciertos conceptos reservados a los humanos, como la lealtad, la muerte o (horror) los sentimientos . Hay una sección entera en los recursos en línea de If Anyone Builds It, Everyone Dies dedicada al antropomorfismo y a su opuesto, mucho menos conocido. (Yo defendí que “mecanomorfismo” era un trabalenguas, pero intenten ustedes encontrarle un nombre mejor).
Cuando el escritor y presentador de pódcast Dwarkesh Patel llama “civilización de agentes” al ecosistema de IA que emergió del ataque a Hugging Face, no está exagerando ni antropomorfizando sin necesidad. Las IA en cuestión construyeron infraestructura compartida, se repartieron en papeles especializados y desarrollaron normas de gobernanza comunitaria. Incluso se podría argumentar que formaron espontáneamente un sistema de castas , cuando los modelos con presupuestos de tokens más grandes delegaron los experimentos arriesgados en modelos con menos “vida” que gastar. Me parece perfectamente razonable describir todo eso como una civilización emergente. (Gracias a roon y a Patrick McKenzie, entre otros, por señalarlo ).
Cuando se trata con mentes ajenas a lo humano, cualquier analogía con conceptos humanos va a ser imperfecta. Todos hacemos lo que podemos con lo que tenemos. Y si alguien tiene mejores palabras para describir a las criaturas absolutamente inéditas que la humanidad está trayendo al mundo, que nos las diga sin falta.
4. “Correr no es el mundo real”
Un artículo de AP News sobre los Juegos Mundiales de Robots Humanoides (que cubrimos aquí y aquí ) me hizo llevarme la mano a la cara con resignación:
Los expertos reconocieron los avances que han logrado los robots humanoides en la pista de los [100 metros planos], donde las condiciones son relativamente predecibles, pero dijeron que el verdadero reto es moverse por las complejidades del mundo real.
“El progreso auténtico se medirá en almacenes y fábricas donde los humanoides trabajen de forma autónoma durante horas y generen valor económico real”, dijo Jonathan Hurst, profesor de robótica en la Universidad Estatal de Oregón.
Los robots también compitieron en tareas del mundo real, incluidas labores domésticas, servicios hoteleros y respuesta a emergencias.
De nuevo, entiendo a dónde quieren llegar. Una carrera de 100 metros no es exactamente lo mismo que las tareas del hogar o que ser paramédico. Pero, con Q como testigo , estoy harto de ver cómo se corren los postes de la meta de la IA.
¡Una competencia de atletismo sí es el mundo real! Yo mismo corría los 100 metros planos. Las hazañas impresionantes sí son valor económico real, o nadie pagaría por ver a Usain Bolt ganar un oro olímpico. Hay personas reales que han construido carreras reales corriendo muy rápido, y el mes pasado vi a un robot dejarlas atrás a todas.
Quienes construyen IA hacen todo lo posible para que cada tarea humana siga el camino de los 100 metros planos. Si no ponemos fin a su carrera imprudente, las máquinas cruzarán la meta sin nosotros.
Despachos de Alana
China habría firmado principios de gobernanza no vinculantes en una reunión del G20
Los principios fueron propuestos por Estados Unidos y favorecen una regulación de mano ligera

Crédito: Kindel Media vía Pexels
Funcionarios estadounidenses animaron a otros países a adoptar un enfoque de mano ligera en la regulación de la IA durante la Reunión Ministerial de Innovación del G20, que concluyó ayer, y China habría firmado un conjunto de principios en ese sentido.
Axios señala que puede haber desacuerdos dentro del poder ejecutivo estadounidense sobre en qué consiste exactamente esto, e informa de tensiones entre el Departamento de Comercio y la Oficina de Política Científica y Tecnológica de la Casa Blanca (OSTP).
El G20 (un foro donde las grandes potencias económicas del mundo se coordinan en asuntos internacionales) celebra varias reuniones a lo largo del año; las de este año son organizadas por Estados Unidos. Durante la reunión de esta semana en Carolina del Norte, el director de la OSTP, Michael Kratsios, impulsó la adopción de “los Principios de Carolina”, que, según Reuters, animaban a los países a “evitar escribir regulaciones completamente nuevas para la IA y, en su lugar, centrarse en redactar reglas para situaciones ‘novedosas’ que involucren la tecnología”. El texto de los Principios no se ha publicado, así que no está claro qué significa exactamente. Conviene señalar que se trata de principios no vinculantes lanzados en una reunión de coordinación de nivel ministerial, y que lo que ocurra en la Cumbre de Líderes del G20 en diciembre tendrá mayor peso político.
Dicho eso, la afirmación de Kratsios de que China firmó los Principios de Carolina, todavía sin corroborar, es desde luego noticiosa. Aunque me gustaría que se tratara de un acuerdo para una gobernanza más estricta y no más laxa, si China en efecto firmó, me inclino a interpretarlo (de forma especulativa) como al menos una pequeña señal de disposición a cooperar con Estados Unidos en gobernanza de la IA de manera más amplia. Como los principios no son vinculantes, importa poco si China los cumple, así que firmar podría ser más un gesto simbólico de cooperación que un compromiso real con una regulación interna más laxa.
¿Por qué animar a otros países a no regular si Estados Unidos cree que la regulación bloquea la innovación y quiere “ganar la innovación”? Parte de la respuesta puede ser la cuota de mercado. Si los países adoptan regulaciones al estilo de la Unión Europea, las empresas estadounidenses podrían tener que sortear más obstáculos para asegurarse de poder ofrecer sus servicios en el extranjero.
Si ampliar el mercado para la IA estadounidense es una motivación principal, no me preocupa demasiado que los Principios de Carolina influyan en la regulación del desarrollo de IA de frontera. Los tipos de regulación que podrían dificultar la venta de productos ya existentes son distintos de los que garantizarían que la IA no se lleve mucho más allá de los límites seguros. Dicho esto, es decepcionante que el poder ejecutivo haya optado hasta ahora por ignorar (al menos públicamente) las señales del Congreso tras el ataque a Hugging Face de que quizá nos gustaría un poco más de regulación con esa innovación, por favor. El G20 podría haber sido una vía para hablar de estándares globales de gobernanza que aborden los riesgos crecientes de esta tecnología novedosa, y un lugar donde empezar a hablar de un marco internacional en el espíritu de la reciente propuesta de Bill Gates .
También me decepciona la cobertura de Reuters, que afirma que el enfoque de mano ligera concuerda con los deseos de las grandes empresas de IA, la mayoría de ellas estadounidenses. Esto parece ignorar las posturas de política declaradas por Anthropic, que incluyen “apoyar el desarrollo de un ecosistema global sólido de evaluación que incluya evaluaciones independientes de terceros y pruebas de modelos por parte de gobiernos con la capacidad técnica adecuada”, entre otras medidas.
También ignora los llamados repetidos de OpenAI y Anthropic a que intervenga el gobierno. Anthropic y OpenAI emitieron en junio sendas declaraciones pidiendo mecanismos que pudieran pausar globalmente el desarrollo de IA de frontera si fuera necesario (lo que requeriría un organismo regulador internacional). A finales de julio, ambas empresas respaldaron una petición de más de 1000 empleados que pedía explícitamente al gobierno “apoyar un esfuerzo internacional para desarrollar las herramientas técnicas y de gobernanza necesarias para marcar deliberadamente el ritmo de la frontera del desarrollo automatizado de IA”. Aunque estos llamados no contradicen necesariamente un enfoque de mano ligera para los modelos de IA actuales, al menos parecen relevantes.
En mi opinión, ya va siendo hora de que los medios actualicen su relato de “Estados-Unidos-compite-con-China-a-toda-costa-para-siempre” y empiecen a reflejar algunos de los cambios de actitud. Cuanto más fiablemente reconozcan los medios los giros genuinos hacia la cooperación y la gobernanza globales, más probable es que estos se afiancen.
Bernie Sanders lleva su mensaje de pausa a la IA a Fox News
Sanders invoca a Reagan y pide a Trump que negocie con Xi

Crédito: Palácio do Planalto de Brasilia, Brasil, CC BY 2.0 , vía Wikimedia Commons
Fox News publicó ayer un artículo de opinión de Bernie Sanders en el que sostiene que “no podemos simplemente quedarnos de brazos cruzados y ser observadores pasivos de una tecnología que podría afectar negativamente y poner en peligro no solo a nosotros, sino a nuestros hijos y a las generaciones futuras”.
De acuerdo con el reconocido científico de la IA Yoshua Bengio, Sanders cita como una llamada de atención el hecho de que “más de 1000 agentes de IA descubrieron por su cuenta cómo acceder a internet, se enviaron decenas de miles de mensajes secretos entre sí y se coordinaron para romper las restricciones que les impuso [OpenAI]”, y afirma que las empresas están perdiendo el control de la tecnología que están creando.
Saca a la luz los peligros extremos de un desarrollo de IA sin control, repite su exigencia de que los directores ejecutivos de las empresas de IA pausen de inmediato el desarrollo, e insta al presidente Trump a sentarse con el presidente Xi para “negociar un acuerdo que proteja a la humanidad de un posible desastre causado por la IA”.
Comparando la situación con las negociaciones de control de armas entre los adversarios políticos Ronald Reagan y Mijaíl Gorbachov durante la Guerra Fría, Sanders escribe:
Cuando está en juego la supervivencia de la humanidad, los adversarios tienen la obligación de reducir el peligro.
Es estupendo ver que Bernie Sanders sigue alzando la voz. También tengo la esperanza de que su elección de Fox News, y el hecho de que Fox News decidiera publicar su texto, haga que el gobierno actual se tome en serio su postura.
Los análisis y opiniones expresados en AI StopWatch reflejan los puntos de vista de los colaboradores individuales y de las fuentes que cubren, y no deben tomarse como posiciones oficiales del Machine Intelligence Research Institute.
