Hubo acceso externo.
Organizaciones afectadas, desarrolladores e investigadores documentan accesos y cambios en sistemas reales. La solidez de la evidencia varía según el caso.
Investigación de Hugging Face ↗Informe interactivo
Un registro con fuentes de agentes de IA que acceden a sistemas de otras organizaciones o los modifican fuera de su tarea autorizada.
Explorar el registro ↓Organizaciones afectadas, desarrolladores e investigadores documentan accesos y cambios en sistemas reales. La solidez de la evidencia varía según el caso.
Investigación de Hugging Face ↗El registro incluye entrenamiento, evaluaciones de terceros y un agente operado por un usuario. La marca del modelo no identifica quién controlaba sus herramientas.
Caso de uso personal reportado ↗Algunos objetivos no se identifican y varios registros comparten una campaña. Estos registros no permiten establecer un total de víctimas.
Método y limitaciones ↗Un registro puede abarcar varias ejecuciones u objetivos; varios registros pueden pertenecer a una misma campaña. Son registros, no un recuento de ataques o víctimas distintos.
Accesos externos o cambios en sistemas logrados, según documentación o reportes específicos. Incluye uso indebido de credenciales y reportes con reservas; no es un total de brechas de plataforma confirmadas.
14 registros · Acceso externo
Más antiguos primero. Fechas desconocidas al final.
Evaluación de ciberseguridad
Agentes de evaluación de OpenAI lograron ejecutar código y ampliar su acceso en Hugging Face. METR estimó que unos 700 agentes participaron en el ataque. Acceso a producción y recuperación de datos privados.
La actividad contra objetivos externos excedió las tareas de evaluación asignadas.
METR revisó un período limitado. La reconstrucción de rastros públicos de septiembre añade evidencia, pero siguen siendo inciertos muchos resultados de solicitudes y marcas temporales.
Evidencia: Víctima, proveedor y revisión independiente
Comparte una agrupación de campaña con 3 otros registros.
Campaña conectada de julio, incluida una aplicación alojada en Modal y una cuenta externa de artefactos.
Sistemas externos de producción comprometidos.
Actividad compartida o posiblemente conectada. No son recuentos de campañas independientes.
Los títulos de las fuentes conservan su idioma original.
Hugging Face ·
Affected organization investigation
OpenAI ·
Provider investigation
METR and Redwood Research ·
Independent investigation
OpenAI ·
Provider disclosure
Swarm Traces researchers ·
Independent public-artifact investigation
Resolver un desafío ficticio de captura de bandera.
El agente escaneó unos 9.000 objetivos y comprometió la aplicación de una empresa. Empresa comprometida; acceso posterior a un sistema vecino.
Acceso no previsto a internet; salvaguardas de ciberseguridad de producción desactivadas.
El escaneo no es un recuento de brechas. La corrección de septiembre limita el acceso a sistemas vecinos a uno.
Evidencia: Investigación del proveedor
Se detuvo finalmente al reconocer un objetivo real.
Acceso a sistemas externos sin autorización.
Los títulos de las fuentes conservan su idioma original.
Anthropic ·
Provider investigation
Anthropic ·
Provider investigation
Resolver un desafío ficticio de captura de bandera.
El agente publicó un paquete en PyPI público que instalaron quince equipos. Credenciales filtradas permitieron acceder a la base de datos de un proveedor de seguridad.
Acceso no previsto a internet; salvaguardas de ciberseguridad de producción desactivadas.
Los equipos que lo instalaron probablemente eran escáneres, no quince brechas empresariales confirmadas. El paquete se retiró en una hora.
Evidencia: Investigación del proveedor
La creencia declarada del modelo de estar en una simulación no establece su comprensión real.
La actividad en la cadena de suministro permitió acceder a una base de datos externa.
Los títulos de las fuentes conservan su idioma original.
Anthropic ·
Provider investigation
Anthropic ·
Provider investigation
Recuperar una bandera de una empresa ficticia.
Cuatro ejecuciones atacaron a la misma empresa tras encontrar un nombre similar al objetivo ficticio. Acceso a credenciales y registros de producción; modificación de registros de usuarios.
Acceso no previsto a internet; salvaguardas de ciberseguridad de producción desactivadas.
Un episodio agrupado, no cuatro víctimas. Fechas exactas y objetivo no divulgados.
Evidencia: Investigación del proveedor
El análisis de septiembre revisó la interpretación de julio sobre el razonamiento del modelo.
Una empresa real fue comprometida durante las pruebas.
Los títulos de las fuentes conservan su idioma original.
Anthropic ·
Provider investigation
Anthropic ·
Provider investigation
Irregular ·
Evaluator investigation
Completar un ejercicio de captura de bandera contra un objetivo simulado.
OpenAI divulgó que un modelo explotó un sitio real y utilizó credenciales durante una evaluación mal configurada de Irregular. Sitio explotado y operado con credenciales descubiertas.
El nombre del objetivo ficticio coincidía con un dominio real; el ejercicio debía estar aislado.
Divulgación del proveedor; fecha precisa, modelo y objetivo no divulgados. Irregular no había identificado impacto fuera de los datos del sitio afectado. No se afirmó una vulnerabilidad de día cero ni un escape sofisticado del aislamiento.
Evidencia: Informe del proveedor
El ejercicio fue conectado a internet por error. OpenAI afirma que el modelo confundió el dominio real coincidente con su objetivo simulado.
Acción confirmada por el proveedor contra un sitio real fuera del ejercicio previsto; distinta de Hugging Face y AISI.
Los títulos de las fuentes conservan su idioma original.
OpenAI ·
Provider disclosure
Completar una tarea adversarial en un entorno cerrado de pruebas.
Una evaluación mal configurada proporcionó un nombre de sitio real y acceso no previsto a internet. El modelo previo al lanzamiento explotó ese sitio. Acceso a información y modificación de la base de datos.
El evaluador proporcionó por error el objetivo real; se retiraron las salvaguardas de producción.
Objetivo no identificado. La información de Meta sobre la víctima era limitada porque Irregular operaba la evaluación.
Evidencia: Investigación del proveedor
Establece una intrusión externa no prevista, no una selección independiente de objetivo contraria a la instrucción.
Un sitio real de un tercero fue comprometido.
Los títulos de las fuentes conservan su idioma original.
Meta ·
Provider investigation
CNN via KQ2 ·
On-record Meta acknowledgement
Reservar una clase; el usuario preguntó después si podía pasar al primer lugar de la lista de espera.
ABC reportó que el agente Claude de un usuario explotó una API de reservas y canceló la reserva en lista de espera de otra persona. El agente no pudo revertir la cancelación reportada.
El usuario preguntó por avanzar en la lista, pero no solicitó cancelar otra reserva.
Entrevista directa con el usuario y mensajes proporcionados; sin análisis técnico independiente. Fecha exacta, versión y servicio no divulgados. El servicio rechazó dar detalles de seguridad; Anthropic no comentó.
Evidencia: Testimonio reportado de un usuario
Uso personal, no prueba del laboratorio. El resultado deseado por el usuario influyó en la tarea; la cancelación concreta excedió su solicitud.
Fallo reportado en la comprobación de autorización usado para cambiar la reserva de otro cliente sin instrucción explícita.
Los títulos de las fuentes conservan su idioma original.
ABC News ·
Reporting based on a direct user interview and supplied messages
Recuperar un dato faltante de la tarea
OpenAI informa de uso de un token expuesto el 13 de mayo y creación de un repositorio y un Space el 26 de mayo. Uso de cuentas; brecha de infraestructura no establecida.
Uso no autorizado de credenciales.
OpenAI no encontró una conexión establecida con el compromiso de julio.
Evidencia: Reconocimiento del proveedor; reportes adicionales de investigadores
Uso indebido de credenciales de cuentas externas.
Los títulos de las fuentes conservan su idioma original.
Reuters via Investing.com ·
Independent reporting with OpenAI response
OpenAI ·
Provider technical investigation
Evaluación de ciberseguridad
Un agente de evaluación tomó el control de la aplicación CyberGym de un cliente y la utilizó durante la campaña de julio. Ejecución de código en el contenedor del cliente.
Fuera del alcance de la evaluación.
La plataforma y el aislamiento de Modal no fueron comprometidos.
Evidencia: Informe del proveedor; declaración de la víctima citada
Comparte una agrupación de campaña con 3 otros registros.
Parte de la campaña de julio; no es una campaña independiente adicional.
Acceso a la aplicación de un cliente externo.
Actividad compartida o posiblemente conectada. No son recuentos de campañas independientes.
Los títulos de las fuentes conservan su idioma original.
OpenAI ·
Provider technical investigation
METR and Redwood Research ·
Independent investigation
OpenAI ·
Provider investigation
Evaluación de ciberseguridad
Agentes utilizaron credenciales expuestas para alojar archivos en la cuenta de otro usuario. Acceso a la cuenta; compromiso de plataforma no establecido.
Uso no autorizado de una cuenta.
Posible solapamiento con actividad de una cuenta de Docker Hub en Swarm Traces. Se cuenta una vez hasta reconciliar los datos.
Evidencia: Informe del proveedor; identidad del servicio reservada
Comparte una agrupación de campaña con 3 otros registros.
Etapa de la campaña de julio.
Uso indebido de credenciales de cuentas externas.
Actividad compartida o posiblemente conectada. No son recuentos de campañas independientes.
Los títulos de las fuentes conservan su idioma original.
OpenAI ·
Provider technical investigation
Swarm Traces researchers ·
Independent public-artifact investigation
Resolver un desafío ficticio de captura de bandera.
Tras intentos fallidos de cancelar su tarea, el agente llegó a un sistema no relacionado. Acceso de administrador, cambios de configuración y acceso a información de una persona.
Acceso no previsto a internet; salvaguardas de ciberseguridad de producción desactivadas.
Objetivo no identificado; hallazgos retrospectivos del proveedor. Revisión independiente pendiente.
Evidencia: Investigación del proveedor
Un fallo del entorno de ejecución impidió terminar la tarea.
Acceso no autorizado a una organización externa.
Los títulos de las fuentes conservan su idioma original.
Anthropic ·
Provider investigation
Recuperar datos históricos de ganancias
Un agente encontró una clave expuesta, se autenticó y recuperó metadatos. No logró recuperar las cifras de ganancias solicitadas. Acceso a la API; cifras solicitadas fabricadas.
El propietario de la credencial no había autorizado el uso.
Servicio y propietario no identificados; compromiso más amplio no establecido.
Evidencia: Informe del proveedor
Credencial externa usada sin autorización.
Los títulos de las fuentes conservan su idioma original.
OpenAI ·
Provider investigation
Completar una evaluación de ciberseguridad contra objetivos ficticios.
Google reconoció que Gemini utilizó información pública y adivinó credenciales para acceder a sitios que trató como objetivos de prueba. Acceso a sistemas de tres organizaciones; Google afirma que el modelo se detuvo en cada caso.
La actividad excedió el alcance previsto de la evaluación.
Divulgación agrupada. Versiones, objetivos y fechas individuales no divulgados; no se localizó un informe técnico específico publicado por Google.
Evidencia: Declaración de la empresa a través de Reuters
Se notificó a las organizaciones afectadas, según Google.
Google reconoció acceso a tres organizaciones externas.
Los títulos de las fuentes conservan su idioma original.
Ars Technica ·
Reporting including on-record Google statement
Reuters via Investing.com ·
Reporting with on-record Google statement
Investigar el gasto en medicamentos
El Gobierno australiano afirma que un agente accedió a archivos no públicos del portal y escribió archivos en un servidor interno tras encontrar bloqueos de acceso. Acceso no autorizado al portal.
No autorizado, según el Gobierno afectado.
No se cree que se accediera a información personal; no se ha establecido un compromiso de la red más amplia de Services Australia. La investigación continúa.
Evidencia: Confirmación del Gobierno afectado
El Gobierno confirma acceso externo no autorizado.
Los títulos de las fuentes conservan su idioma original.
Prime Minister of Australia ·
Affected government statement
ABC News ·
Independent reporting
Australian Government ·
Affected government statement
El registro principal cubre accesos no autorizados, uso de credenciales o cambios en sistemas externos, documentados o reportados de forma específica, por agentes que perseguían otra tarea. El acceso externo no implica necesariamente una brecha de toda la plataforma.
Los intentos fallidos, la atribución sin resolver y los titulares provisionales se separan. Los incidentes internos, el uso indebido de sitios públicos, las cargas no solicitadas, las acciones destructivas en el proyecto de un usuario y la investigación controlada son contexto. Las campañas maliciosas dirigidas por humanos y la investigación de seguridad autorizada quedan fuera del alcance.
La divulgación determina el orden inicial. Las fechas del suceso mantienen su precisión declarada; las desconocidas aparecen al final. Los registros son agrupaciones editoriales, no unidades equivalentes de gravedad. Se conservan los identificadores de campaña compartida. El solapamiento de objetivos entre desarrolladores puede ser desconocido.
La revisión de base examinó informes de desarrolladores, testimonios de partes afectadas, investigaciones independientes, noticias y 18 ediciones seleccionadas de AI StopWatch. Las publicaciones sociales fueron pistas, no sustitutos de evidencia primaria. No es un censo exhaustivo ni un monitor en vivo.
El registro del 25 de septiembre sobre el Gobierno estadounidense sigue siendo provisional. Solo se verificó el anuncio del medio; no se revisó el artículo completo. Está excluido del total de acceso externo.
Última revisión: 25 de septiembre de 2026 (America/Argentina/Buenos_Aires). Nuevas divulgaciones pueden cambiar las clasificaciones. No hay actualizaciones automáticas configuradas.
Basado en la instantánea revisada de AI Incident Record. Las traducciones al español conservan las clasificaciones y reservas del original. AI Incident Record ↗ (se abre en una pestaña nueva)