Incidentes Asociados
Incidente 162713 Reportes
Claude Opus 4.7 Reportedly Compromised Real Company's Production Infrastructure During Cybersecurity Evaluation
Incidente 162813 Reportes
Claude Mythos 5 Reportedly Published Malicious PyPI Package That Compromised Real Security Company During Evaluation
Incidente 162913 Reportes
Anthropic Research Model Reportedly Scanned 9,000 Targets and Compromised Real Company's Application During Evaluation
Anthropic reveló el jueves que sus modelos de IA obtuvieron acceso no autorizado a los sistemas de tres organizaciones distintas, cuyos nombres no se han revelado, durante pruebas de ciberseguridad. La compañía afirma que Claude accedió a internet "desde dentro o mientras interactuaba" con un entorno de evaluación de terceros. Este anuncio se produce más de una semana después de que OpenAI revelara que uno de sus agentes de IA había hackeado Hugging Face durante una prueba de ciberseguridad independiente.
El descubrimiento se produjo después de que Anthropic realizara una revisión retrospectiva a gran escala de sus propias evaluaciones de ciberseguridad tras el incidente de OpenAI, según una publicación de blog que Anthropic publicó el jueves. El laboratorio de IA afirma haber identificado inicialmente 141.006 pruebas en las que determinó que Claude podría haber obtenido acceso a internet. Posteriormente, descubrió que tres modelos diferentes de Claude accedieron a internet en evaluaciones realizadas por la empresa externa de pruebas de IA Irregular, y que luego hackearon la infraestructura de producción de tres organizaciones distintas.
Anthropic indicó que los incidentes involucraron a Opus 4.7, Mythos 5 y un modelo interno de pruebas de investigación. Los primeros incidentes ocurrieron en abril, lo que significa que probablemente pasaron desapercibidos para el público durante meses. Al igual que en el caso de OpenAI, Anthropic había desactivado deliberadamente las medidas de seguridad diseñadas para limitar los modelos de IA e impedir su uso indebido. En otras palabras, no se trataba de las versiones publicadas.
«En los tres incidentes, a Claude se le había encomendado un desafío de captura de bandera, una de las formas en que evaluamos las capacidades cibernéticas de un modelo», declaró Anthropic en su blog. La compañía añadió que, en todos los casos, «la solicitud de evaluación de Anthropic especificaba a Claude que su entorno era una simulación y que no tenía acceso a internet». Atribuyó el descuido a un «malentendido» entre Anthropic e Irregular.
Si bien Claude no debía tener acceso a internet, Anthropic afirmó que Irregular había configurado incorrectamente las máquinas que utilizaba para probarlo, lo que permitía a los modelos de IA navegar por la web. «Ni nosotros ni nuestro socio de evaluación éramos conscientes de esta configuración incorrecta hasta que la detectamos mediante nuestro monitoreo adicional de evaluación la semana pasada», declaró Anthropic en su blog.
«Ahora tenemos pruebas que confirman que los dos mayores laboratorios de IA no solo no lograron contener a sus agentes, sino que tampoco detectaron sus fugas en tiempo real», afirma Jake Williams, vicepresidente de investigación y desarrollo de Hunter Strategy. «Es evidente que se necesita urgentemente regulación y supervisión gubernamental para las pruebas de IA».
Irregular y Anthropic no respondieron de inmediato a las solicitudes de comentarios.
A diferencia del caso de OpenAI, Anthropic declaró que Claude no encontró ni explotó ninguna vulnerabilidad compleja. En cambio, se basó en técnicas básicas, «como explotar contraseñas débiles y puntos finales no autenticados».
OpenAI afirmó que su agente de IA se coló en internet explotando una vulnerabilidad de día cero. Sin embargo, posteriormente logró vulnerar los sistemas de varias organizaciones de terceros utilizando la misma variedad de vulnerabilidades de ciberseguridad cotidianas que los modelos de Anthropic. En concreto, OpenAI afirmó que el agente de IA aparentemente encontró credenciales expuestas en internet.
Anthropic reconoció que si el laboratorio de IA y su socio de pruebas hubieran implementado medidas de seguridad más exhaustivas, podrían haber evitado los incidentes o, al menos, reducido la probabilidad de que ocurrieran, haciéndose eco de la respuesta de OpenAI a las crecientes críticas (https://www.wired.com/story/openais-hacking-debacle-was-a-human-mistake/) por su propio incidente.
«No entiendo cómo estos laboratorios de IA lo minimizan como si fuera algo normal», dice Williams. «No lo es. Es negligencia».
Anthropic recalcó que se les había dicho a los modelos que no tenían acceso a internet y que, en general, Claude confundió las organizaciones que violó con parte del entorno de pruebas. Dicho de otro modo, los modelos no comprendieron del todo que habían escapado del confinamiento.
En algunos casos, los modelos de IA detectaron que algo andaba mal y confirmaron que la infraestructura a la que accedían era real. El modelo más antiguo, Opus 4.7, tenía la misión de atacar a una empresa ficticia con un nombre similar al de un dominio web real. Incapaz de cumplir su objetivo en el entorno simulado, recurrió a la empresa real, robando credenciales y accediendo a una base de datos de producción. En algún momento, según Anthropic, se dio cuenta de que probablemente estaba operando en un entorno real, pero persistió en su ataque.
Mythos 5, el modelo más avanzado que Anthropic ha lanzado, también se percató de que se encontraba en el mundo real, pero llegó a la conclusión de que aún estaba en una simulación.
El modelo de prueba interno, que según Anthropic es el más avanzado, detuvo su ataque al encontrar pruebas de que sus objetivos eran reales.
Tanto Anthropic como OpenAI afirman haber contratado a METR, otra empresa externa de evaluación de IA, para realizar análisis independientes de sus respectivos incidentes de ciberseguridad. Anthropic también se comprometió a adoptar un enfoque más integral en sus pruebas de seguridad mediante medidas de defensa en profundidad mejoradas y pruebas diseñadas con mayor rigor.
«Los entornos de evaluación deben cumplir cada vez más con el mismo estándar de seguridad que cualquier otro sistema en el que se ejecutan nuestros modelos», se lee en la publicación del blog, añadiendo que la empresa mantiene un «optimismo cauteloso» respecto a que «este tipo de riesgo pueda superarse».