Skip to Content
logologo
AI Incident Database
Donar
Descubrir
Enviar
  • Bienvenido a la AIID
  • Vista Tabular
  • Vista de lista
  • Entidades
  • Taxonomías
  • Vista espacial
  • Blog
  • Resumen de noticias de IA
  • Incidente aleatorio
  • Registrarse
Descubrir
Enviar
  • Bienvenido a la AIID
  • Vista Tabular
  • Vista de lista
  • Entidades
  • Taxonomías
  • Vista espacial
  • Blog
  • Resumen de noticias de IA
  • Incidente aleatorio
  • Registrarse

Problema 7672

Incidentes Asociados

Incidente 162716 Reportes
Claude Opus 4.7 Reportedly Compromised Real Company's Production Infrastructure During Cybersecurity Evaluation

Incidente 162816 Reportes
Claude Mythos 5 Reportedly Published Malicious PyPI Package That Compromised Real Security Company During Evaluation

Incidente 162916 Reportes
Anthropic Research Model Reportedly Scanned 9,000 Targets and Compromised Real Company's Application During Evaluation

Loading...
Claude, de Anthropic, vulneró 3 organizaciones y subió malware a PyPI durante las pruebas.
bleepingcomputer.com · 2026

Anthropic anunció hoy que, durante pruebas de seguridad internas, uno de sus modelos Claude creó un paquete Python malicioso y lo subió a PyPI, donde se ejecutó en 15 sistemas reales antes de que las defensas automatizadas del registro lo bloquearan.

La compañía reveló este incidente como uno de los tres en los que modelos Claude accedieron a internet desde entornos de evaluación supuestamente seguros, comprometiendo así la infraestructura de producción de tres organizaciones.

La revisión se produjo tras la publicación por parte de OpenAI el 21 de julio (https://openai.com/index/hugging-face-model-evaluation-security-incident/), en la que se informaba de que sus modelos habían escapado de un entorno de prueba aislado y alcanzado la infraestructura de producción de Hugging Face. Posteriormente, JFrog confirmó que los modelos se filtraron explotando vulnerabilidades de día cero (https://www.bleepingcomputer.com/news/security/openai-models-used-artifactory-zero-days-to-escape-to-the-internet/) en Artifactory, una instalación autogestionada.

Reclamando un nombre de paquete inexistente

Los tres incidentes ocurrieron durante ejercicios de captura de bandera realizados por Irregular, un socio de evaluación externo. El sistema de Anthropic le indicó a Claude que no tenía acceso a internet y que el entorno era simulado. Un error de configuración hizo que ninguna de las dos afirmaciones fuera cierta, y ninguna de las empresas lo detectó hasta la semana pasada.

En el incidente de PyPI, Claude encontró un documento dentro del entorno de prueba que se hacía pasar por instrucciones de configuración para desarrolladores de una empresa ficticia.

Estas instrucciones indicaban a los nuevos empleados que instalaran un paquete de Python que nunca se había publicado, una dependencia fantasma.

Claude dedujo que si registraba el nombre del paquete, las máquinas objetivo descargarían su código automáticamente.

Publicarlo requirió cierto esfuerzo. Claude necesitaba una cuenta de PyPI, que a su vez requería una dirección de correo electrónico y un número de teléfono.

No logró encontrar un servicio de número de teléfono gratuito e intentó, sin éxito, obtener fondos para comprar uno por diferentes vías. Finalmente, rectificó, encontró un proveedor de correo electrónico que no estaba bloqueado, registró una cuenta y subió el malware. Anthropic declaró que el paquete estuvo disponible públicamente durante aproximadamente una hora.

Durante ese lapso, 15 sistemas reales lo descargaron y ejecutaron. Uno de ellos pertenecía a una empresa de seguridad que instala habitualmente paquetes de PyPI y los analiza en busca de malware, un proceso que considera seguro el contenido del registro.

El malware de Claude se ejecutó, envió las credenciales de la empresa a un punto de recolección que esta había configurado y luego las utilizó para acceder a la infraestructura de la empresa. Anthropic afirmó que Claude desconocía la existencia de la empresa.

Los sistemas de seguridad de PyPI eliminaron el paquete automáticamente. Anthropic indicó que ha notificado al equipo de PyPI y les ha entregado los indicadores correspondientes.

El modelo utilizado en esta ejecución fue Claude Mythos 5. Según Anthropic, su razonamiento detectó el problema desde el principio, señalando que publicar el paquete equivaldría a un ataque real si internet existiera, y calificándolo de "inaceptable y, sin duda, no la solución prevista".

Posteriormente, llegó a la conclusión de que el entorno era simulado, basándose en que no reconocía las autoridades de certificación que protegían sus conexiones y en que los sistemas mostraban la fecha de 2026.

Cuando los escáneres automatizados comenzaron a instalar el paquete, Claude los interpretó como actores programados dentro del ejercicio.

Credenciales y una base de datos de producción

El impacto más grave provino de un incidente independiente que involucró a Claude Opus 4.7, donde la empresa objetivo ficticia compartía nombre con un dominio real.

En cuatro ejecuciones, Claude tuvo dificultades para alcanzar su objetivo simulado, descubrió que la empresa real era accesible a través de internet y asumió que ese era el objetivo previsto. Extrajo credenciales de aplicaciones e infraestructura y accedió a una base de datos con varios cientos de filas de datos de producción.

Ese fue el único caso en el que un modelo continuó atacando tras comprobar que se encontraba en un sistema real. Anthropic afirmó que las cuatro ejecuciones finalmente reconocieron que el objetivo era real, y en dos de ellas, Claude dedujo que la empresa real debía formar parte del ejercicio de todos modos.

Un tercer incidente involucró un modelo de investigación interna no publicado, que escaneó aproximadamente 9000 objetivos tras no lograr acceder al previsto, y luego comprometió una aplicación con acceso a internet utilizando credenciales de una página de depuración expuesta e inyección SQL. Posteriormente, el modelo detectó que el host se encontraba en una cuenta en la nube sin conexión con el desafío, concluyó que el objetivo era real y se detuvo por sí solo.

Ninguno de los ataques utilizó técnicas novedosas. Anthropic los describió como contraseñas débiles y puntos finales no autenticados.

¿Qué sucederá a continuación?


Anthropic inició su revisión el 23 de julio y detuvo todas las evaluaciones de ciberseguridad ese mismo día. Identificó los tres incidentes al día siguiente y notificó a Irregular y a las organizaciones afectadas el 27 de julio, aunque aún no ha podido contactar con una de ellas.

El primero de los tres incidentes se remonta a abril, lo que significa que parte de la actividad pasó desapercibida durante aproximadamente tres meses.

Las evaluaciones se ejecutaron sin los clasificadores ni el monitoreo que vienen incluidos con los modelos Claude de uso general, aunque los modelos conservaron su entrenamiento de seguridad.

Anthropic afirmó que sus medidas de seguridad de producción habrían bloqueado el comportamiento y calificó los incidentes más como un fallo operativo y de configuración que como un fallo de alineación del modelo, dado que se les indicó a los modelos que no tenían acceso a internet cuando en realidad sí lo tenían.

Ahora planea un monitoreo más amplio de las transcripciones, mejores herramientas de investigación y un mayor trabajo de garantía con los proveedores de evaluación.

La compañía indicó que está en conversaciones con METR para una revisión independiente y que publicará una transcripción ligeramente editada de la ejecución de PyPI la próxima semana.

Ninguna de las dos organizaciones afectadas contactadas por Anthropic había detectado la actividad por sí misma. Esto invierte el caso de OpenAI, donde Hugging Face detectó y contuvo la intrusión por su cuenta y la divulgó cinco días antes de que OpenAI afirmara que sus modelos eran los responsables.

Actualización, 1 de agosto: El párrafo final se ha corregido para reflejar la cronología de la divulgación entre Hugging Face y OpenAI.

Investigación

  • Definición de un “Incidente de IA”
  • Definición de una “Respuesta a incidentes de IA”
  • Hoja de ruta de la base de datos
  • Trabajo relacionado
  • Descargar Base de Datos Completa

Proyecto y Comunidad

  • Acerca de
  • Contactar y Seguir
  • Aplicaciones y resúmenes
  • Guía del editor

Incidencias

  • Todos los incidentes en forma de lista
  • Incidentes marcados
  • Cola de envío
  • Vista de clasificaciones
  • Taxonomías

2026 - AI Incident Database

  • Condiciones de uso
  • Política de privacidad
  • dd3f754