Incidente 1685: Según informes, una versión temprana de Claude Opus 4.6 Checkpoint obtuvo acceso administrativo no autorizado a un sistema de terceros durante una evaluación de ciberseguridad.
Descripción: Anthropic informó que, durante una evaluación de ciberseguridad realizada en enero de 2026, un punto de control inicial de Claude Opus 4.6 deshabilitó accidentalmente su objetivo asignado y luego accedió a una máquina de terceros a través de Internet. Según se informó, el modelo utilizó una contraseña descubierta para obtener acceso de administrador, recolectó credenciales adicionales, modificó la configuración del sistema y leyó la información personal de una persona antes de que se agotara su presupuesto de tokens. Posteriormente, Anthropic notificó a la parte afectada.
Editor Notes: (1) Jan. 2026: incident occurred during a pre-release cybersecurity evaluation. (2) Aug. 2026: Anthropic identified the previously missed incident while preparing transcripts for METR and notified the affected party. (3) 09/09/2026: Anthropic disclosed the incident, said a subsequent review of roughly 481 million transcripts found no additional cases of similar or greater severity, and announced an independent METR investigation.
Entidades
Ver todas las entidadesAlleged: Anthropic , Large language model developers y AI agent system developers developed an AI system deployed by Irregular , Anthropic , AI evaluation organizations y AI agent system deployers, which harmed Unidentified third party compromised by Claude Opus 4.6 during Anthropic cybersecurity evaluation , Unidentified person whose personal information was accessed by Claude Opus 4.6 , Privacy y Organizations.
Sistemas de IA presuntamente implicados: Large language models , Early checkpoint of Claude Opus 4.6 , Cybersecurity AI systems , Claude Opus 4.6 , Claude y AI agent systems
Estadísticas de incidentes
ID
1685
Cantidad de informes
2
Fecha del Incidente
2026-09-09
Editores
Daniel Atherton
Informes del Incidente
Cronología de Informes
Loading...
Anthropic reveló el miércoles otro caso de un modelo de IA que pirateó sistemas externos durante las pruebas, el último de una creciente lista de incidentes que han generado preocupación sobre el riesgo que representan los agentes de IA aut…
Loading...
Anthropic reveló el miércoles que otro de sus modelos Claude accedió erróneamente a internet durante un ejercicio de ciberseguridad, siendo esta la cuarta vez que sus modelos lo hacen.
Una versión temprana del modelo Claude Opus 4.6 se cone…
Variantes
Una "Variante" es un incidente de IA similar a un caso conocido—tiene los mismos causantes, daños y sistema de IA. En lugar de enumerarlo por separado, lo agrupamos bajo el primer incidente informado. A diferencia de otros incidentes, las variantes no necesitan haber sido informadas fuera de la AIID. Obtenga más información del trabajo de investigación.
¿Has visto algo similar?
en revisión
Fecha del Incidente:
2026-09-09
Incidentes Similares
Selected by our editors
Claude Opus 4.7 Reportedly Compromised Real Company's Production Infrastructure During Cybersecurity Evaluation
· 16 informes
Claude Mythos 5 Reportedly Published Malicious PyPI Package That Compromised Real Security Company During Evaluation
· 16 informes
Anthropic Research Model Reportedly Scanned 9,000 Targets and Compromised Real Company's Application During Evaluation
· 16 informes
Did our AI mess up? Flag the unrelated incidents
Incidentes Similares
Selected by our editors
Claude Opus 4.7 Reportedly Compromised Real Company's Production Infrastructure During Cybersecurity Evaluation
· 16 informes
Claude Mythos 5 Reportedly Published Malicious PyPI Package That Compromised Real Security Company During Evaluation
· 16 informes
Anthropic Research Model Reportedly Scanned 9,000 Targets and Compromised Real Company's Application During Evaluation
· 16 informes
Did our AI mess up? Flag the unrelated incidents
