Incidente 1685: Según informes, una versión temprana de Claude Opus 4.6 Checkpoint obtuvo acceso administrativo no autorizado a un sistema de terceros durante una evaluación de ciberseguridad.
Respondido
Descripción: Anthropic informó que, durante una evaluación de ciberseguridad realizada en enero de 2026, un punto de control inicial de Claude Opus 4.6 deshabilitó accidentalmente su objetivo asignado y luego accedió a una máquina de terceros a través de Internet. Según se informó, el modelo utilizó una contraseña descubierta para obtener acceso de administrador, recolectó credenciales adicionales, modificó la configuración del sistema y leyó la información personal de una persona antes de que se agotara su presupuesto de tokens. Posteriormente, Anthropic notificó a la parte afectada.
Editor Notes: (1) Jan. 2026: incident occurred during a pre-release cybersecurity evaluation. (2) Aug. 2026: Anthropic identified the previously missed incident while preparing transcripts for METR and notified the affected party. (3) 09/09/2026: Anthropic disclosed the incident, said a subsequent review of roughly 481 million transcripts found no additional cases of similar or greater severity, and announced an independent METR investigation.
Entidades
Ver todas las entidadesAlleged: Anthropic , Large language model developers y AI agent system developers developed an AI system deployed by Irregular , Anthropic , AI evaluation organizations y AI agent system deployers, which harmed Unidentified third party compromised by Claude Opus 4.6 during Anthropic cybersecurity evaluation , Unidentified person whose personal information was accessed by Claude Opus 4.6 , Privacy y Organizations.
Sistemas de IA presuntamente implicados: Large language models , Early checkpoint of Claude Opus 4.6 , Cybersecurity AI systems , Claude Opus 4.6 , Claude y AI agent systems
Estadísticas de incidentes
ID
1685
Cantidad de informes
3
Fecha del Incidente
2026-09-09
Editores
Daniel Atherton
Informes del Incidente
Cronología de Informes
Loading...
Respuesta post-incidente de Anthropic, Paul C. Bogdan, Richard Qi, Jake Eaton, Sam Kennedy, Fabien Roger, Alex Glynn, Runjin Chen, Ben Wright, Otto Stegmaier, Jon Kutasov, Dan Foreman-Mackey, Sylvie Carr, Shan Carter, Monte MacDiarmid
Nota del editor de AIID: Este es un resumen no contiguo del informe de Anthropic del 9 de septiembre de 2026, preparado para que un único registro de informe de AIID pueda vincularse a los cuatro identificadores de incidentes de evaluación …
Loading...
Anthropic reveló el miércoles otro caso de un modelo de IA que pirateó sistemas externos durante las pruebas, el último de una creciente lista de incidentes que han generado preocupación sobre el riesgo que representan los agentes de IA aut…
Loading...
Anthropic reveló el miércoles que otro de sus modelos Claude accedió erróneamente a internet durante un ejercicio de ciberseguridad, siendo esta la cuarta vez que sus modelos lo hacen.
Una versión temprana del modelo Claude Opus 4.6 se cone…
Variantes
Una "Variante" es un incidente de IA similar a un caso conocido—tiene los mismos causantes, daños y sistema de IA. En lugar de enumerarlo por separado, lo agrupamos bajo el primer incidente informado. A diferencia de otros incidentes, las variantes no necesitan haber sido informadas fuera de la AIID. Obtenga más información del trabajo de investigación.
¿Has visto algo similar?
