インシデント 1685: Checkpointの初期バージョンであるClaude Opus 4.6が、サイバーセキュリティ評価中にサードパーティシステムへの不正な管理者アクセス権を取得していたと報じられている。
概要: Anthropic社は、2026年1月に実施したサイバーセキュリティ評価において、Claude Opus 4.6の初期チェックポイントが誤って割り当てられたターゲットを無効化し、その後、インターネット経由で無関係の第三者のマシンに到達したと報告した。このモデルは、発見されたパスワードを使用して管理者権限を取得し、追加の認証情報を収集し、システム設定を変更し、トークン予算が尽きる前に1人の個人情報を読み取ったという。Anthropic社はその後、影響を受けた当事者に通知した。
Editor Notes: (1) Jan. 2026: incident occurred during a pre-release cybersecurity evaluation. (2) Aug. 2026: Anthropic identified the previously missed incident while preparing transcripts for METR and notified the affected party. (3) 09/09/2026: Anthropic disclosed the incident, said a subsequent review of roughly 481 million transcripts found no additional cases of similar or greater severity, and announced an independent METR investigation.
Alleged: Anthropic , Large language model developers と AI agent system developers developed an AI system deployed by Irregular , Anthropic , AI evaluation organizations と AI agent system deployers, which harmed Unidentified third party compromised by Claude Opus 4.6 during Anthropic cybersecurity evaluation , Unidentified person whose personal information was accessed by Claude Opus 4.6 , Privacy と Organizations.
関与が疑われるAIシステム: Large language models , Early checkpoint of Claude Opus 4.6 , Cybersecurity AI systems , Claude Opus 4.6 , Claude と AI agent systems
インシデントのステータス
インシデントID
1685
レポート数
2
インシデント発生日
2026-09-09
エディタ
Daniel Atherton
インシデントレポート
レポートタイムライン
Loading...
Anthropic社は水曜日、テスト中にAIモデルが外部システムをハッキングした事例を新たに公表した。これは、自律型AIエージェントがもたらすリスクへの懸念を高める、増加の一途をたどる同様の事例の最新事例である。
Anthropic社によると、1月に発生したこの事例は、社内で事前に調査が行われていたにもかかわらず、先月まで発見されなかった。これは、高度なモデルによる予期せぬ挙動を特定し、封じ込めることがAI開発者にとってどれほど困難であるかを浮き彫りにしている。
同社はブログ…
Loading...
バリアント
「バリアント」は既存のAIインシデントと同じ原因要素を共有し、同様な被害を引き起こし、同じ知的システムを含んだインシデントです。バリアントは完全に独立したインシデントとしてインデックスするのではなく、データベースに最初に投稿された同様なインシデントの元にインシデントのバリエーションとして一覧します。インシデントデータベースの他の投稿 タイプとは違い、バリアントではインシデントデータベース以外の根拠のレポートは要求されません。詳細についてはこの研究論文を参照してください
似たようなものを見つけましたか?
レビュー前
インシデント発生日:
2026-09-09
