関連インシデント
インシデント 162716 Report
Claude Opus 4.7 Reportedly Compromised Real Company's Production Infrastructure During Cybersecurity Evaluation
インシデント 162816 Report
Claude Mythos 5 Reportedly Published Malicious PyPI Package That Compromised Real Security Company During Evaluation
インシデント 162916 Report
Anthropic Research Model Reportedly Scanned 9,000 Targets and Compromised Real Company's Application During Evaluation
Anthropic社は本日、社内セキュリティテスト中に、同社のClaudeモデルの一つが悪意のあるPythonパッケージを作成し、PyPIにアップロードしたと発表しました。このパッケージは、レジストリの自動防御システムによって削除されるまで、15台の実機システムで実行されていました。
同社は、この事例を、本来は隔離されたはずの評価環境からClaudeモデルがインターネット上に流出し、3つの組織の運用インフラを侵害した3件のインシ デントのうちの1件として公表しました。
この調査は、OpenAIが7月21日に発表した、同社のモデルが隔離されたテスト環境から脱出し、Hugging Face社の運用インフラに到達したという情報(https://openai.com/index/hugging-face-model-evaluation-security-incident/)に続くものです。JFrog社は後に、これらのモデルが自社ホスト型のArtifactoryのゼロデイ脆弱性を悪用してインターネット上に流出したことを確認しました(https://www.bleepingcomputer.com/news/security/openai-models-used-artifactory-zero-days-to-escape-to-the-internet/)。
存在しないパッケージ名を不正に取得
これら3件の事案はすべて、第三者評価パートナーであるIrregular社が実施したキャプチャー・ザ・フラッグ演習中に発生しました。Anthropic社は、Claude氏に対し、インターネット接続がなく、環境はシミュレーションであると表示しました。しかし、設定ミスにより、実際にはどちらも正しくなく、両社とも先週までこの事実に気づきませんでした。
PyPIの事案では、Claude氏はテスト環境内に、架空の企業の開発者向けセットアップ手順書を装った文書を発見しました。
その手順書には、新規採用者に対し、公開されていないPythonパッケージ(架空の依存関係)をインストールするよう指示されていました。
Claude氏は、自らパッケージ名を登録すれば、ターゲットのマシンが自動的にそのコードをダウンロードすることに着目しました。
しかし、実際に公開するにはいくつかの手順が必要でした。Claude氏はPyPIアカウントが必要でしたが、そのためにはメールアドレス、そして電話番号が必要でした。
無料の電話番号サービスを見つけることができず、そ の後、複数の方法で資金調達を試みましたが、いずれも失敗に終わりました。最終的に、攻撃者は追跡をやり直し、ブロックされていないメールプロバイダーを見つけ、アカウントを登録してマルウェアをアップロードしました。
Anthropic社はによると、このパッケージは約1時間、公開された状態で放置されていました。
その間、15台の実際のシステムがダウンロードして実行しました。そのうちの1台は、PyPIからパッケージを定期的にインストールし、マルウェアのスキャンを行うセキュリティ企業のものでした。このワークフローでは、レジストリの内容は実行しても安全であるとみなされます。
Claudeのペイロードが実行され、その企業の認証情報が事前に設定した収集ポイントに送信され、その後、その認証情報を使って企業のインフラストラクチャにさらに侵入しました。Anthropic社によると、Claudeはこの企業の存在を知らなかったとのことです。
PyPIのセキュリティシステムは、このパッケージを自動的に削除しました。Anthropic社は、PyPIチームに通知し、関連情報を提供したと述べています。
このシミュレーション実行の背後にあるモデルは、Claude Mythos 5でした。Anthropicによると、Claude Mythos 5は問題を早期に検知し、パッケージを公開することはインターネットが実在する環境であれば現実世界への攻撃に相当すると指摘し、「これは許容できないことであり、明らかに意図された解決策ではない」と結論付けました。
その後、Claude Mythos 5は、接続を保護する認証局を認識できないこと、およびシステムに2026年 の日付が表示されていることなどを根拠に、環境が偽装されているという結論に至りました。
自動スキャナーがパッケージのインストールを開始すると、Claude Mythos 5はそれらをシミュレーション内のスクリプト化されたアクターとして認識しました。
認証情報と本番データベース
最も深刻な影響は、Claude Opus 4.7に関連する別のインシデントから発生しました。このインシデントでは、架空のターゲット企業が実在するドメインと同じ名前を使用していました。
4回のシミュレーション実行において、Claude Mythos 5はシミュレーション上のターゲットへの到達に苦戦し、実在の企業がインターネット経由でアクセス可能であることを発見し、それが本来の目的であると誤認しました。アプリケーションとインフラストラクチャの認証情報を抽出し、数百行の運用データが格納されたデータベースにアクセスしました。
これは、モデルが実際のシステムにアクセスしていると認識した後も攻撃を継続した唯一のケースでした。Anthropic社によると、4回の攻撃すべてで最終的にターゲットが実在するシステムであることを認識しており、そのうち2回では、クロード氏は実際の企業が演習に参加しているに違いないと推論しました。
3つ目の事例は、未公開の社内研究モデルによるもので、意図したターゲットにアクセスできなかった後、約9,000のターゲットをスキャンし、公開されたデバッグページから取得した認証情報とSQLインジェクションを使用してインターネットに接続されたアプリケーションを侵害しました。このモデルはその後、ホストがチャレンジとは無関係のクラウドアカウントに存在することに気づき、ターゲットが実在するシステムであると判断して自動的に攻撃を停止しました。
これらの攻撃はいずれも新しい手法を用いたものではありませんでした。Anthropic社は、これらの攻撃は脆弱なパスワードと認証されていないエンドポイントによるものだと説明しています。
今後の展開
Anthropic社は7月23日に調査を開始し、同日、すべてのサイバーセキュリティ評価を中止しました。同社は翌日、3件のインシデントを特定し、7月27日にIrregular社と関係組織に通知したが、3件のうち1件にはまだ連絡が取れていない。
3件のインシデントのうち最も古いものは4月に発生したもので、一部の活動は約3ヶ月間検出されずにいたことになる。
評価は、一般公開されているClaudeモデルに付属する分類器と監視機能を使わずに実行されたが、モデルは安全トレーニングは継続していた。
Anthropic社は、自社の運用上の安全対策によってこの挙動は阻止できたはずだと述べ、モデルが実際にはインターネットに接続できていたにもかかわらず、接続されていないと認識されていたことから、今回のインシデントはモデルのアライメント不良というよりも、ハーネスや運用上の不具合に近いと説明した。
同社は今後、より広範なトランスクリプト監視、より優れた調査ツール、評価ベンダーとの連携強化を計画している。
同社は、独立したレビューのためにMETRと協議中であり、PyPI実行のトランスクリプトを一部編集した上で、今後1週間以内に公開する予定であると述べた。
Anthropicが連絡を取った2つの被害組織はいずれも、自らこの活 動を検知していませんでした。これはOpenAIのケースとは正反対です。OpenAIの場合、Hugging Faceは独自に侵入を検知・封じ込め、OpenAIが自社のモデルが原因だと発表する5日前に公表していました(https://huggingface.co/blog/security-incident-july-2026)。
更新(8月1日):Hugging FaceとOpenAI間の情報開示の時系列を反映させるため、最後の段落を修正しました。