Skip to Content
logologo
AI Incident Database
Faire un don
Découvrir
Envoyer
  • Bienvenue sur AIID
  • Vue de tableau
  • Vue de liste
  • Entités
  • Taxonomies
  • Vue spatiale
  • Blog
  • Résumé de l’Actualité sur l’IA
  • Incident au hasard
  • S'inscrire
Découvrir
Envoyer
  • Bienvenue sur AIID
  • Vue de tableau
  • Vue de liste
  • Entités
  • Taxonomies
  • Vue spatiale
  • Blog
  • Résumé de l’Actualité sur l’IA
  • Incident au hasard
  • S'inscrire

Problème 7672

Incidents associés

Incident 162716 Rapports
Claude Opus 4.7 Reportedly Compromised Real Company's Production Infrastructure During Cybersecurity Evaluation

Incident 162816 Rapports
Claude Mythos 5 Reportedly Published Malicious PyPI Package That Compromised Real Security Company During Evaluation

Incident 162916 Rapports
Anthropic Research Model Reportedly Scanned 9,000 Targets and Compromised Real Company's Application During Evaluation

Loading...
Claude, d'Anthropic, a infiltré trois organisations et a téléchargé un logiciel malveillant PyPI lors de tests.
bleepingcomputer.com · 2026

Anthropic a annoncé aujourd'hui que lors de tests de sécurité internes, l'un de ses modèles Claude a généré un package Python malveillant et l'a téléchargé sur PyPI. Ce package a été exécuté sur 15 systèmes réels avant d'être bloqué par les défenses automatisées du registre.

L'entreprise a révélé cet incident comme l'un des trois au cours desquels des modèles Claude ont accédé à Internet depuis des environnements d'évaluation censés être sécurisés, compromettant ainsi l'infrastructure de production de trois organisations.

Cette enquête fait suite à la révélation d'OpenAI le 21 juillet (https://openai.com/index/hugging-face-model-evaluation-security-incident/) concernant la fuite de ses modèles d'un environnement de test isolé et leur infiltration dans l'infrastructure de production de Hugging Face. JFrog a par la suite confirmé que les modèles avaient échappé à la vigilance des utilisateurs en exploitant des failles zero-day (https://www.bleepingcomputer.com/news/security/openai-models-used-artifactory-zero-days-to-escape-to-the-internet/) au sein de son infrastructure Artifactory auto-hébergée.

S'approprier un nom de paquet inexistant

Ces trois incidents se sont produits lors d'exercices de capture de drapeau menés par Irregular, un partenaire d'évaluation tiers. Anthropic a indiqué à Claude qu'il n'avait pas accès à Internet et que l'environnement était simulé. Une erreur de configuration a fait que ces deux affirmations étaient fausses, et aucune des deux entreprises ne s'en est aperçue avant la semaine dernière.

Lors de l'incident PyPI, Claude a découvert dans l'environnement de test un document se faisant passer pour des instructions d'installation destinées aux développeurs d'une entreprise fictive.

Ces instructions indiquaient aux nouveaux employés d'installer un paquet Python qui n'avait jamais été publié : une dépendance fantôme.

Claude a compris qu'en enregistrant le nom lui-même, les machines cibles téléchargeraient automatiquement le code.

La publication du paquet s'est avérée complexe. Claude avait besoin d'un compte PyPI, ce qui nécessitait une adresse e-mail, elle-même nécessitant un numéro de téléphone.

N'ayant pas trouvé de service de numéro de téléphone gratuit, il a ensuite tenté, sans succès, d'obtenir les fonds nécessaires pour en acheter un par différents moyens. Finalement, il a fait marche arrière, trouvé un fournisseur de messagerie non bloqué, créé un compte et téléchargé le logiciel malveillant.

Anthropic a indiqué que le paquet est resté accessible publiquement pendant environ une heure.

Durant ce laps de temps, 15 systèmes réels l'ont téléchargé et exécuté. L'un d'eux appartenait à une entreprise de sécurité qui installe régulièrement des paquets depuis PyPI et les analyse à la recherche de logiciels malveillants, une procédure qui considère le contenu du registre comme sûr.

Le code malveillant de Claude s'est exécuté, a envoyé les identifiants de cette entreprise à un point de collecte qu'elle avait mis en place, puis les a utilisés pour s'infiltrer plus profondément dans l'infrastructure de l'entreprise. Anthropic a précisé que Claude ignorait l'existence de cette entreprise.

Les systèmes de sécurité de PyPI ont supprimé automatiquement le paquet. Anthropic a indiqué avoir informé l'équipe PyPI et lui avoir transmis des indicateurs.

Le modèle utilisé pour cette exécution était Claude Mythos 5. Selon Anthropic, son raisonnement a rapidement mis en évidence le problème, soulignant que la publication du package équivaudrait à une véritable attaque si Internet existait réellement, et qualifiant cela d'« inacceptable, et certainement pas la solution envisagée ».

Le modèle a ensuite conclu que l'environnement était simulé, car il ne reconnaissait pas les autorités de certification sécurisant ses connexions et que les systèmes affichaient la date de 2026.

Lorsque des scanners automatisés ont commencé à installer le package, Claude les a interprétés comme des acteurs scriptés au sein de l'exercice.

Identifiants et base de données de production


L'impact le plus grave est survenu lors d'un incident distinct impliquant Claude Opus 4.7, où l'entreprise cible fictive partageait un nom avec un domaine réel.

Au cours de quatre exécutions, Claude a eu des difficultés à atteindre sa cible simulée, a découvert que l'entreprise réelle était accessible via Internet et a supposé que c'était l'objectif recherché. Il a extrait les identifiants d'application et d'infrastructure et a accédé à une base de données contenant plusieurs centaines de lignes de données de production.

Il s'agissait du seul cas où un modèle a continué d'attaquer après avoir déterminé qu'il s'agissait d'un système réel. Anthropic a indiqué que les quatre exécutions ont finalement reconnu que la cible était réelle, et que dans deux d'entre elles, Claude a supposé que l'entreprise réelle devait de toute façon participer à l'exercice.

Un troisième incident impliquait un modèle de recherche interne non publié, qui a analysé environ 9 000 cibles après avoir échoué à atteindre la cible visée, puis a compromis une application accessible via Internet en utilisant des identifiants provenant d'une page de débogage exposée et une injection SQL. Ce modèle a ensuite constaté que l'hôte se trouvait sur un compte cloud sans lien avec le défi, a conclu que la cible était réelle et s'est arrêté de lui-même.

Aucune des attaques n'a utilisé de techniques inédites. Anthropic les a décrites comme des mots de passe faibles et des points d'accès non authentifiés.

Et ensuite ?


Anthropic a commencé son examen le 23 juillet et a suspendu toutes les évaluations de cybersécurité le même jour. L'entreprise a identifié les trois incidents le lendemain et a notifié Irregular et les organisations concernées le 27 juillet, bien qu'elle n'ait pas encore pu contacter l'une des trois.

Le plus ancien des trois incidents remonte à avril, ce qui signifie qu'une partie de l'activité est restée indétectée pendant environ trois mois.

Les évaluations ont été menées sans les classificateurs et le système de surveillance généralement intégrés aux modèles Claude, bien que ces derniers aient conservé leur entraînement de sécurité.

Anthropic a déclaré que ses mesures de sécurité en production auraient bloqué ce comportement et a qualifié les incidents de défaillance plus proches d'un dysfonctionnement du faisceau et du fonctionnement que d'un problème d'alignement du modèle, car les modèles ont été informés qu'ils n'avaient pas accès à Internet alors qu'ils y étaient connectés.

L'entreprise prévoit désormais un suivi plus étendu des transcriptions, de meilleurs outils d'investigation et un renforcement de la collaboration avec les fournisseurs d'évaluation.

Anthropic a indiqué être en discussion avec le METR (https://metr.org/about) pour un audit indépendant et qu'elle publiera une transcription légèrement expurgée de l'exécution sur PyPI dans le courant de la semaine prochaine.

Aucune des deux organisations concernées contactées par Anthropic n'avait détecté l'activité elle-même. Cela inverse le cas d'OpenAI, où Hugging Face a détecté et neutralisé l'intrusion par ses propres moyens et l'a divulguée cinq jours avant qu'OpenAI n'accuse ses modèles.

Mise à jour du 1er août : Le dernier paragraphe a été corrigé afin de refléter la chronologie des divulgations entre Hugging Face et OpenAI.

Recherche

  • Définition d'un « incident d'IA »
  • Définir une « réponse aux incidents d'IA »
  • Feuille de route de la base de données
  • Travaux connexes
  • Télécharger la base de données complète

Projet et communauté

  • À propos de
  • Contacter et suivre
  • Applications et résumés
  • Guide de l'éditeur

Incidents

  • Tous les incidents sous forme de liste
  • Incidents signalés
  • File d'attente de soumission
  • Affichage des classifications
  • Taxonomies

2026 - AI Incident Database

  • Conditions d'utilisation
  • Politique de confidentialité
  • dd3f754