Nicolas Berger
Nicolas Berger
Expert en cybersecurite offensive
| · 12 min de lecture

Hugging Face confirme une breche majeure : datasets internes et credentials de services compromis via un dataset malveillant — plan d'action pour les RSSI francais

TL;DR — URGENCE SECURITE

  • Breche confirmee le 20 juillet 2026 : Hugging Face, la plus grande plateforme de modeles d'intelligence artificielle avec plus d'un million de modeles heberges, a confirme une breche majeure affectant ses systemes internes. L'attaque a ete declenchee par un dataset malveillant uploade sur la plateforme.
  • Vecteur d'attaque — dataset malveillant : un dataset specialement concu a exploite une vulnerabilite dans le pipeline de traitement de Hugging Face, permettant l'execution de code arbitraire sur les serveurs de la plateforme. Les attaquants ont ensuite escalade leurs privileges pour obtenir un acces etendu aux systemes internes.
  • Donnees compromises : des datasets internes (donnees d'entrainement proprietaires, datasets prives d'utilisateurs) et des credentials de services (cles API, tokens d'acces, secrets d'infrastructure) ont ete compromis. L'ampleur exacte de la compromission est encore en cours d'evaluation.
  • Actions immediates pour les RSSI : auditer toutes les dependances IA tierces, effectuer une rotation immediate de tous les credentials lies a Hugging Face, verifier l'integrite des modeles deployes en production, et mettre a jour votre registre de sous-traitants RGPD.

Le 20 juillet 2026, Hugging Face — la plateforme qui heberge plus d'un million de modeles d'intelligence artificielle et qui est devenue l'infrastructure de facto du machine learning mondial — a confirme avoir ete victime d'une breche de securite majeure. L'incident, revele par TechCrunch puis confirme par la plateforme elle-meme, marque un tournant dans la securite de la chaine d'approvisionnement de l'IA. Un dataset malveillant, volontairement uploade par un acteur encore non identifie, a exploite une vulnerabilite dans le systeme de traitement des donnees pour executer du code arbitraire sur les serveurs de Hugging Face.

Cette breche n'est pas un simple incident isole. Elle revele une fragilite systemique dans l'ecosysteme de l'IA open source dont dependent aujourd'hui des milliers d'entreprises francaises et europeennes. Selon les dernieres estimations, plus de 50 000 organisations dans le monde utilisent Hugging Face dans leurs pipelines de production, dont un nombre significatif d'entreprises du CAC 40, de startups de la French Tech et d'organismes publics. L'ANSSI a immediatement classe cet incident comme « critique » et recommande une evaluation d'urgence de toutes les dependances IA des organisations concernees.

Pour les RSSI francais, cette breche pose des questions fondamentales : comment securiser une chaine d'approvisionnement IA dont les composants sont heberges sur des plateformes tierces ? Comment verifier l'integrite de modeles de machine learning qui sont essentiellement des fichiers binaires opaques ? Et surtout, quelles sont les obligations reglementaires au regard de NIS2 et du RGPD lorsque votre fournisseur de modeles IA est compromis ?

Les faits : Hugging Face confirme une breche majeure

Hugging Face est bien plus qu'un simple depot de modeles : c'est le GitHub de l'intelligence artificielle. Fondee en 2016 et basee a New York avec des bureaux a Paris, la plateforme heberge aujourd'hui plus d'un million de modeles pre-entraines, 300 000 datasets et des dizaines de milliers de demonstrations interactives (Spaces). Des geants comme Google, Meta, Microsoft, Amazon et des milliers de startups y publient et consomment des modeles. La bibliotheque Transformers de Hugging Face, installee plus de 100 millions de fois, est devenue un standard industriel. Quand Hugging Face est compromis, c'est l'ensemble de l'ecosysteme IA mondial qui tremble.

Le 20 juillet 2026, Hugging Face a publie un bulletin de securite confirmant qu'un dataset malveillant uploade sur sa plateforme avait exploite une vulnerabilite dans le pipeline de traitement des donnees. Selon les premieres informations rapportees par TechCrunch, le dataset contenait du code specialement concu pour s'executer lors du chargement automatique par les systemes internes de Hugging Face — un mecanisme similaire aux attaques par deserialisation pickle qui affectent les modeles de machine learning depuis plusieurs annees, mais applique ici au traitement des datasets.

Une fois le code execute sur les serveurs, les attaquants ont escalade leurs privileges de maniere methodique. Ils ont d'abord obtenu un acces limite au systeme de stockage des datasets, puis sont parvenus a compromettre des credentials de services internes — des tokens d'acces et des cles API qui permettent aux differents composants de l'infrastructure Hugging Face de communiquer entre eux. Avec ces credentials, les attaquants ont obtenu un acces etendu a des systemes internes, leur permettant d'acceder a des datasets prives d'utilisateurs et a des informations d'infrastructure sensibles.

Hugging Face a immediatement lance une procedure de reponse a incident, revoquer les credentials compromis et notifie les utilisateurs concernes. La plateforme a egalement recommande a tous ses utilisateurs de proceder a une rotation de leurs tokens d'acces par mesure de precaution. L'equipe de securite a engage des experts forensiques externes pour evaluer l'ampleur complete de la compromission, une investigation qui est toujours en cours au moment de la publication de cet article.

Fiche technique de l'incident

Type d'attaque

Supply chain attack via dataset malveillant

Impact

Datasets internes + credentials de services

Decouverte

20 juillet 2026

Severite

Critique

Avis d'expert
Nicolas Berger

« Cette breche illustre parfaitement les risques identifies par la directive NIS2 en matiere de securite de la chaine d'approvisionnement. L'article 21 de NIS2 exige que les entites essentielles et importantes evaluent la securite de leurs fournisseurs directs et prestataires de services. Or, combien d'entreprises francaises ont integre Hugging Face dans leur registre de sous-traitants ? Combien ont evalue les risques lies a l'utilisation de modeles et datasets heberges sur une plateforme tierce ? Si votre pipeline IA tire des modeles depuis Hugging Face, votre chaine d'approvisionnement est potentiellement compromise. L'ANSSI recommande depuis 2024 une evaluation systematique des risques lies aux composants IA — cette breche demontre que ce n'etait pas un exces de prudence. »

Nicolas Berger, Expert en cybersecurite offensive — WebGuard Agency

Anatomie de l'attaque : du dataset malveillant a l'escalade de privileges

Pour comprendre la gravite de cette breche, il est essentiel de saisir le mecanisme technique qui l'a rendue possible. Les datasets de machine learning ne sont pas de simples fichiers de donnees inertes. Selon le format utilise, ils peuvent contenir du code executable — une realite que la communaute de la securite denonce depuis plusieurs annees sans que les pratiques de l'industrie IA n'evoluent suffisamment vite.

Le vecteur d'attaque principal repose sur la deserialisation de fichiers pickle, un format de serialisation Python largement utilise dans l'ecosysteme du machine learning. Lorsqu'un fichier pickle est charge en memoire via la fonction pickle.load(), Python execute automatiquement le code embarque dans le fichier pour reconstruire les objets serialises. Cette fonctionnalite, concue a l'origine pour la commodite des developpeurs, constitue un vecteur d'execution de code arbitraire redoutablement efficace. Un fichier pickle malveillant peut executer n'importe quelle commande systeme, telecharger et installer des backdoors, exfiltrer des donnees ou pivoter vers d'autres systemes du reseau.

Dans le cas de Hugging Face, le dataset malveillant contenait des fichiers dont le chargement automatique par les systemes de traitement de la plateforme a declenche l'execution de code sur les serveurs. Les attaquants avaient soigneusement concu le payload pour etre discret : au lieu de tenter immediatement une exfiltration massive, le code initial s'est contente d'etablir une persistance et de collecter des informations sur l'environnement — versions des logiciels, permissions disponibles, topologie du reseau interne. Cette phase de reconnaissance a dure suffisamment longtemps pour permettre aux attaquants de planifier leur escalade de privileges.

L'escalade de privileges a ete rendue possible par l'acces a des credentials de services stockes dans l'environnement d'execution. Les architectures cloud modernes utilisent frequemment des variables d'environnement, des fichiers de configuration ou des services de gestion de secrets pour permettre aux differents microservices de communiquer entre eux. En accedant a ces credentials, les attaquants ont pu se deplacer lateralement dans l'infrastructure, passant du service de traitement des datasets a des systemes plus sensibles — incluant potentiellement les serveurs qui hebergent les datasets prives des utilisateurs et les modeles non publies. Cette technique de « lateral movement » est un classique des attaques sophistiquees, mais son application a une plateforme IA de cette envergure est sans precedent.

CHAINE D'ATTAQUE : BRECHE HUGGING FACE DATASET MALVEILLANT Upload d'un dataset contenant du code EXECUTION DE CODE Deserialisation pickle sur serveur HF ESCALADE DE PRIVILEGES Acces credentials internes ACCES SYSTEMES INTERNES Mouvement lateral dans l'infra CREDENTIALS + DATASETS COMPROMIS Cles API, tokens d'acces, datasets prives Phase d'attaque active Escalade de privileges Source : analyse WebGuard Agency d'apres TechCrunch et bulletin de securite Hugging Face — Juillet 2026
Avis d'expert
Nicolas Berger

« Le probleme des fichiers pickle dans le machine learning est connu depuis des annees, et pourtant l'industrie continue de les utiliser massivement. Un fichier pickle est fondamentalement un vecteur d'execution de code arbitraire — c'est comme recevoir un executable inconnu et le lancer avec les yeux fermes. L'ANSSI a publie des recommandations specifiques sur ce sujet dans son guide de securite des systemes d'IA. L'article 21 de NIS2 impose la securisation de la chaine d'approvisionnement, et cela inclut les composants IA. Les formats plus surs comme SafeTensors existent, mais leur adoption reste insuffisante. Cette breche devrait servir d'electrochoc pour l'ensemble de l'ecosysteme. »

Nicolas Berger, Expert en cybersecurite offensive — WebGuard Agency

Quelles donnees ont ete compromises ?

La breche Hugging Face a compromis deux categories de donnees distinctes, chacune avec des implications specifiques pour les entreprises utilisatrices. La premiere categorie concerne les datasets internes — des jeux de donnees utilises par Hugging Face pour ses propres operations, mais aussi potentiellement des datasets prives uploades par des utilisateurs et des organisations. Si votre entreprise a uploade des donnees d'entrainement contenant des informations proprietaires, des donnees clients ou des donnees personnelles sur Hugging Face, ces informations pourraient avoir ete accessibles aux attaquants.

La seconde categorie, et peut-etre la plus preoccupante a court terme, concerne les credentials de services. Les tokens d'acces Hugging Face (HF tokens) permettent aux utilisateurs d'interagir avec l'API de la plateforme, de telecharger des modeles prives, de pousser des mises a jour et de gerer des deployments. Si ces tokens ont ete compromis, un attaquant pourrait potentiellement acceder aux modeles prives de votre organisation, modifier des modeles en production (en y injectant du code malveillant), ou deployer des versions compromises d'applications IA. Au-dela des tokens utilisateurs, les credentials de services internes de Hugging Face — ceux qui permettent aux microservices de la plateforme de communiquer entre eux — ouvraient un acces potentiel a l'ensemble de l'infrastructure.

Les implications au regard du RGPD sont considerables. De nombreuses entreprises utilisent Hugging Face pour entrainer ou affiner des modeles sur des donnees qui peuvent inclure des informations personnelles — meme indirectement, sous forme de textes extraits de bases de donnees clients, de conversations de support ou de documents internes. Si ces donnees d'entrainement etaient accessibles via les datasets compromis, les entreprises concernees pourraient avoir l'obligation de notifier la CNIL dans un delai de 72 heures conformement a l'article 33 du RGPD, et potentiellement de notifier les personnes concernees si le risque est eleve (article 34).

L'impact potentiel s'etend egalement aux modeles deployes en production. Si un attaquant a pu acceder a des modeles prives et les modifier subtilement — en alterant les poids du reseau neuronal ou en injectant un comportement conditionnel — les consequences pourraient etre devastatrices et extremement difficiles a detecter. Un modele de traitement du langage naturel pourrait etre modifie pour generer des reponses biaisees dans des contextes specifiques, un modele de detection de fraude pourrait etre desactive pour certains patterns, ou un modele de classification d'images pourrait etre aveugle a certains contenus. Ces modifications, souvent appelees « model poisoning », sont pratiquement indetectables par les methodes d'evaluation traditionnelles.

CHRONOLOGIE DE L'INCIDENT Date inconnue Dataset malveillant uploade sur HF 20 juillet 2026 Hugging Face confirme la breche publiquement 20 juillet 2026 Rotation des tokens recommandee a tous 21 juillet 2026 Investigation forensique en cours Source : analyse WebGuard Agency d'apres les communications officielles Hugging Face — Juillet 2026
Avis d'expert
Nicolas Berger

« L'article 33 du RGPD est sans ambiguite : toute violation de donnees personnelles doit etre notifiee a l'autorite de controle dans un delai de 72 heures. Si votre entreprise a uploade des datasets contenant des donnees personnelles sur Hugging Face — meme sous forme de textes d'entrainement, de transcriptions ou de donnees pseudonymisees — vous devez evaluer immediatement si ces donnees ont pu etre accessibles. La CNIL a recemment rappele que les donnees utilisees pour l'entrainement de modeles d'IA ne perdent pas leur caractere personnel du simple fait de leur inclusion dans un dataset. Le registre de sous-traitants RGPD de nombreuses entreprises ne mentionne probablement pas Hugging Face — c'est un manquement qu'il faut corriger en urgence. »

Nicolas Berger, Expert en cybersecurite offensive — WebGuard Agency

Les 5 actions urgentes pour les entreprises francaises

Face a cette breche, les RSSI et les equipes de securite doivent agir rapidement. Voici les cinq actions prioritaires a mettre en oeuvre dans les prochaines heures et jours pour limiter l'exposition de votre organisation.

1

Auditer toutes les dependances IA tierces

Dressez un inventaire complet de tous les modeles et datasets que votre organisation consomme depuis Hugging Face. Identifiez quels modeles sont utilises en production, lesquels sont en phase de developpement, et lesquels ont ete telecharges puis stockes localement. Verifiez si des datasets ont ete uploades sur la plateforme et si ces datasets contenaient des informations sensibles ou des donnees personnelles. Cet inventaire doit inclure les modeles charges via la bibliotheque Transformers, les datasets telecharges via datasets.load_dataset(), et les applications deployees sur Hugging Face Spaces. Documentez chaque element avec sa version, sa date de telechargement et son hash SHA-256.

2

Rotation immediate des credentials

Procedez immediatement a la rotation de tous les tokens d'acces Hugging Face utilises par votre organisation. Cela inclut les tokens personnels des developpeurs, les tokens de service utilises par vos pipelines CI/CD, et tout token stocke dans des variables d'environnement, des fichiers .env ou des gestionnaires de secrets. Revoquez les anciens tokens via les parametres de votre compte Hugging Face et generez-en de nouveaux avec des permissions minimales. Verifiez egalement que d'anciens tokens n'ont pas ete commites accidentellement dans vos depots de code — un scan avec des outils comme TruffleHog ou GitLeaks est indispensable.

3

Verifier l'integrite des modeles deployes

Pour chaque modele en production issu de Hugging Face, comparez le hash SHA-256 de vos fichiers locaux avec les hash officiels publies sur le depot du modele. Si vous avez telecharge des modeles avant la breche et que vous les avez stockes localement sans les mettre a jour, ils sont probablement surs. En revanche, tout modele telecharge ou mis a jour recemment doit etre verifie avec une attention particuliere. Privilegiez les modeles au format SafeTensors, qui ne permettent pas l'execution de code arbitraire, par rapport aux formats pickle (.bin, .pt). Utilisez l'outil picklescan pour analyser les fichiers pickle a la recherche de code malveillant.

4

Implementer un pipeline de validation des modeles

Mettez en place un processus systematique de validation avant tout deploiement de modele IA en production. Ce pipeline devrait inclure : un scan automatique des fichiers avec picklescan et des outils de detection de malware, une execution en environnement sandboxe (conteneur isole sans acces reseau) pour observer le comportement du modele, une verification des signatures et des hash, et une batterie de tests de regression pour detecter tout changement inattendu dans les predictions. Ce pipeline doit etre automatise dans votre CI/CD et aucun modele ne devrait atteindre la production sans avoir passe ces etapes.

5

Mettre a jour votre registre de sous-traitants RGPD

Si votre organisation utilise Hugging Face pour traiter ou stocker des donnees personnelles — directement ou via des datasets d'entrainement — la plateforme doit figurer dans votre registre des activites de traitement (article 30 du RGPD). Evaluez si la breche constitue une violation de donnees au sens de l'article 33 et documentez votre analyse, qu'elle conclue a une notification ou non. Si vous determinez que des donnees personnelles ont pu etre compromises, vous disposez de 72 heures pour notifier la CNIL. En parallele, revoyez vos clauses contractuelles avec Hugging Face et assurez-vous que les engagements en matiere de securite et de notification d'incidents sont clairement definis.

CHECKLIST URGENTE — BRECHE HUGGING FACE Inventaire des modeles et datasets HF Rotation de tous les tokens HF Verification hash SHA-256 des modeles Scan picklescan sur tous les fichiers .bin/.pt Pipeline de validation en sandbox Migration vers SafeTensors planifiee Registre RGPD mis a jour Evaluation article 33 RGPD effectuee Scan TruffleHog sur les depots de code Politique supply chain IA documentee (NIS2) Checklist WebGuard Agency — Adaptee aux exigences NIS2, RGPD et recommandations ANSSI

Votre chaine IA est-elle compromise ?

Nos experts evaluent votre exposition a la breche Hugging Face, verifient l'integrite de vos modeles et datasets, et mettent en place un pipeline de securisation IA conforme a NIS2 et au RGPD. Audit d'urgence disponible sous 24h.

Demander un audit IA d'urgence →
Avis d'expert
Nicolas Berger

« L'ere ou l'on pouvait telecharger aveuglefement un modele open source depuis Hugging Face et le deployer en production est revolue. Cette breche marque un point de bascule pour l'ensemble de l'ecosysteme IA. La directive NIS2 et les recommandations de l'ANSSI sur la securite des systemes d'IA convergent vers une meme exigence : chaque composant IA doit etre traite comme un code executable potentiel et soumis aux memes controles de securite que n'importe quel logiciel tiers. La supply chain IA n'est plus un angle mort tolerable — c'est un vecteur d'attaque principal. Les organisations qui integrent l'IA dans leurs processus metier sans avoir mis en place un cadre de gouvernance et de securite adapte s'exposent a des risques majeurs, tant operationnels que reglementaires. »

Nicolas Berger, Expert en cybersecurite offensive — WebGuard Agency

Sources et references

  • TechCrunch — « Hugging Face confirms major breach: internal datasets and service credentials compromised via malicious dataset » (20 juillet 2026)
  • Hugging Face — Bulletin de securite officiel : compromission de datasets internes et credentials de services (20 juillet 2026)
  • BleepingComputer — « Hugging Face breach: attackers used malicious dataset to execute code on servers » (20 juillet 2026)
  • ANSSI — Recommandations de securite pour les systemes d'intelligence artificielle (2024, mises a jour 2026)
  • Directive (UE) 2022/2555 (NIS2) — Article 21 : Mesures de gestion des risques en matiere de cybersecurite, securite de la chaine d'approvisionnement
  • RGPD — Articles 33 et 34 : Notification des violations de donnees personnelles
Article publie le — Derniere mise a jour le
FAQ

Questions frequentes

Le 20 juillet 2026, Hugging Face a confirme une breche de securite majeure sur sa plateforme. Un dataset malveillant uploade par un acteur malveillant a exploite une vulnerabilite dans le pipeline de traitement des donnees de la plateforme, permettant l'execution de code arbitraire sur les serveurs de Hugging Face. Les attaquants ont ensuite escalade leurs privileges pour obtenir un acces etendu aux systemes internes, compromettant des datasets internes et des credentials de services (cles API, tokens d'acces). Hugging Face a immediatement lance une procedure de reponse a incident et recommande a tous ses utilisateurs de proceder a une rotation de leurs tokens d'acces.
Si votre entreprise utilise des modeles ou des datasets provenant de Hugging Face, vous etes potentiellement concerne a plusieurs niveaux. Premierement, si vous utilisez des tokens d'acces Hugging Face (HF tokens) dans vos pipelines de production ou de developpement, ces credentials doivent etre immediatement revoques et remplaces. Deuxiemement, si vous avez uploade des datasets prives sur la plateforme, ces donnees ont pu etre accessibles aux attaquants. Troisiemement, meme si vous utilisez uniquement des modeles publics telecharges localement, il est prudent de verifier leur integrite en comparant les hash SHA-256 avec les versions officielles. Enfin, tout modele au format pickle (.bin, .pt) doit etre scanne avec des outils specialises comme picklescan pour detecter d'eventuels payloads malveillants.
Par mesure de precaution, Hugging Face recommande a tous ses utilisateurs de considerer leurs tokens comme potentiellement compromis et de proceder a une rotation immediate, sans attendre une confirmation specifique. Pour ce faire, connectez-vous a votre compte Hugging Face, allez dans Settings > Access Tokens, revoquez tous les tokens existants et generez-en de nouveaux avec des permissions minimales (read-only si possible). Verifiez egalement que vos tokens n'ont pas ete commites dans des depots de code en utilisant des outils comme TruffleHog ou GitLeaks. Surveillez les journaux d'acces de votre compte pour detecter toute activite suspecte (telechargements inhabituels, modifications de modeles, acces a des depots prives). Si vous constatez une activite anormale, contactez immediatement l'equipe de securite de Hugging Face et votre RSSI.
La reponse depend de votre evaluation de l'incident au regard de l'article 33 du RGPD. Si vous avez uploade des datasets contenant des donnees personnelles sur Hugging Face (donnees d'entrainement, textes extraits de bases clients, transcriptions, etc.) et que ces donnees ont pu etre accessibles aux attaquants, vous avez l'obligation de notifier la CNIL dans un delai de 72 heures a compter du moment ou vous avez eu connaissance de la violation. Meme si vous concluez que la notification n'est pas necessaire, vous devez documenter votre analyse et la conserver. La CNIL a recemment clarifie que les donnees personnelles ne perdent pas leur caractere personnel du fait de leur inclusion dans un dataset d'entrainement IA. En cas de doute, contactez votre DPO (Delegue a la Protection des Donnees) et privilegiez la notification par precaution — ne pas notifier une violation averee expose a des sanctions beaucoup plus lourdes que notifier par exces de prudence.

Vous ne trouvez pas la reponse a votre question ?

Certifications & accreditations
PASSI (ANSSI)
ISO 27001
CEH Certified
OSCP
CISSP
SOC 2 Type II
Newsletter

Veille cybersecurite

Recevez chaque semaine les dernieres menaces, vulnerabilites et bonnes pratiques directement dans votre boite mail.

Pas de spam. Desinscription en un clic. Environ 1 email par semaine.

Pret a renforcer votre cybersecurite ?

Rejoignez les entreprises qui font confiance a WebGuard Agency pour proteger leurs actifs numeriques. Premier audit offert.

Voir nos tarifs
200+
Audits realises
99,9%
Disponibilite SOC
< 4h
Temps de reponse

🛡️ Audit de sécurité gratuit — réponse en 24h, sans engagement

Obtenir mon audit gratuit →