Guide RGPD · Anonymisation

Anonymisation des données et pseudonymisation : faire la différence

L'anonymisation des données fait sortir un jeu de données du champ du RGPD ; la pseudonymisation le protège mais le laisse dans le champ. Confondre les deux est l'erreur la plus fréquente. Ce chapitre donne les définitions, les techniques, les trois critères européens pour vérifier une anonymisation et les évolutions récentes de la jurisprudence et du Comité européen de la protection des données (CEPD), avec les points de vigilance du responsable de la sécurité des systèmes d'information (RSSI) et du délégué à la protection des données (DPO).

Mis à jour le · 9 min de lecture

Références
RGPD art. 4, 25, 32 ; avis G29 05/2014
Critères
Individualisation, corrélation, inférence
En cours
Lignes directrices du CEPD (2025, 2026)
Chapitres du guide
  1. Le RGPD pour le RSSI et le DPO
  2. Le DPO
  3. Article 28 : le sous-traitant
  4. Le registre des traitements
  5. Privacy by design (art. 25)
  6. Anonymisation et pseudonymisation
  7. Glossaire RGPD

En bref

  1. Des données anonymisées ne permettent plus, en pratique et de façon irréversible, d'identifier une personne : le RGPD ne s'y applique plus.

  2. Des données pseudonymisées ont seulement perdu leurs identifiants directs ; on peut les rattacher à une personne avec une information complémentaire conservée à part : elles restent des données personnelles.

  3. Une anonymisation se vérifie avec trois critères : impossible d'isoler une personne (individualisation), de relier des données la concernant (corrélation), de déduire une information sur elle (inférence).

  4. Aucune technique ne suffit seule : l'avis 05/2014 du G29 recommande de combiner randomisation et généralisation, au cas par cas.

  5. Depuis l'arrêt CEPD contre CRU (2025), des données pseudonymisées peuvent ne pas être personnelles pour un destinataire qui n'a aucun moyen raisonnable de réidentifier ; elles le restent pour celui qui détient la clé.

Anonymisation et pseudonymisation : les définitions

Le RGPD définit la pseudonymisation à son article 4, point 5 : un traitement qui empêche d'attribuer les données à une personne précise sans recourir à des informations supplémentaires, à condition que ces informations soient conservées séparément et protégées par des mesures techniques et organisationnelles. Remplacer le nom d'un patient par un numéro, et garder la table de correspondance dans un coffre, c'est pseudonymiser.

L'anonymisation n'est pas définie dans les articles, mais le considérant 26 précise que le règlement ne s'applique pas aux informations anonymes, c'est-à-dire qui ne concernent pas une personne identifiée ou identifiable, compte tenu de l'ensemble des moyens raisonnablement susceptibles d'être utilisés pour l'identifier. La Commission nationale de l'informatique et des libertés (CNIL) la décrit comme un traitement qui rend impossible, en pratique, toute identification de la personne, de manière irréversible.

Un tableau de cinq patients fictifs avec nom, date de naissance, commune et service. Première branche, pseudonymisation : les noms deviennent des codes (P-7F3A, P-21C9…), les autres colonnes restent ; une clé de correspondance conservée à part permet, par une flèche de retour, de retrouver les noms : toujours des données personnelles. Seconde branche, anonymisation par tranches d'âge et comptage : un tableau par service et tranche d'âge (cardiologie, 70 ans et plus : 2 ; cardiologie, 30 à 39 ans : effectif de 1, masqué ; maternité, 30 à 39 ans : 2), sans nom ni commune. Un tableau des trois critères, individualisation, corrélation et inférence, indique « risque » pour les données pseudonymisées et « tenu » pour les données anonymisées. Conclusion : hors du champ du RGPD si les trois critères sont tenus.
À partir du même tableau de patients fictifs : la pseudonymisation remplace les noms par des codes, mais une clé permet de revenir en arrière ; l'anonymisation généralise et agrège jusqu'à ce que plus personne ne puisse être isolé.
Anonymisation et pseudonymisation comparées
PseudonymisationAnonymisation
PrincipeRemplacer les identifiants directs par un pseudonymeRendre toute identification impossible en pratique
Réversible ?Oui, avec l'information complémentaire (clé, table de correspondance)Non, par définition
Statut au regard du RGPDDonnées personnelles : le RGPD s'appliqueDonnées anonymes : le RGPD ne s'applique plus
Usage typiqueMesure de sécurité et de minimisation, études internes, testsStatistiques publiées, données ouvertes, conservation au-delà de la durée prévue
Où le RGPD la citeArticles 25 (dès la conception), 32 (sécurité), 6 (compatibilité d'un traitement ultérieur), 89 (recherche et statistiques)Considérant 26

Pseudonymiser : techniques et bonnes pratiques

La pseudonymisation est avant tout une mesure de sécurité et de minimisation : elle réduit les conséquences d'une fuite et limite ce que voient les personnes qui n'ont pas besoin de l'identité. L'avis 05/2014 du groupe de travail « Article 29 » (G29), qui réunissait les autorités européennes avant le CEPD, en décrit les principales techniques :

TechniquePrincipePoint de vigilance pour le RSSI
Chiffrement à clé secrèteL'identifiant est chiffré ; le détenteur de la clé peut le déchiffrer.La sécurité repose entièrement sur la protection et la rotation de la clé.
Fonction de hachage simpleL'identifiant est transformé en empreinte de taille fixe.Faible : si l'ensemble des valeurs possibles est connu (numéros, dates), on retrouve l'identifiant en hachant toutes les valeurs.
Hachage avec clé secrèteLe hachage utilise une clé, conservée séparément.Robuste tant que la clé est protégée ; supprimer la clé rend le lien très difficile à reconstituer.
TokenisationL'identifiant est remplacé par un jeton aléatoire, la correspondance est stockée dans une base séparée.Protéger et journaliser l'accès à la base de correspondance.

Le Comité européen de la protection des données (CEPD) a adopté en janvier 2025 des lignes directrices 01/2025 sur la pseudonymisation, soumises à consultation publique. Il y insiste sur la notion de domaine de pseudonymisation : l'ensemble des personnes et des organisations pour lesquelles les données ne doivent pas être rattachables à une personne. Plus ce domaine est bien défini et cloisonné, plus la pseudonymisation est efficace.

L'arrêt CEPD contre CRU (septembre 2025)

Dans un arrêt du 4 septembre 2025 (affaire C-413/23 P), la Cour de justice de l'Union européenne a jugé que des données pseudonymisées restent des données personnelles pour le responsable qui détient la clé, mais peuvent ne pas l'être pour un destinataire qui ne dispose d'aucun moyen raisonnable de réidentifier les personnes. L'affaire concernait le Conseil de résolution unique, qui avait transmis à un cabinet d'audit des commentaires d'actionnaires pseudonymisés, et portait sur le règlement applicable aux institutions européennes, rédigé dans les mêmes termes que le RGPD. La Cour a aussi précisé que l'obligation d'informer les personnes pèse sur le responsable initial, au moment de la collecte.

Cette approche « relative » ne change rien pour celui qui pseudonymise : ses données restent soumises au RGPD. Elle invite en revanche à documenter, pour chaque destinataire, les moyens dont il dispose réellement pour réidentifier. Le contrat avec le sous-traitant et les engagements de ne pas réidentifier en font partie.

Anonymiser : randomisation et généralisation

Le G29 range les techniques d'anonymisation en deux familles, que la CNIL reprend :

  • la randomisation, qui modifie les valeurs pour couper le lien entre les données et la personne tout en préservant la répartition d'ensemble : ajout de bruit, permutation des valeurs entre individus, confidentialité différentielle ;
  • la généralisation, qui réduit la précision des valeurs pour qu'une personne se fonde dans un groupe : agrégation, k-anonymat (chaque combinaison de caractéristiques est partagée par au moins k personnes), l-diversité et t-proximité (qui évitent qu'un groupe ait une valeur sensible trop homogène).

L'avis compare ces techniques au regard des trois risques. Sa conclusion est nette : aucune technique ne règle seule les trois, et la pseudonymisation n'en règle aucun. Il faut donc combiner les techniques et choisir au cas par cas, selon l'usage prévu des données.

Risque résiduel par technique, d'après le tableau de synthèse de l'avis 05/2014 du G29
TechniqueIsoler une personne ?Relier ses données ?Déduire une information ?
PseudonymisationOuiOuiOui
Ajout de bruitOuiPeut-être pasPeut-être pas
Substitution (permutation)OuiOuiPeut-être pas
Agrégation, k-anonymatNonOuiOui
l-diversitéNonOuiPeut-être pas
Confidentialité différentiellePeut-être pasPeut-être pasPeut-être pas
Hachage, tokenisationOuiOuiPeut-être pas

Vérifier une anonymisation : les trois critères

Pour savoir si un jeu de données est vraiment anonyme, les autorités européennes appliquent trois critères. La CNIL les illustre ainsi :

CritèreQuestionExemple d'échec
IndividualisationPeut-on isoler une personne dans le jeu de données ?Une ligne unique combinant âge, commune et service désigne de fait un patient.
CorrélationPeut-on relier des données qui concernent la même personne, dans ce jeu ou entre plusieurs jeux ?Le même pseudonyme apparaît dans deux extractions successives, qu'on peut recouper.
InférencePeut-on déduire, presque à coup sûr, une information nouvelle sur une personne ?Si tous les hommes de 20 à 25 ans d'une enquête sont non imposables, on le sait aussi pour le répondant de 24 ans que l'on connaît.

Si les trois critères sont satisfaits, les données peuvent être considérées comme anonymes. Sinon, il faut une analyse approfondie du risque de réidentification, en tenant compte des données disponibles par ailleurs, des moyens d'un attaquant raisonnable et de l'évolution des techniques. Une anonymisation se réexamine dans le temps : de nouvelles données publiées ailleurs peuvent rendre réidentifiable un jeu qui ne l'était pas.

Ce qui évolue en 2026

Le CEPD a adopté le 7 juillet 2026 un projet de lignes directrices sur l'anonymisation, ouvert à consultation publique jusqu'au 30 octobre 2026. D'après la présentation qu'en fait la CNIL, il tient compte de l'arrêt CEPD contre CRU, conserve les trois critères comme test de référence et propose deux façons d'évaluer le résultat : une approche contextuelle, qui tient compte des capacités réelles de chaque entité susceptible de réidentifier, et une approche simplifiée, plus prudente, qui ignore ces différences. Tant que la version définitive n'est pas adoptée, l'avis 05/2014 reste la référence la plus citée.

Exemple : les statistiques du portail patient

  1. Analyse détaillée par un cabinet de conseil. Le cabinet doit étudier les parcours de prise de rendez-vous. L'hôpital lui transmet une extraction pseudonymisée : identifiants remplacés par un hachage avec clé secrète conservée par la direction des systèmes d'information, dates de naissance réduites à l'année. Pour l'hôpital, ce sont toujours des données personnelles : le cabinet est sous-traitant, avec un contrat article 28 qui lui interdit toute tentative de réidentification et impose la suppression en fin de mission.
  2. Tableau de bord publié dans le rapport annuel. Les chiffres sont anonymisés : nombre de rendez-vous pris en ligne par service et par trimestre, tranches d'âge de dix ans, aucun effectif inférieur à un seuil fixé par l'établissement. Le DPO vérifie les trois critères : aucune personne isolable, aucune donnée individuelle à relier, aucune déduction possible sur un patient. Le tableau peut être publié.

Questions fréquentes

Quelle est la différence entre anonymisation et pseudonymisation ?

L'anonymisation rend toute identification impossible en pratique et de façon irréversible : les données sortent du champ du RGPD. La pseudonymisation remplace les identifiants directs par un pseudonyme, mais une information complémentaire (clé, table de correspondance) permet de revenir en arrière : les données restent personnelles et le RGPD s'applique.

Les données pseudonymisées sont-elles des données personnelles ?

Oui pour l'organisme qui détient l'information permettant de réidentifier. Depuis l'arrêt de la Cour de justice du 4 septembre 2025 (CEPD contre CRU), elles peuvent ne pas l'être pour un destinataire qui n'a aucun moyen raisonnable de réidentifier les personnes, ce qui s'apprécie au cas par cas.

Comment savoir si des données sont vraiment anonymes ?

En appliquant les trois critères européens : il ne doit pas être possible d'isoler une personne, de relier des données la concernant, ni de déduire une information sur elle. Si l'un des critères n'est pas rempli, une analyse du risque de réidentification est nécessaire.

Le hachage d'un identifiant suffit-il à anonymiser ?

Non. Le hachage est une technique de pseudonymisation. Un hachage simple est même fragile : si l'on connaît l'ensemble des valeurs possibles (numéros de téléphone, dates), on peut toutes les hacher et retrouver l'identifiant. Et les autres colonnes du jeu de données permettent souvent d'isoler la personne.

Peut-on conserver des données anonymisées sans limite de durée ?

Des données réellement anonymes ne sont plus soumises au RGPD, donc pas à ses durées de conservation. L'anonymisation est d'ailleurs une façon de garder des statistiques au-delà de la durée prévue pour les données personnelles. Encore faut-il qu'elle résiste dans le temps aux nouvelles possibilités de recoupement.

Sources

Ce chapitre résume et reformule les publications officielles ci-dessous. En cas de doute, le texte officiel fait foi.

Une plateforme et un service qui s'adaptent à vous

Notre plateforme est conçue pour un paramétrage très fin et une large capacité d'adaptation à vos besoins.